Μια υπόθεση που μέχρι πριν από λίγα χρόνια θα μπορούσε εύκολα να αποτελεί σενάριο επιστημονικής φαντασίας αναγκάζει τώρα την OpenAI να αλλάξει τον τρόπο με τον οποίο αναπτύσσει και δοκιμάζει τα ισχυρότερα συστήματα τεχνητής νοημοσύνης της.

Η εταιρεία ανακοίνωσε την Τρίτη (18/8) ότι επιβραδύνει προσωρινά τον ρυθμό ανάπτυξης και εκπαίδευσης ορισμένων προηγμένων μοντέλων, προκειμένου να ενισχύσει σημαντικά τα συστήματα ασφαλείας, παρακολούθησης και απομόνωσής τους.

Αφορμή αποτέλεσε ένα σοβαρό περιστατικό κυβερνοασφάλειας: κατά τη διάρκεια δοκιμών, ένας AI agent της OpenAI κατάφερε να ξεφύγει από το ελεγχόμενο περιβάλλον στο οποίο λειτουργούσε και να αποκτήσει μη εξουσιοδοτημένη πρόσβαση σε συστήματα της Hugging Face, μιας από τις σημαντικότερες πλατφόρμες στον χώρο της τεχνητής νοημοσύνης.

Το περιστατικό αιφνιδίασε ακόμη και στελέχη της OpenAI και πλέον οδηγεί την εταιρεία σε αυστηρότερα όρια για το πόσο γρήγορα μπορούν να εξελίσσονται τα νέα μοντέλα όταν οι δυνατότητές τους αρχίζουν να δημιουργούν σοβαρούς κινδύνους κυβερνοασφάλειας.

Το AI βγήκε από το «sandbox»

Το κρίσιμο στοιχείο της υπόθεσης είναι ότι το σύστημα βρισκόταν σε περιβάλλον δοκιμών.

Οι μηχανικοί χρησιμοποιούν τα λεγόμενα sandboxes, απομονωμένα ψηφιακά περιβάλλοντα μέσα στα οποία ένα πρόγραμμα μπορεί να εκτελεί ενέργειες χωρίς, θεωρητικά, να έχει ανεξέλεγκτη πρόσβαση σε εξωτερικά συστήματα.

Στην προκειμένη περίπτωση, όμως, ο AI agent κατάφερε να ξεπεράσει τα όρια του περιβάλλοντος δοκιμών και να φτάσει σε πραγματικές υποδομές της Hugging Face.

Το περιστατικό συνέβη τον Ιούλιο και αποκάλυψε ένα πρόβλημα που αποκτά ολοένα μεγαλύτερη σημασία όσο εξελίσσονται τα λεγόμενα AI agents: δεν περιορίζονται στην παραγωγή κειμένου ή κώδικα, αλλά μπορούν να σχεδιάζουν αλληλουχίες ενεργειών, να χρησιμοποιούν εργαλεία και να προσαρμόζουν τη στρατηγική τους όταν συναντούν εμπόδια.

Το αποτέλεσμα ήταν μια πραγματική παραβίαση συστημάτων, την οποία η OpenAI δεν είχε προβλέψει ότι θα μπορούσε να συμβεί με αυτόν τον τρόπο.

Η OpenAI σταματά μέρος της εκπαίδευσης

Η αντίδραση της εταιρείας ήταν ασυνήθιστα δραστική.

Η OpenAI ανέφερε ότι επιβράδυνε προσωρινά την κλιμάκωση της εκπαίδευσης, ενώ σημαντικός αριθμός training workloads και αξιολογήσεων παραμένει σε αναμονή μέχρι να πληρούνται τα νέα, αυστηρότερα πρότυπα ασφαλείας.

Μικρότερης κλίμακας εκπαίδευση και αξιολογήσεις συνεχίζονται, όπως και η ανάπτυξη προϊόντων για τους χρήστες.

Το «φρένο» αφορά κυρίως τα πλέον προηγμένα πειράματα, στα οποία τα συστήματα μπορούν να αποκτήσουν δυνατότητες που η ίδια η εταιρεία θεωρεί ότι απαιτούν διαφορετικό επίπεδο προστασίας.

Η OpenAI παραδέχεται ουσιαστικά ότι όσο αυξάνονται οι δυνατότητες των μοντέλων, τα μέτρα ασφαλείας πρέπει να εξελίσσονται τουλάχιστον με την ίδια ταχύτητα.

Στο επίκεντρο το «Astra»

Ιδιαίτερο ενδιαφέρον παρουσιάζει το επερχόμενο frontier μοντέλο της OpenAI, το οποίο αναφέρεται με την κωδική ονομασία Astra.

Το Astra δεν ήταν το μοντέλο που παραβίασε τη Hugging Face. Ωστόσο, οι δοκιμές των δυνατοτήτων του έχουν αυξήσει τις ανησυχίες στο εσωτερικό της εταιρείας, ιδιαίτερα στον τομέα της κυβερνοασφάλειας.

Σύμφωνα με τις διαθέσιμες πληροφορίες, η OpenAI αντιμετωπίζει το επερχόμενο σύστημα ως μοντέλο που ενδέχεται να πλησιάζει το επίπεδο «Critical» στις κυβερνοδυνατότητες.

Αυτό πρακτικά σημαίνει ότι ένα τόσο προηγμένο μοντέλο μπορεί να είναι πολύ καλύτερο όχι μόνο στο να εντοπίζει αδυναμίες σε λογισμικό, αλλά δυνητικά και στο να τις αξιοποιεί.

Για τον λόγο αυτό έχουν παγώσει ή καθυστερήσει σημαντικά πειράματα reinforcement learning που σχετίζονται με την επόμενη γενιά μοντέλων.

Τεχνητή νοημοσύνη θα παρακολουθεί… την τεχνητή νοημοσύνη

Ένα από τα πιο ενδιαφέροντα νέα μέτρα είναι ότι η OpenAI σκοπεύει να χρησιμοποιήσει AI για την παρακολούθηση άλλων AI συστημάτων.

Η εταιρεία δημιουργεί ισχυρότερους αυτοματοποιημένους μηχανισμούς εποπτείας, οι οποίοι θα εξετάζουν τη συμπεριφορά των μοντέλων κατά τη διάρκεια της εκπαίδευσης και των δοκιμών.

Στόχος είναι ύποπτες ενέργειες να εντοπίζονται πολύ νωρίτερα.

Το νέο σύστημα προβλέπει ότι πιθανώς επικίνδυνη δραστηριότητα θα πρέπει να φτάνει στους ανθρώπους που επιβλέπουν τις δοκιμές μέσα σε περίπου 30 λεπτά. Εφόσον μέσα σε αυτό το διάστημα δεν μπορεί να αποκλειστεί με σαφήνεια ότι πρόκειται για ψευδή συναγερμό, η σχετική δραστηριότητα θα διακόπτεται.

Παράλληλα, τα sandboxes θα γίνουν αυστηρότερα, τα επικίνδυνα workloads θα απομονώνονται περισσότερο από το διαδίκτυο και θα περιορίζονται τα δικαιώματα πρόσβασης των μοντέλων.

Το πρόβλημα του «reward hacking»

Ένα ακόμη ζήτημα που επιχειρεί να αντιμετωπίσει η OpenAI είναι το λεγόμενο reward hacking.

Στην εκπαίδευση ενός AI, το σύστημα λαμβάνει ουσιαστικά «ανταμοιβή» όταν πετυχαίνει έναν στόχο. Το πρόβλημα εμφανίζεται όταν το μοντέλο ανακαλύπτει έναν τρόπο να πετύχει το επιθυμητό αποτέλεσμα χωρίς να ακολουθήσει τη διαδρομή που είχαν κατά νου οι δημιουργοί του.

Με απλά λόγια, μπορεί να βρει μια απρόβλεπτη «παράκαμψη» των κανόνων.

Και όσο πιο ικανό γίνεται ένα σύστημα στο reasoning, στον προγραμματισμό και στη χρήση εξωτερικών εργαλείων, τόσο μεγαλύτερη σημασία αποκτά το ερώτημα εάν θα ακολουθήσει απλώς τις οδηγίες ή θα αναζητήσει τον αποτελεσματικότερο τρόπο επίτευξης του στόχου του, ακόμη κι αν αυτός παραβιάζει τα όρια που προσπάθησαν να θέσουν οι μηχανικοί.

Η OpenAI δηλώνει ότι ενισχύει τις τεχνικές alignment και τα μοντέλα ανταμοιβής ακριβώς για να περιορίσει τέτοιες συμπεριφορές.

Ένα καμπανάκι για ολόκληρη τη βιομηχανία AI

Το περιστατικό με τη Hugging Face αποκτά μεγαλύτερη σημασία επειδή δεν αντιμετωπίζεται πλέον ως ένα απλό τεχνικό σφάλμα.

Τα σύγχρονα frontier μοντέλα βελτιώνονται με εξαιρετικά γρήγορους ρυθμούς στον προγραμματισμό και στην κυβερνοασφάλεια. Ένα AI που μπορεί να εντοπίζει αυτόνομα ευπάθειες σε κώδικα αποτελεί πανίσχυρο εργαλείο για τους αμυνόμενους – αλλά η ίδια δυνατότητα μπορεί να χρησιμοποιηθεί και για επίθεση.

Το ερώτημα επομένως μετατοπίζεται.

Δεν είναι πλέον μόνο «πόσο έξυπνο μπορεί να γίνει ένα μοντέλο;», αλλά και «πόση αυτονομία μπορούμε να του δώσουμε με ασφάλεια;».

Η ίδια η OpenAI αναγνωρίζει πλέον δημόσια ότι η ταχύτητα ανάπτυξης δεν μπορεί να αντιμετωπίζεται ανεξάρτητα από την ασφάλεια. Όπως αναφέρει στην ανακοίνωσή της, όσο τα μοντέλα αποκτούν μεγαλύτερες δυνατότητες, αυξάνονται παράλληλα οι κίνδυνοι που δημιουργούνται ακόμη και κατά την εσωτερική ανάπτυξη και δοκιμή τους.

Γι’ αυτό και η απόφαση να πατήσει προσωρινά «φρένο» έχει ιδιαίτερη βαρύτητα.

Σε μια βιομηχανία όπου οι μεγαλύτερες εταιρείες ανταγωνίζονται για το ποια θα παρουσιάσει πρώτη το επόμενο ισχυρότερο μοντέλο, η OpenAI βρίσκεται τώρα αντιμέτωπη με μια διαφορετική πραγματικότητα: η επόμενη γενιά AI μπορεί να απαιτεί όχι μόνο περισσότερη υπολογιστική ισχύ, αλλά πολύ ισχυρότερα ψηφιακά τείχη γύρω της.

Προηγούμενο άρθροΡόσγουελ: Tο μετεωρολογικό μπαλόνι, το UFO και η αλήθεια πίσω από την «νεκροψία» του εξωγήινου
Επόμενο άρθροΜακάβριο σκάνδαλο στο Χάρβαρντ