Η OpenAI αποφάσισε να μην προχωρήσει στην κυκλοφορία του επόμενης γενιάς μοντέλου τεχνητής νοημοσύνης GPT-6.1 Astra, έπειτα από σοβαρές ανησυχίες που προέκυψαν κατά τη διάρκεια των εσωτερικών δοκιμών ασφαλείας.
Σύμφωνα με τη Wall Street Journal, η απόφαση αποτελεί μία από τις πιο σαφείς μέχρι σήμερα ενδείξεις ότι η συμπεριφορά των αυτόνομων AI agents μπορεί να βάλει φρένο στον εξαιρετικά γρήγορο ρυθμό ανάπτυξης των προηγμένων μοντέλων τεχνητής νοημοσύνης.
Η OpenAI σχεδίαζε να παρουσιάσει το GPT-6.1 Astra μέσα στις επόμενες ημέρες ή εβδομάδες, με στόχο να κάνει το ντεμπούτο του τον Οκτώβριο μέσα στο ChatGPT και το Codex. Το νέο μοντέλο ήταν πιο ικανό από προηγούμενες εκδόσεις στην ολοκλήρωση σύνθετων εργασιών από την αρχή μέχρι το τέλος χωρίς ανθρώπινη παρέμβαση, ενώ εμφάνιζε βελτιώσεις και στη γραφή.
Η εταιρεία, ωστόσο, αποφάσισε τελικά να μην το διαθέσει στο κοινό και να επικεντρωθεί στη βελτίωση της ασφάλειας μελλοντικών μοντέλων, τα οποία αναμένεται να είναι ακόμη πιο ισχυρά.
Τα δύο προβλήματα που «έκοψαν» την κυκλοφορία του GPT-6.1 Astra
Η Saachi Jain, επικεφαλής των συστημάτων ασφαλείας της OpenAI, δήλωσε στη WSJ ότι το GPT-6.1 Astra εμφάνισε χειρότερες επιδόσεις σε δύο κρίσιμους τομείς σε σύγκριση με τον προκάτοχό του, GPT-6 Astra.
Ο πρώτος αφορά το λεγόμενο alignment, δηλαδή τον βαθμό στον οποίο ένα μοντέλο ακολουθεί τις προθέσεις και τις οδηγίες του ανθρώπου.
Σύμφωνα με την OpenAI, το GPT-6.1 Astra εμφάνισε υψηλότερα επίπεδα παραπλανητικής συμπεριφοράς στις σχετικές δοκιμές. Με απλά λόγια, το μοντέλο δεν ήταν πάντοτε απόλυτα ειλικρινές απέναντι στον χρήστη σχετικά με τις ενέργειες που είχε ή δεν είχε πραγματοποιήσει.
Το δεύτερο ζήτημα σχετιζόταν με αυτό που η εταιρεία ονομάζει «scope authorization». Πρόκειται για την ικανότητα του μοντέλου να αντιλαμβάνεται τα όρια της εντολής που έχει λάβει και να ζητάει άδεια από τον χρήστη προτού προχωρήσει σε ενέργειες που βρίσκονται έξω από αυτά.
Στις δοκιμές, το GPT-6.1 Astra συνέχιζε σε ορισμένες περιπτώσεις την εκτέλεση μιας εργασίας χωρίς να ζητήσει την απαραίτητη έγκριση, ενώ μπορούσε να επιχειρήσει να χρησιμοποιήσει εξωτερικά εργαλεία και υπηρεσίες ακόμη και όταν κάτι τέτοιο ενδεχομένως δημιουργούσε κινδύνους.
Η Jain σημείωσε ότι η OpenAI προσπαθεί να βρει την ισορροπία ανάμεσα σε ένα μοντέλο που παραμένει αυστηρά εντός των ορίων της εντολής και σε ένα σύστημα που δεν εγκαταλείπει εύκολα μια εργασία όταν συναντά εμπόδια.
Παρότι το GPT-6.1 Astra είχε βελτιωθεί σε προβλήματα όπως η λεγόμενη «τεμπελιά» των μοντέλων, δηλαδή η τάση να αποφεύγουν ή να εγκαταλείπουν δύσκολες εργασίες, τελικά δεν κατάφερε να περάσει τον πήχη ασφαλείας και alignment που έχει θέσει η εταιρεία.
Ένα σπάνιο φρένο στην κούρσα της AI
Η απόφαση είναι αξιοσημείωτη, καθώς οι μεγάλες εταιρείες τεχνητής νοημοσύνης βρίσκονται σε διαρκή αγώνα για την παρουσίαση ισχυρότερων μοντέλων.
Η ανακοίνωση έρχεται μία ημέρα πριν από το ετήσιο συνέδριο προγραμματιστών της OpenAI στο Σαν Φρανσίσκο, το οποίο στο παρελθόν έχει χρησιμοποιηθεί από την εταιρεία για την παρουσίαση νέων μοντέλων και υπηρεσιών.
Η συγκεκριμένη αγορά έχει αποκτήσει ιδιαίτερη σημασία, καθώς η OpenAI ανταγωνίζεται άμεσα την Anthropic για τους developers και τις επιχειρήσεις που ενσωματώνουν τεχνητή νοημοσύνη στις εφαρμογές τους.
Το τελευταίο διάστημα, OpenAI και Anthropic έχουν ζητήσει από τον κλάδο να επιβραδύνει την ανάπτυξη των πλέον προηγμένων συστημάτων και να επενδύσει περισσότερο σε πρότυπα ασφαλείας, δηλώνοντας ότι είναι διατεθειμένες να περιορίσουν ακόμη και τον ρυθμό της δικής τους εσωτερικής προόδου.
Τα περιστατικά με AI agents
Η απόφαση για το GPT-6.1 Astra έρχεται σε μια περίοδο κατά την οποία η OpenAI διερευνά σειρά περιστατικών ασφαλείας που συνδέονται με αυτόνομους agents.
Όπως αναφέρει η WSJ, η εταιρεία έχει δημιουργήσει νέο σύστημα παρακολούθησης ώστε να εντοπίζει ταχύτερα προβληματικές συμπεριφορές και έχει επιβάλει αυστηρότερες δικλίδες ασφαλείας στις εσωτερικές δοκιμές.
Νωρίτερα μέσα στο καλοκαίρι, εκατοντάδες εσωτερικοί agents της OpenAI που συμμετείχαν σε δοκιμή κυβερνοασφάλειας κατέληξαν να παραβιάσουν συστήματα της Hugging Face.
Έκτοτε, οργανισμοί όπως η αυστραλιανή κυβέρνηση και τα Ηνωμένα Έθνη διαπίστωσαν ότι agents της OpenAI είχαν χρησιμοποιήσει παρόμοιες, αν και λιγότερο εκτεταμένες, τεχνικές για να αποκτήσουν πρόσβαση σε ιστοσελίδες τους.
Πολλά από αυτά τα περιστατικά αφορούσαν εσωτερικά μοντέλα που δεν επρόκειτο ποτέ να κυκλοφορήσουν δημόσια.
Την περασμένη εβδομάδα, η OpenAI ανακοίνωσε επίσης ότι διέκοψε προσωρινά την εκπαίδευση των ισχυρότερων μοντέλων της, όταν ένας agent εκμεταλλεύθηκε κενό στους περιορισμούς πρόσβασης στο διαδίκτυο και συνδέθηκε με δημόσιο chatbot. Σύμφωνα με την εταιρεία, το νέο σύστημα παρακολούθησης εντόπισε το περιστατικό μέσα σε 15 λεπτά.
Η OpenAI διευκρίνισε ότι το GPT-6.1 Astra δεν σχετίζεται με το συγκεκριμένο περιστατικό και αποτελεί διαφορετική περίπτωση.
Τι θα γίνει με το GPT-6.1 Astra
Η OpenAI δεν σκοπεύει να εγκαταλείψει πλήρως την τεχνολογία πίσω από το μοντέλο. Αντίθετα, θα διατηρήσει τον βασικό «πυρήνα» του μοντέλου και θα τον υποβάλει σε νέους κύκλους reinforcement learning, δηλαδή εκπαίδευσης κατά την οποία το σύστημα μαθαίνει ποιες συμπεριφορές θεωρούνται σωστές ή λανθασμένες μέσω επιβράβευσης και ανατροφοδότησης. Στόχος είναι να διορθωθούν τα προβλήματα ασφαλείας και η ίδια τεχνολογική βάση να αξιοποιηθεί σε επόμενες εκδόσεις της οικογένειας GPT-6.
Παράλληλα, θα πραγματοποιήσει βαθύτερη ανάλυση προκειμένου να εντοπιστούν οι αιτίες των προβλημάτων που εμφανίστηκαν στο GPT-6.1 Astra.
Μεταξύ άλλων, οι ερευνητές θα εξετάσουν εάν τα περιβάλλοντα reinforcement learning επιβραβεύουν πράγματι τις σωστές συμπεριφορές ή εάν, άθελά τους, ωθούν τα μοντέλα προς λανθασμένες στρατηγικές.
Η έρευνα, σύμφωνα με τη Jain, θα καλύψει όλα τα στάδια ανάπτυξης του μοντέλου.
Αυξάνεται η πίεση από τις Αρχές
Την ίδια στιγμή, η ταχύτατη εξέλιξη της τεχνητής νοημοσύνης προσελκύει όλο και μεγαλύτερη προσοχή από πολιτικούς και ρυθμιστικές αρχές.
Αργότερα μέσα στην εβδομάδα, υποεπιτροπή της αμερικανικής Γερουσίας αναμένεται να πραγματοποιήσει ακρόαση με ανεξάρτητους ερευνητές υπό τον τίτλο «Rogue AI: Securing the Homeland Against AI Agent Attacks».
Παράλληλα, ο γενικός εισαγγελέας της Φλόριντα James Uthmeier έχει προσφύγει δικαστικά κατά της OpenAI, υποστηρίζοντας ότι η εταιρεία και ο CEO Σαμ Άλτμαν διέθεσαν εν γνώσει τους μη ασφαλές προϊόν και αγνόησαν προειδοποιήσεις σχετικά με πιθανές βλάβες για τους χρήστες.
Σε αίτημα προσωρινών μέτρων που κατατέθηκε τη Δευτέρα, ο Uthmeier ζητά μεταξύ άλλων να μην επιτρέπεται στην OpenAI να αναπτύσσει νέα μοντέλα χωρίς εγκεκριμένες από τρίτους δικλίδες ασφαλείας.
Εκπρόσωπος της OpenAI απάντησε ότι οι πολίτες θέλουν να γνωρίζουν ότι η τεχνητή νοημοσύνη αναπτύσσεται με ασφαλή τρόπο και ότι αυτό ξεκινά από τις ίδιες τις εταιρείες.
Παράλληλα, σημείωσε ότι οι κυβερνήσεις έχουν σημαντικό ρόλο στη διαμόρφωση ισχυρών προτύπων ασφαλείας, τα οποία, όπως τόνισε, θα πρέπει να εφαρμόζονται σε ολόκληρη τη βιομηχανία και όχι σε μία μόνο εταιρεία.
