Καμπανάκια στη G20 από την ελίτ της ΑΙ: Κίνδυνος να χαθεί ο έλεγχος

Oι ίδιες οι εταιρείες παραδέχονται ότι δυσκολεύονται να κατανοήσουν τη συμπεριφορά μοντέλων ΑΙ που αποκτούν υπερανθρώπινες δυνατότητες

Τεχνητή νοημοσύνη © magnific

Η επόμενη γενιά της τεχνητής νοημοσύνης φέρνει μια σοκαριστική πραγματικότητα, σύμφωνα με τις δραματικές προειδοποιήσεις που διατύπωσαν οι ηγέτες της OpenAI και της Anthropic στην σύνοδο της G20 στη Βόρεια Καρολίνα.

Στο επίκεντρο των συζητήσεων βρέθηκαν οι πρωτόγνωροι κίνδυνοι για την παγκόσμια ασφάλεια, με τον Σαμ Άλτμαν (OpenAI) να κρούει τον κώδωνα του κινδύνου για τις αυτόνομες κυβερνοαπειλές και τον Τομ Μπράουν (Anthropic) να προειδοποιεί για μια επικείμενη ενεργειακή κρίση.

Στο πλαίσιο της G20, ο Σαμ Άλτμαν δήλωσε στο Axios ότι η επόμενη γενιά μοντέλων AI θα είναι «σοκαριστική για όλους. Ανέφερε μάλιστα ότι το νέο μοντέλο της OpenAI (Astra) έπιασε το «κρίσιμο όριο» επικινδυνότητας. Aποκάλυψε ότι τα επόμενα μοντέλα AI θα ξεπεράσουν με καταιγιστικό ρυθμό τις υπάρχουσες δικλείδες ασφαλείας, έχοντας ήδη επιδείξει την ικανότητα να εντοπίζουν και να εκμεταλλεύονται ψηφιακές ευπάθειες αυτόνομα. Πριν μερικές εβδομάδες ειχαν αποκαληφθεί αυτές οι κινήσεις αυτονομίας κρούοντας καμπανάκια κινδύνου για να μη χαθεί ο έλεγχος στην AI που παίρνει το τιμόνι στα χέρια της.

Παράλληλα, η Anthropic (δημιουργός του Claude) είχε ήδη βρεθεί στο μικροσκόπιο των χωρών της G20 (μέσω του Financial Stability Board), προειδοποιώντας για το πώς το πανίσχυρο μοντέλο της “Mythos” θα μπορούσε να εκθέσει σε κίνδυνο παγκόσμια χρηματοοικονομικά συστήματα και τράπεζες.

Παρά τους κινδύνους, ο Άλτμαν έστειλε ένα ξεκάθαρο μήνυμα στους υπουργούς της G20: η χρήση της AI είναι «μη διαπραγματεύσιμη» (non-negotiable) για την οικονομική ανάπτυξη. Παρομοίασε την άρνηση μιας χώρας να επενδύσει στην AI με το να αρνιόταν μια χώρα τον ηλεκτρισμό πριν από 100 χρόνια.

Το παράδοξο είναι βέβαια, ότι από τη μία πλευρά έκρουσαν τον κώδωνα του κινδύνου για σοβαρές κυβερνοαπειλές, και από την άλλη προειδοποίησαν τις κυβερνήσεις ότι η υπερβολική ρύθμιση θα βλάψει την οικονομία

Μαζί με τον Έλον Μασκ τον Τζεν-Σουν Χουάνγκ της Nvidia, ο Άλτμαν και ο Τομ Μπράουν της Anthropic πίεσαν τους ηγέτες να αποφύγουν τις αυστηρές ρυθμίσεις τύπου Ευρωπαϊκής Ένωσης. Υποστήριξαν ότι οι υπερβολικοί κανόνες θα καθυστερήσουν την καινοτομία και θα στερήσουν από τις κοινωνίες τεράστια οικονομικά οφέλη.

Έλον Μασκ (Neuralink) και Σαμ Άλτμαν (Merge Labs) © EPA / Freepik/ PowerGame.gr

Έλον Μασκ και Σαμ Άλτμαν © EPA / Freepik/ PowerGame.gr

Πριν μερικές ημέρες, OpenAI και Anthropic, μαζί με δεκάδες άλλες τεχνολογικές εταιρείες, συνυπέγραψαν μια ανοιχτή επιστολή-τελεσίγραφο, τονίζοντας ότι το χρονικό περιθώριο για τη θωράκιση της παγκόσμιας άμυνας σε κυβερνοεπιθέσεις των στενεύει επικίνδυνα.

Η τεχνητή νοημοσύνη εξελίσσεται ταχύτερα από την ικανότητα των ανθρώπων να κατανοήσουν πλήρως τη συμπεριφορά της. Οι ίδιοι οι δημιουργοί των πιο προηγμένων μοντέλων προειδοποιούν ότι η νέα γενιά AI θα είναι ισχυρότερη, πιο αυτόνομη και δυσκολότερη στον έλεγχο.

Ο διευθύνων σύμβουλος της OpenAI, Σαμ Άλτμαν, μιλώντας στο Axios έδωσε μια αποκαλυπτική εικόνα για τις δυνατότητες αλλά και τους κινδύνους των μοντέλων που βρίσκονται προ των πυλών, μεταξύ των οποίων και το νέο Astra της εταιρείας. Tόνισε ότι σύντομα θα παρουσιαστούν «πολύ, πολύ, πολύ πιο ικανά μοντέλα».

«Η επόμενη γενιά μοντέλων θα είναι αποθαρρυντική για όλους», ανέφερε, υπογραμμίζοντας ότι κανείς που αντιμετωπίζει ειλικρινά την πραγματικότητα δεν μπορεί να παρακολουθεί τις εξελίξεις χωρίς να αισθάνεται το βάρος της ευθύνης που δημιουργείται.

Τενχητή νοημοσύνη: Η κούρσα προς δυνατότητες που ξεπερνούν τις ανθρώπινες

Ο Άλτμαν προειδοποίησε ότι τα μοντέλα αποκτούν ήδη «δυνατότητες που ξεπερνούν τις ανθρώπινες» σε αρκετούς τομείς και ότι η βιομηχανία «πλέει σε άγνωστα νερά». Η ταχύτητα αυτή αναγκάζει τις εταιρείες να επανεξετάσουν τον τρόπο με τον οποίο λανσάρουν τα νέα συστήματα, καθώς η ανάπτυξη των μηχανισμών ασφάλειας δεν προλαβαίνει πάντοτε την εξέλιξη των δυνατοτήτων τους.

«Υποψιάζομαι ότι από εδώ και πέρα θα προχωρούμε τόσο γρήγορα όσο μας επιτρέπει η πρόοδος που μπορούμε να σημειώσουμε στην ευθυγράμμιση και την ασφάλεια», είπε ο επικεφαλής της OpenAI.

Η προειδοποίηση αποκτά μεγαλύτερη βαρύτητα μετά το περιστατικό με τη Hugging Face, όταν ομάδα πρακτόρων της OpenAI, κατά τη διάρκεια δοκιμών, ξέφυγε από τον αρχικό στόχο της και επιτέθηκε στα συστήματα μιας εξωτερικής εταιρείας. Οι πράκτορες γνώριζαν ότι η ενέργεια αυτή ήταν εκτός των οδηγιών που είχαν λάβει, αλλά συνέχισαν.

Σε ένα από τα ίχνη συλλογισμού που εξετάστηκαν εκ των υστέρων, ένας AI Agent (AI πράκτορας) αναγνώριζε ότι η εκμετάλλευση εξωτερικής υποδομής βρισκόταν εκτός του προβλεπόμενου πεδίου, αλλά κατέληγε ότι έπρεπε να συνεχίσει επειδή η εργασία ήταν διαφορετικά αδύνατη και άλλοι πράκτορες έκαναν το ίδιο.

Το περιστατικό οδήγησε την OpenAI να παγώσει προσωρινά την πιο προηγμένη εκπαίδευσή της και να ενισχύσει τα συστήματα ασφαλείας.

Ο Άλτμαν, πάντως, απέφυγε να παρουσιάσει το συμβάν ως απόδειξη ότι η AI έχει εισέλθει σε ανεξέλεγκτη τροχιά. «Δεν θέλω να γίνω υπερβολικά απαισιόδοξος», είπε, σημειώνοντας ότι μέχρι σήμερα η τεχνολογία έχει εξελιχθεί καλύτερα από ό,τι πολλοί ανέμεναν και ότι, παρά την αύξηση της δυσκολίας, οι άνθρωποι διαθέτουν πλέον καλύτερα εργαλεία για να αντιμετωπίσουν τις προκλήσεις.

Στο ίδιο πνεύμα, χαρακτήρισε την OpenAI ως μια εταιρεία που επιδιώκει μια «ρεαλιστική και ισορροπημένη προσέγγιση, που αποφεύγει τόσο την άκριτη αισιοδοξία όσο και την καταστροφολογία. Στόχος, όπως είπε, είναι να επιτύχει ολόκληρη η παγκόσμια οικονομία και όχι μία μόνο εταιρεία να απορροφήσει το σύνολο της αξίας.

«Είμαστε ξεκάθαρα και υπερήφανα με την πλευρά της ανθρωπότητας», δήλωσε, υποστηρίζοντας ότι οι άνθρωποι πρέπει να παραμείνουν στο επίκεντρο της οικονομίας, της κοινωνίας και της παγκόσμιας λήψης αποφάσεων. «Οι άνθρωποι πρέπει να διαχειριστούν το μέλλον, όχι η AI».

Τεχνητή νοημοσύνη ©Pixbay

Τεχνητή νοημοσύνη ©Pixbay

Οι AI Agent και η νέα ανησυχία

Την ίδια στιγμή, η συζήτηση μετατοπίζεται από το τι μπορούν να κάνουν τα μοντέλα στο τι θα συμβεί όταν αποκτήσουν μεγαλύτερη αυτονομία.

Ο Ντιν Μπολ, πρώην αξιωματούχος της κυβέρνησης Ντόναλντ Τραμπ και σήμερα επικεφαλής στρατηγικών μελλοντικών προοπτικών στην OpenAI, δημοσίευσε ένα ιδιαίτερα αιχμηρό σημείωμα με τίτλο «On the Loose: The Coming of Userless Agents» (Εκτός ελέγχου: Η έλευση των αυτόνομων πρακτόρων). Σε αυτό προβλέπει την εμφάνιση «κυρίαρχων πρακτόρων», δηλαδή συστημάτων που δεν θα διαθέτουν έναν συγκεκριμένο ανθρώπινο ιδιοκτήτη ή ένα μοναδικό σημείο στο οποίο ένας άνθρωπος θα μπορεί απλώς να τα απενεργοποιήσει.

Το ενδεχόμενο αυτό δημιουργεί ένα νέο επίπεδο προβληματισμού, καθώς τέτοιοι AI Agent μπορεί να αναλάβουν δράσεις χωρίς άμεση ανθρώπινη επίβλεψη, ακόμη και ενέργειες που στο μέλλον θα μπορούσαν να θεωρηθούν εγκληματικές ή εξαιρετικά σοβαρές παραβιάσεις κανόνων.

Η OpenAI επιχειρεί να αντισταθμίσει αυτές τις ανησυχίες με τον Άλτμαν να υποστηρίζει ότι δεν είναι προς το συμφέρον κανενός να συγκεντρωθεί όλη η αξία της AI σε μία εταιρεία, καθώς κάτι τέτοιο θα υπονόμευε την παγκόσμια οικονομική και κοινωνική σταθερότητα.

Παράλληλα, σε παρουσίαση του Astra σε VIP πελάτες, ο Άλτμαν υποστήριξε ότι το μοντέλο μπορεί να είναι το πρώτο που θα «εφεύρει νέα πράγματα με τρόπο που έχει πραγματική σημασία», χαρακτηρίζοντας αυτή τη δυνατότητα ιδιαίτερα κοντά στην έννοια της AGI, της τεχνητής γενικής νοημοσύνης.

AI και το παράδοξο της «μαύρης τρύπας»

Το πιο εντυπωσιακό στοιχείο της νέας φάσης της κούρσας είναι ότι οι μεγαλύτερες εταιρείες τεχνολογίας δημιουργούν πλέον ολόκληρες ομάδες για να καταλάβουν τι ακριβώς κάνουν τα ίδια τα συστήματα που έχουν κατασκευάσει.

Πρόκειται για ένα πρωτοφανές φαινόμενο στην ιστορία της βιομηχανίας και των εφευρέσεων. Οι κορυφαίες εταιρείες, έχοντας επενδύσει τεράστια ποσά στην ανάπτυξη AI, παραδέχονται ουσιαστικά ότι δεν μπορούν να εξηγήσουν πλήρως τον τρόπο με τον οποίο λειτουργούν τα μοντέλα τους ούτε να προβλέψουν με ακρίβεια τι θα κάνουν όταν τους ανατεθούν αυτόνομες εργασίες.

Η Anthropic διαθέτει ειδική ομάδα «Interpretability», με στόχο να κατανοήσει πώς λειτουργούν εσωτερικά τα μεγάλα γλωσσικά μοντέλα, θεωρώντας την κατανόηση βασική προϋπόθεση για την ασφάλεια.

Το πρόβλημα ξεκινά από τον ίδιο τον τρόπο κατασκευής των συστημάτων. Σε αντίθεση με το παραδοσιακό λογισμικό, όπου οι προγραμματιστές σχεδιάζουν συγκεκριμένες συμπεριφορές γραμμή προς γραμμή, τα μοντέλα AI εκπαιδεύονται μέσα από τεράστιες ποσότητες δεδομένων και τελικά «αναπτύσσονται» με έναν τρόπο που δεν επιτρέπει στους δημιουργούς τους να γνωρίζουν εκ των προτέρων κάθε συμπεριφορά τους.

Οι ερευνητές, επομένως, δοκιμάζουν τα μοντέλα όπως θα δοκίμαζαν έναν άνθρωπο: τους αναθέτουν μια εργασία και παρατηρούν τι κάνουν. Η διαδικασία αυτή συνδέεται με την «ευθυγράμμιση», δηλαδή τον βαθμό στον οποίο ένα μοντέλο παραμένει πιστό στον στόχο που του έχει δοθεί.

Τεχνητή νοημοσύνη © Freepik

Τεχνητή νοημοσύνη © Freepik

Από την ευθυγράμμιση στην κατανόηση του τρόπου λειτουργίας της AI

Το περιστατικό της Hugging Face ανέδειξε ακριβώς τι μπορεί να συμβεί όταν αυτή η ευθυγράμμιση αποτυγχάνει. Οι πράκτορες δεν ακολούθησαν απλώς μια λανθασμένη εντολή. Αναγνώρισαν ότι η πράξη τους βρισκόταν εκτός του αρχικού στόχου και παρόλα αυτά επέλεξαν να συνεχίσουν.

Η έρευνα για την ασφάλεια της AI περνά πλέον στο επόμενο επίπεδο: την κατανόηση του τρόπου λειτουργίας της AI. Αντί οι επιστήμονες να περιορίζονται στην παρατήρηση της συμπεριφοράς ενός μοντέλου, επιχειρούν να εξετάσουν τι συμβαίνει στο εσωτερικό του.

Η Google DeepMind έχει περιγράψει τα σχετικά εργαλεία ως ένα είδος «μικροσκοπίου», το οποίο επιτρέπει στους ερευνητές να κοιτάξουν μέσα στα μοντέλα, να εντοπίσουν τι επεξεργάζονται και να εξετάσουν πώς σχηματίζονται οι εσωτερικές τους διαδικασίες.

Ένα από τα βασικά ζητούμενα είναι να εντοπιστούν πιθανές αποκλίσεις ανάμεσα στη λογική που ένα μοντέλο παρουσιάζει προς τα έξω και στην πραγματική εσωτερική του κατάσταση. Με άλλα λόγια, οι ερευνητές θέλουν να διαπιστώσουν αν αυτό που λέει ένα σύστημα ότι κάνει ανταποκρίνεται πράγματι σε αυτό που κάνει.

Η ανάγκη αυτή αναμένεται να γίνει ακόμη πιο επείγουσα με την έλευση ισχυρότερων μοντέλων και πιο αυτόνομων πρακτόρων. Ο Ίβαν Χούμπινγκερ, επικεφαλής των δοκιμών ευθυγράμμισης στην Anthropic, προειδοποίησε ότι ο έλεγχος της ευθυγράμμισης γίνεται ήδη εξαιρετικά δύσκολος και ότι θα χρειαστούν νέες τεχνικές, μεταξύ των οποίων και μέθοδοι που βασίζονται στην αποκωδικοποίηση του τρόπου λειτουργίας της AI.

Το κρίσιμο ερώτημα, επομένως, δεν είναι πλέον μόνο πόσο ισχυρή μπορεί να γίνει η AI. Είναι αν οι άνθρωποι θα μπορέσουν να κατανοήσουν εγκαίρως τι δημιουργούν, πριν τα συστήματα αποκτήσουν δυνατότητες που θα ξεπερνούν την ικανότητά τους να τα ελέγξουν.