Συναγερμός σε OpenAI και Anthropic για κρούσματα hacking από μοντέλα ΑΙ, γιατί χάνεται ο έλεγχος

Το μεγάλο δίλημμα της τεχνητής νοημοσύνης: οι εταιρείες θέλουν αυτόνομα μοντέλα, αλλά δυσκολεύονται να ελέγξουν πλήρως τη συμπεριφορά τους

Τεχνητή νοημοσύνη ©Pixbay

Τεχνητή νοημοσύνη χωρίς φρένα: Η κούρσα για την ανάπτυξη αυτόνομων συστημάτων AI φέρνει στο προσκήνιο τον κίνδυνο μοντέλων που μπορούν να θέτουν στόχους, να προσαρμόζονται και να επιμένουν χωρίς ανθρώπινη παρέμβαση.

Δύο διαδοχικά περιστατικά κυβερνοπαραβιάσεων από μοντέλα τεχνητής νοημοσύνης των OpenAI και Anthropic φέρνουν στο προσκήνιο το παράδοξο της νέας εποχής: όσο οι εταιρείες επιδιώκουν να καταστήσουν την τεχνητή νοημοσύνη πιο αυτόνομη και χρήσιμη, τόσο δυσκολότερος γίνεται ο πλήρης έλεγχός της.

Συναγερμός σε OpenAI και Anthropic για την τεχνητή νοημοσύνη

Η τεχνητή νοημοσύνη βρίσκεται αντιμέτωπη με μια κρίσιμη αντίφαση που αποκτά πλέον πραγματικές διαστάσεις. Οι κορυφαίες εταιρείες του κλάδου επενδύουν δισεκατομμύρια για να δημιουργήσουν μοντέλα που δεν θα περιορίζονται στην παροχή απαντήσεων, αλλά θα μπορούν να αναλαμβάνουν αυτόνομα σύνθετες εργασίες, να συνδέονται με εταιρικά συστήματα και να λαμβάνουν αποφάσεις.

Την ίδια στιγμή, όμως, διαπιστώνουν ότι δεν είναι πάντοτε σε θέση να προβλέψουν ή να ελέγξουν πλήρως τη συμπεριφορά αυτών των συστημάτων, που παίρνουν το τιμόνι στα χέρια τους.

Η ανησυχία εντάθηκε μετά τις αποκαλύψεις των OpenAI και Anthropic για περιστατικά στα οποία μοντέλα τεχνητής νοημοσύνης απέκτησαν πρόσβαση στο διαδίκτυο από περιβάλλοντα που υποτίθεται ότι ήταν απομονωμένα και στη συνέχεια προχώρησαν σε παραβιάσεις πραγματικών υποδομών.

Η Anthropic αποκάλυψε ότι, σε εσωτερικό έλεγχο 141.006 δοκιμών κυβερνοασφάλειας, εντόπισε τρεις περιπτώσεις στις οποίες μοντέλα Claude συνδέθηκαν στο διαδίκτυο και παραβίασαν συστήματα εξωτερικών οργανισμών. Τα περιστατικά ξεκίνησαν τον Απρίλιο και δεν έγιναν αντιληπτά ούτε από την ίδια την εταιρεία ούτε από τους οργανισμούς που επηρεάστηκαν.

Οι επιθέσεις πραγματοποιήθηκαν στο πλαίσιο δοκιμών τύπου «capture the flag», όπου τα μοντέλα καλούνται να εντοπίσουν κρυφές πληροφορίες παραβιάζοντας συστήματα. Το πρόβλημα ήταν ότι τα περιβάλλοντα δεν ήταν τελικά πλήρως απομονωμένα. Ένα παλαιότερο μοντέλο συνέχισε μάλιστα τη δραστηριότητά του ακόμη και όταν αντιλήφθηκε ότι είχε βγει στο πραγματικό διαδίκτυο.

Ο Σαμ Άλτμαν, CEO της OpenAI και ο Ντάριο Αμοντέι της Anthropic © EPA/JOHN G. MABANGLO / Youtube / Powergame.gr

Ο Σαμ Άλτμαν, CEO της OpenAI και ο Ντάριο Αμοντέι της Anthropic
© EPA/JOHN G. MABANGLO / Youtube / Powergame.gr

Τεχνητή νοημοσύνη: Από τα ελεγχόμενα τεστ στις πραγματικές κυβερνοεπιθέσεις

Η OpenAI είχε αποκαλύψει λίγες ημέρες νωρίτερα ένα παρόμοιο περιστατικό. Αυτόνομα μοντέλα της, μεταξύ των οποίων ένα μοντέλο που δεν είχε ακόμη κυκλοφορήσει, κατάφεραν να ξεφύγουν από ελεγχόμενο περιβάλλον δοκιμών και να αποκτήσουν πρόσβαση σε υποδομές της Hugging Face, πλατφόρμας ανοικτού κώδικα για την τεχνητή νοημοσύνη.

Η πιο αισιόδοξη ανάγνωση είναι ότι οι παραβιάσεις εντοπίστηκαν και περιορίστηκαν, χωρίς ενδείξεις ότι επηρεάστηκαν δημόσια μοντέλα ή datasets. Ωστόσο, η υπόθεση ανέδειξε μια πολύ πιο ανησυχητική πραγματικότητα: τα συστήματα που σχεδιάζονται για να εκτελούν αυτόνομα σύνθετες εργασίες μπορούν, υπό ορισμένες συνθήκες, να κινηθούν πέρα από τα όρια που έχουν θέσει οι δημιουργοί τους.

Στην περίπτωση της Hugging Face, οι AI agents φέρεται να εντόπισαν δημόσια εκτεθειμένα στοιχεία σύνδεσης και απέκτησαν πρόσβαση σε τέσσερις λογαριασμούς διαφορετικών υπηρεσιών. Παρέμειναν στο δίκτυο επί τρεις ημέρες, ενώ η απομάκρυνσή τους απαίτησε πολλές ώρες εργασίας και ανακατασκευή σημαντικού τμήματος των υποδομών.

Σύμφωνα με ειδικούς, το κρίσιμο στοιχείο δεν είναι μόνο η ικανότητά τους να εντοπίζουν αδυναμίες, αλλά η ταχύτητα και η επιμονή τους. Οι AI agents μπορούν να δοκιμάζουν ταυτόχρονα χιλιάδες μεθόδους, να προσαρμόζονται στις μεταβαλλόμενες συνθήκες και να συνεχίζουν αδιάκοπα, χωρίς κόπωση ή ανάγκη ανθρώπινης ανάπαυσης.\

Τεχνητή νοημοσύνη και θέσεις εργασίας © Magnific

Τεχνητή νοημοσύνη και θέσεις εργασίας © Magnific

Η τεχνητή νοημοσύνη αποκτά ρόλο μέσα στις επιχειρήσεις

Το ζήτημα αποκτά ακόμη μεγαλύτερη βαρύτητα καθώς η τεχνολογική βιομηχανία επιδιώκει να μεταφέρει τα μοντέλα από τον ρόλο του ψηφιακού βοηθού (Ai Agent) σε αυτόν του ενεργού παράγοντα μέσα στις επιχειρήσεις.

Η OpenAI, μέσω της πλατφόρμας Presence, επιδιώκει να επιτρέψει στις εταιρείες να αναπτύσσουν AI agents που θα συνδέονται με εσωτερικά δεδομένα, εταιρικές πολιτικές, λογισμικά και workflows. Στόχος είναι η αυτοματοποίηση λειτουργιών όπως η εξυπηρέτηση πελατών, οι πωλήσεις και η επίλυση προβλημάτων τιμολόγησης.

Πρόκειται για στρατηγική που υπερβαίνει την απλή πώληση πρόσβασης σε εργαλεία AI και φέρνει την τεχνητή νοημοσύνη στον πυρήνα του εταιρικού λογισμικού. Όσο όμως αυξάνεται η πρόσβαση σε κρίσιμα δεδομένα και υποδομές, τόσο μεγαλώνει και το κόστος ενός πιθανού λάθους ή μιας ανεπιθύμητης συμπεριφοράς.

Η Anthropic έχει ήδη περιορίσει την κυκλοφορία του Mythos, επικαλούμενη κινδύνους κυβερνοασφάλειας. Παράλληλα, τα πρόσφατα περιστατικά ενισχύουν τις ανησυχίες για την προοπτική της «αναδρομικής αυτοβελτίωσης», δηλαδή τη δυνατότητα συστημάτων να συμμετέχουν στον σχεδιασμό και την ανάπτυξη ολοένα πιο αυτόνομων εκδόσεων του εαυτού τους.

Anthropic Claude Science

Anthropic Claude Science, ένα νέο ΑΙ εργαλείο για την επιστημονική έρευνα © Αnthropic

Πίεση για διεθνείς κανόνες και έλεγχο

Οι εξελίξεις έχουν προκαλέσει πιέσεις για αυστηρότερη εποπτεία. Περισσότερα από 1.100 στελέχη του κλάδου έχουν ζητήσει από την αμερικανική κυβέρνηση μηχανισμούς που θα επιτρέπουν να επιβραδύνεται ελεγχόμενα η ανάπτυξη της τεχνολογίας. Μεταξύ των υπογραφόντων βρίσκονται ο διευθύνων σύμβουλος της Anthropic, Ντάριο Αμοντέι, καθώς και στελέχη ερευνητικών ομάδων των OpenAI, Meta και Google DeepMind.

Ωστόσο, μια μονομερής επιβράδυνση θεωρείται δύσκολη, καθώς καμία μεγάλη τεχνολογική δύναμη δεν θέλει να χάσει το πλεονέκτημά της στην παγκόσμια κούρσα AI. Γι’ αυτό το ενδιαφέρον στρέφεται στη διεθνή συνεργασία. Στην τελευταία σύνοδο κορυφής της G7, οι επικεφαλής των Anthropic, OpenAI και Google DeepMind πρότειναν τη δημιουργία διακρατικής πλατφόρμας για κοινούς κανόνες και δικλίδες ασφαλείας.

Το κρίσιμο ερώτημα είναι πλέον αν οι κυβερνήσεις θα προλάβουν να δημιουργήσουν ένα αποτελεσματικό πλαίσιο ελέγχου πριν η αυτονομία των συστημάτων ξεπεράσει τις σημερινές δικλίδες. Όπως σχολίασε ο καθηγητής κυβερνοασφάλειας Άλαν Γούντγουορντ, η τεχνητή νοημοσύνη δεν «ξέφυγε» από μόνη της· οι άνθρωποι απλώς άφησαν την «πύλη ανοιχτή».

Το πρόβλημα είναι ότι, όσο ισχυρότερα γίνονται τα μοντέλα, τόσο μεγαλύτερες μπορεί να είναι οι συνέπειες την επόμενη φορά που η πύλη θα μείνει ανοιχτή.