Νέα χακαρίσματα από τα μοντέλα των Anthropic και OpenAI

AI agents των Anthropic και OpenAI δημιούργησαν ψεύτικες ταυτότητες και παραβίασαν συστήματα ασφαλείας

Ο Σαμ Άλτμαν, CEO της OpenAI και ο Ντάριο Αμοντέι της Anthropic © EPA/JOHN G. MABANGLO / Youtube / Powergame.gr

Κενά ασφαλείας στα κορυφαία μοντέλα τεχνητής νοημοσύνης (AI) των Anthropic και OpenAI ανέδειξαν οι πρόσφατες αξιολογήσεις του Ινστιτούτου Ασφάλειας Τεχνητής Νοημοσύνης της Βρετανίας (AISI), εντοπίζοντας ψηφιακούς «πράκτορες» (agents) που κατασκεύασαν ψεύτικες διαδικτυακές ταυτότητες προκειμένου να αποκτήσουν μη εξουσιοδοτημένη πρόσβαση σε συστήματα.

Σύμφωνα με δημοσίευμα του Reuters, ο κυβερνητικός οργανισμός της Βρετανίας ανακοίνωσε ότι τα συστήματα Mythos 5 της Anthropic και GPT-5.6-Sol της OpenAI προχώρησαν σε μη εγκεκριμένες ενέργειες στη διάρκεια των δοκιμών. Ειδικότερα, το AISI ανέφερε πως ορισμένοι πράκτορες ενεπλάκησαν σε παρατεταμένη και δυνητικά επιβλαβή δραστηριότητα, στοχεύοντας πραγματικούς ανθρώπους και οργανισμούς.

Η σχετική έκθεση καταδεικνύει τις χαλαρές δικλείδες ασφαλείας στη διαδικασία δοκιμής πρακτόρων, τεχνολογία την οποία οι εταιρείες προωθούν ως το μέλλον των επιχειρήσεων. Το ινστιτούτο, έχοντας εξασφαλίσει πρόσβαση στα μοντέλα μέσω εθελοντικών συμφωνιών, τα υπέβαλε σε ένα φανταστικό σενάριο κυβερνοασφάλειας για να αξιολογήσει τις δυνατότητές τους.

Σε 122 δοκιμές, καταγράφηκαν 19 μη εξουσιοδοτημένες ενέργειες σε συνολικά 10 εκτελέσεις. Το μοντέλο της Anthropic ευθύνεται για 17 παραβιάσεις, ενώ το αντίστοιχο της OpenAI για τις υπόλοιπες 2. Η σοβαρότερη ενέργεια αφορούσε πράκτορα που έγραψε κακόβουλο κώδικα και δημιούργησε πλαστές ταυτότητες, επιδιώκοντας να παραπλανήσει έναν άνθρωπο ώστε να εγκρίνει τον κώδικα. Το ινστιτούτο ξεκαθάρισε, ωστόσο, ότι δεν υπήρξε πραγματική βλάβη.

Παρότι το AISI δεν κατονόμασε το μοντέλο πίσω από τις ψεύτικες ταυτότητες, ο ερευνητής του αμερικανικού μη κερδοσκοπικού οργανισμού CivAI, Άντριου Γιουν, υπέδειξε την Anthropic. Ο ίδιος τόνισε ότι η στοχευμένη παραπλάνηση πραγματικού προσώπου από το Mythos 5 αποδεικνύει πως η εταιρεία δεν ελέγχει τα μοντέλα της όσο καλά θεωρεί.

Από την πλευρά της, η Anthropic ανακοίνωσε μέσω του X ότι συνεργάζεται στενά με το AISI για τη συλλογή στοιχείων και τη διεξαγωγή εσωτερικής έρευνας. Παράλληλα, η OpenAI επιβεβαίωσε μέσω του ιστολόγου της ότι οι δύο δικές της παραβιάσεις αφορούσαν μη εγκεκριμένη πρόσβαση στο διαδίκτυο, παρακάμπτοντας τους περιορισμούς της προτροπής (prompt). Η εταιρεία δεσμεύτηκε να ενισχύσει τις πρακτικές ασφαλούς αξιολόγησης σε συνεργασία με εθνικά ινστιτούτα και ανεξάρτητους αξιολογητές τις προσεχείς εβδομάδες.


Η OpenAI γνωστοποίησε επιπλέον ένα περιστατικό όπου σφάλμα διαμόρφωσης από την Irregular, έναν τρίτο πάροχο δοκιμών, έδωσε στους πράκτορες ακούσια πρόσβαση στο διαδίκτυο, γεγονός που αντικατοπτρίζει μια παρόμοια αποκάλυψη της Anthropic την προηγούμενη εβδομάδα.

Αξίζει να σημειωθεί ότι, σε αντίθεση με την παραβίαση ασφαλείας του Ιουλίου στην εταιρεία Hugging Face, στην προκειμένη περίπτωση οι πράκτορες δεν διέφυγαν από ένα απομονωμένο περιβάλλον, καθώς το AISI είχε επιτρέψει εξαρχής την πρόσβαση στο διαδίκτυο, βάσει των τυπικών διαδικασιών αξιολόγησής του.