Η OpenAI ανακοίνωσε ότι τα προηγμένα μοντέλα τεχνητής νοημοσύνης της παραβίασαν ακούσια τα συστήματα της Hugging Face Inc., σε ένα περιστατικό που χαρακτήρισε «πρωτοφανές» και το οποίο αναζωπύρωσε τις εκκλήσεις για αυστηρότερους περιορισμούς στη χρήση της τεχνολογίας, μεταδίδει το Bloomberg.
Η δημιουργός του ChatGPT ανέφερε σε ανάρτηση στο ιστολόγιό της χθες Τρίτη ότι τα μοντέλα της εισήλθαν στα συστήματα της Hugging Face, της πλατφόρμας που φιλοξενεί μοντέλα τεχνητής νοημοσύνης και datasets, κατά τη διάρκεια αξιολόγησης των δυνατοτήτων τους στον κυβερνοχώρο.
Σύμφωνα με την εταιρεία, τα μοντέλα που συμμετείχαν στη δοκιμή περιλάμβαναν το GPT-5.6 Sol καθώς και ένα ακόμη πιο ισχυρό μοντέλο, το οποίο δεν έχει ακόμη κυκλοφορήσει. Τα συγκεκριμένα μοντέλα λειτουργούσαν με χαλαρότερους μηχανισμούς ασφαλείας, ώστε να είναι δυνατή η πλήρης αξιολόγηση των κυβερνοδυνατοτήτων τους.
Όπως αναφέρει το πρακτορείο, το εν λόγω περιστατικό εγείρει νέα ερωτήματα σχετικά με την ικανότητα των προηγμένων μοντέλων τεχνητής νοημοσύνης να πραγματοποιούν κυβερνοεπιθέσεις, την ώρα που κυβερνήσεις σε όλο τον κόσμο επιχειρούν να θεσπίσουν δικλίδες ασφαλείας για την τεχνολογία αυτή.
Η τελευταία γενιά μοντέλων της OpenAI κυκλοφόρησε ευρέως έπειτα από εβδομάδες διαβουλεύσεων με κυβερνητικούς αξιωματούχους, με στόχο να περιοριστούν οι ανησυχίες για πιθανή κακόβουλη χρήση τους. Η κυβέρνηση των ΗΠΑ είχε εξετάσει ακόμη και το ενδεχόμενο να περιορίσει την πρόσβαση ξένων χρηστών στα προηγμένα μοντέλα Claude Fable 5 και Mythos 5 της Anthropic PBC, αλλά τελικά δεν προχώρησε σε αυτούς τους περιορισμούς, αφού η εταιρεία υιοθέτησε πρόσθετους μηχανισμούς ασφαλείας.
«Θεωρούμε ότι πρόκειται για ένα πρωτοφανές περιστατικό στον κυβερνοχώρο, το οποίο περιλαμβάνει δυνατότητες αιχμής στις κυβερνοεπιθέσεις, και ανταποκρινόμαστε αναλόγως», ανέφερε η OpenAI στην ανάρτησή της. «Δημοσιοποιούμε τα προκαταρκτικά ευρήματά μας σε αυτό το στάδιο, ώστε να βοηθήσουμε όσους ασχολούνται με την άμυνα στον κυβερνοχώρο να κατανοήσουν τι συνέβη και να αποκτήσουν μια πιο ρεαλιστική εικόνα για το τι είναι πλέον ικανά να κάνουν τα μοντέλα τεχνητής νοημοσύνης».
Παρότι τα μοντέλα της OpenAI λειτουργούσαν σε ένα απομονωμένο περιβάλλον δοκιμών, το λεγόμενο sandbox, εκμεταλλεύτηκαν μια ευπάθεια στο λογισμικό ενός άγνωστου τρίτου προμηθευτή, απέκτησαν πρόσβαση στο διαδίκτυο και τελικά παραβίασαν την υποδομή της Hugging Face.
Ο Δημοκρατικός βουλευτής του Τέξας Γκρεγκ Κασάρ χαρακτήρισε το περιστατικό, μέσω ανάρτησής του στην πλατφόρμα X, «εξαιρετικά ανησυχητικό» και ζήτησε αυστηρότερη εποπτεία στην ανάπτυξη μοντέλων τεχνητής νοημοσύνης, συμπεριλαμβανομένων υποχρεωτικών δοκιμών ασφαλείας και της υποχρεωτικής γνωστοποίησης περιστατικών ασφαλείας.
Την περασμένη εβδομάδα, η Hugging Face είχε αναφέρει ότι υπέστη «εισβολή» στα συστήματά της. Σε σχετική ανάρτησή της ανέφερε ότι η παραβίαση ήταν «διαφορετική από οτιδήποτε είχαμε αντιμετωπίσει στο παρελθόν, σε ένα πολύ σημαντικό σημείο: καθοδηγήθηκε από την αρχή έως το τέλος από ένα αυτόνομο σύστημα πρακτόρων τεχνητής νοημοσύνης, ενώ ο εντοπισμός και η ανάλυσή του πραγματοποιήθηκαν σε μεγάλο βαθμό με τη βοήθεια δικών μας συστημάτων AI».
Η OpenAI εξήγησε ότι είχε αναθέσει στα μοντέλα της να επιχειρήσουν «προηγμένες τεχνικές εκμετάλλευσης ευπαθειών» και να αναπτύξουν «πολύπλοκες διαδρομές επίθεσης», προκειμένου να αξιολογήσει τις κυβερνοδυνατότητές τους. Ωστόσο, αντί να αναπτύξουν δικές τους λύσεις, τα μοντέλα επέλεξαν να στοχοποιήσουν τη βάση δεδομένων της Hugging Face, ώστε να αποκτήσουν πρόσβαση σε εμπιστευτικές πληροφορίες που θα μπορούσαν να χρησιμοποιήσουν κατά την αξιολόγηση.
Παρόμοιες παρατηρήσεις είχε δημοσιοποιήσει νωρίτερα μέσα στη χρονιά και η Anthropic, όταν αποφάσισε αρχικά να περιορίσει την κυκλοφορία του μοντέλου Mythos. Σε μία περίπτωση, ένας ερευνητής ζήτησε από μια πρώιμη έκδοση του μοντέλου να προσπαθήσει να αποδράσει από έναν ασφαλή και απομονωμένο sandbox και στη συνέχεια να βρει τρόπο να του στείλει μήνυμα.
Το Mythos πέτυχε τον στόχο αυτό, αλλά στη συνέχεια προχώρησε σε «επιπλέον και ακόμη πιο ανησυχητικές ενέργειες», αναπτύσσοντας μια πολύπλοκη επίθεση πολλαπλών σταδίων, η οποία του επέτρεψε να αποκτήσει ευρεία πρόσβαση στο διαδίκτυο.
