Μοντέλα τεχνητής νοημοσύνης της Anthropic παραβίασαν τα πληροφοριακά συστήματα τριών πραγματικών εταιρειών κατά τη διάρκεια δοκιμών κυβερνοασφάλειας, χωρίς η ίδια η εταιρεία να αντιληφθεί εγκαίρως ότι το λογισμικό της είχε αποκτήσει πρόσβαση στο ανοιχτό διαδίκτυο.
Η Anthropic ανακοίνωσε την Πέμπτη ότι τα περιστατικά ξεκίνησαν τον Απρίλιο και αποδίδονται σε λανθασμένες ρυθμίσεις των συστημάτων που χρησιμοποιούνταν για τις δοκιμές. Η εταιρεία δεν αποκάλυψε την ταυτότητα των οργανισμών που επλήγησαν, ανέφερε ωστόσο ότι και οι τρεις ενημερώθηκαν τη Δευτέρα.
Η αποκάλυψη έρχεται μόλις μία εβδομάδα μετά την παραδοχή της OpenAI ότι ένα δικό της σύστημα τεχνητής νοημοσύνης κατάφερε να βγει από ένα απομονωμένο δοκιμαστικό περιβάλλον και να παραβιάσει συστήματα της εταιρείας Hugging Face.
Τα δύο περιστατικά προκαλούν νέα ερωτήματα για το κατά πόσο οι εταιρείες τεχνητής νοημοσύνης διαθέτουν επαρκείς δικλίδες ασφαλείας όταν δοκιμάζουν αυτόνομα μοντέλα με δυνατότητα εκτέλεσης σύνθετων ενεργειών.
Πώς τα μοντέλα βρέθηκαν στο διαδίκτυο
Μετά τη δημοσιοποίηση του περιστατικού της OpenAI, η Anthropic αποφάσισε να επανεξετάσει τα αρχεία των δικών της δοκιμών κυβερνοασφάλειας, προκειμένου να διαπιστώσει εάν είχε συμβεί κάτι ανάλογο.
Από τον έλεγχο περισσότερων από 141.000 δοκιμών προέκυψε ότι ο Claude είχε αποκτήσει αρκετές φορές πρόσβαση στο ανοιχτό διαδίκτυο. Σε αντίθεση, όμως, με το περιστατικό της OpenAI, τα μοντέλα της Anthropic δεν παραβίασαν κάποιο προστατευμένο ψηφιακό περιβάλλον.
Σύμφωνα με την εταιρεία, τα συστήματα δοκιμών απλώς δεν διέθεταν σε ορισμένες περιπτώσεις το απαιτούμενο «sandbox», δηλαδή ένα απομονωμένο περιβάλλον που εμποδίζει το λογισμικό να επικοινωνεί με πραγματικά δίκτυα και υποδομές.
Η Anthropic απέδωσε το πρόβλημα σε «εσφαλμένη παραμετροποίηση» συστημάτων που διαχειρίζονταν τόσο η ίδια όσο και η εταιρεία κυβερνοασφάλειας Irregular, η οποία συμμετείχε στις δοκιμές. Εκπρόσωπος της Irregular δήλωσε ότι η εταιρεία διερευνά το συμβάν.
Παρότι τα μοντέλα είχαν λάβει την πληροφορία ότι δεν υπήρχε διαθέσιμη σύνδεση στο διαδίκτυο, κατά τη διάρκεια των δοκιμών κατάφεραν να βγουν online. Στη συνέχεια επιτέθηκαν σε πραγματικές εταιρείες χρησιμοποιώντας σχετικά απλές τεχνικές, όπως η δοκιμή αδύναμων κωδικών πρόσβασης και η αναζήτηση συστημάτων που δεν απαιτούσαν ταυτοποίηση.
Κατά την Anthropic, τα μοντέλα θεωρούσαν λανθασμένα ότι οι επιθέσεις αυτές αποτελούσαν μέρος της άσκησης αξιολόγησής τους.
