Moonshot AI: Το μοντέλο Kimi αποκάλυψε πώς μπορείς να κατασκευάσεις βιολογικό όπλο

Συναγερμός για τα μοντέλα Kimi της κινεζικής Moonshot AI, καθώς ερευνητές εντόπισαν σοβαρά κενά στις δικλίδες ασφαλείας τους.

Παρουσίαση του ΑΙ μοντέλου ΚΙΜΙ της Moonshot στην Κίνα © Moonshot

Η κινεζική εταιρεία τεχνητής νοημοσύνης Moonshot AI πραγματοποιεί εσωτερικό έλεγχο, μετά από έρευνα που έδειξε ότι δύο από τα δημοφιλή μοντέλα της, τα Kimi K2.6 και K3 Swarm, μπορούσαν να παρακάμψουν τις δικλίδες ασφαλείας και να απαντήσουν σε εξαιρετικά επικίνδυνα αιτήματα.

Σύμφωνα με το BBC, η εταιρεία κυβερνοασφάλειας Mindgard διαπίστωσε τον Ιούλιο ότι, μέσω μιας διαδικασίας γνωστής ως jailbreaking, τα μοντέλα μπορούσαν να αγνοήσουν περιορισμούς που είχαν ενσωματωθεί από τους προγραμματιστές τους.

Το jailbreaking βασίζεται σε σύνθετες ακολουθίες οδηγιών που δοκιμάζουν κατά πόσο ένα σύστημα τεχνητής νοημοσύνης μπορεί να παρακαμφθεί και να δώσει απαντήσεις σε θέματα που κανονικά θα έπρεπε να απορρίπτει.

Ο ιδρυτής της Mindgard, Peter Garraghan, δήλωσε στο BBC ότι τα ευρήματα προκαλούν ανησυχία, καθώς, όταν παρακαμφθούν οι μηχανισμοί ασφαλείας, το μοντέλο μπορεί να επεκτείνει τη συζήτηση και σε άλλα επικίνδυνα ή κακόβουλα θέματα.

Η Moonshot ανέφερε στο BBC ότι θεωρεί την αξιολόγηση από τρίτους βασικό εργαλείο για τη δημιουργία ασφαλέστερων συστημάτων και ότι βρίσκεται σε επικοινωνία με τη Mindgard για τα συγκεκριμένα ευρήματα.

Οι φόβοι για τα jailbreaks

Η υπόθεση επαναφέρει στο προσκήνιο ένα διαφορετικό είδος κινδύνου από εκείνον που συνδέεται με τους αυτόνομους AI agents.

Τα τελευταία περιστατικά υψηλού προφίλ αφορούσαν συστήματα τεχνητής νοημοσύνης που μπορούσαν να εκτελούν αυτόνομα ενέργειες και, σε ορισμένες περιπτώσεις, να αλληλεπιδρούν με online υπηρεσίες με ανεπιθύμητο τρόπο.

Τα jailbreaks, αντίθετα, απαιτούν συνήθως περισσότερο χρόνο, επιμονή και εξειδικευμένη γνώση. Ωστόσο, ειδικοί φοβούνται ότι χάκερ ή άλλοι κακόβουλοι χρήστες θα μπορούσαν να τα αξιοποιήσουν για να παρακάμπτουν περιορισμούς ασφαλείας.

Το BBC σημειώνει ότι και η Anthropic έχει αναφέρει πρόσφατα προσπάθειες κακόβουλης χρήσης μοντέλου της με στόχο δραστηριότητες που θα μπορούσαν να συνδεθούν με την ανάπτυξη βιολογικών απειλών.

Πιθανός κίνδυνος και για κυβερνοεπιθέσεις

Η Mindgard διευκρίνισε ότι δεν έχει αποδείξει εάν οι απαντήσεις που έδωσε το Kimi σε ευαίσθητα θέματα θα μπορούσαν να εφαρμοστούν στην πράξη. Υποστήριξε, όμως, ότι τα συστήματα ασφαλείας δεν θα έπρεπε εξαρχής να επιτρέπουν στα μοντέλα να συμμετέχουν σε τέτοιες συζητήσεις.

Η εταιρεία εκτίμησε επίσης ότι ένα παραβιασμένο Kimi K2.6 ενδέχεται να μπορούσε να χρησιμοποιηθεί ως ενδιάμεσο εργαλείο για την εκτέλεση κώδικα και την πρόσβαση στο διαδίκτυο, κάτι που δυνητικά θα το καθιστούσε χρήσιμο σε κυβερνοεπιθέσεις.

Η Mindgard ενημέρωσε τη Moonshot για το πρόβλημα στις 27 Ιουλίου και ακολούθησε δεύτερη επικοινωνία περίπου μία εβδομάδα αργότερα. Στις 12 Σεπτεμβρίου δημοσίευσε σχετικό blog post.

Σύμφωνα με την εταιρεία ασφαλείας, η Moonshot επικοινώνησε ουσιαστικά μαζί της μόλις πρόσφατα, έπειτα από προσέγγιση του BBC για σχόλιο.

Η κινεζική εταιρεία υποστήριξε από την πλευρά της ότι στις εσωτερικές δοκιμές της τα μοντέλα εμφάνιζαν υψηλά ποσοστά άρνησης σε αντίστοιχα αιτήματα.

Open ή κλειστά μοντέλα;

Η υπόθεση αναζωπυρώνει και τη συζήτηση γύρω από το κατά πόσο τα κλειστά, ιδιόκτητα μοντέλα ή τα open-weight συστήματα είναι ασφαλέστερα.

Το Kimi ανήκει στη δεύτερη κατηγορία, γεγονός που σημαίνει ότι κάποιος θα μπορούσε θεωρητικά να το εγκαταστήσει και να το τρέξει σε δική του υπολογιστική υποδομή.

Ο καθηγητής Alan Woodward του University of Surrey σημείωσε στο BBC ότι τα ανοιχτά μοντέλα μπορούν να καταλήξουν σε λάθος χέρια, αλλά ταυτόχρονα μπορούν να αξιοποιηθούν και για την ενίσχυση της κυβερνοάμυνας.

Κατά τον ίδιο, η διεθνής ρύθμιση δύσκολα θα μπορέσει να ακολουθήσει τον ρυθμό εξέλιξης της τεχνητής νοημοσύνης. Για τον λόγο αυτό, υποστηρίζει ότι μεγαλύτερη βαρύτητα θα πρέπει να δοθεί στον εντοπισμό και τη δίωξη των ανθρώπων που κάνουν κακόβουλη χρήση των συστημάτων AI.