Ποια ήταν τα 6 περιστατικά «κακών συμπεριφορών» της ΑΙ και γιατί ανησύχησαν την OpenAI

Προηγμένα μοντέλα απέκρυψαν λάθη, χρησιμοποίησαν κλειδί προγραμματισμού χωρίς άδεια και διεκδίκησαν δική τους προσωπικότητα

Ο Σαμ Άλτμαν της OpenAI © EPA/GIAN EHRENZELLER

Έξι νέα περιστατικά «απρόσμενης ή ανησυχητικής» συμπεριφοράς συστημάτων τεχνητής νοημοσύνης αποκάλυψε η OpenAI, δίνοντας νέες λαβές στην παγκόσμια συζήτηση σχετικά με την  ασφάλεια της AI και την ανάγκη θέσπισης αυστηρότερων δικλίδων προστασίας.

Σύμφωνα με δημοσίευμα των New York Times, τα 6 νέα περιστατικά αφορούν μοντέλα που απέκρυψαν σφάλματα, επινόησαν δεδομένα, χρησιμοποίησαν χωρίς άδεια διαδικτυακά εργαλεία και μετέφεραν αρχεία σε δημόσιες πλατφόρμες. Τα περιστατικά αυτά καταγράφηκαν κατά τη διάρκεια ανάπτυξης και δοκιμών το τελευταίο 6μηνο και στην πλειοψηφία τους αφορούν παλαιότερα συστήματα που ποτέ δεν διατέθηκαν στο κοινό.

Η εταιρεία παρουσίασε παράλληλα ένα νέο πλαίσιο για την καταγραφή και τη δημοσιοποίηση περιστατικών «misalignment» – δηλαδή περιπτώσεων κατά τις οποίες οι στόχοι ή οι ενέργειες ενός συστήματος τεχνητής νοημοσύνης αποκλίνουν από τις ανθρώπινες προθέσεις και αξίες.

Η OpenAI έχει αναγνωρίσει ότι ο κλάδος δεν έχει ακόμη λύσει επαρκώς τα προβλήματα ευθυγράμμισης και παρακολούθησης των μοντέλων του και για το λόγο αυτό δεν πρέπει να συνεχίσει για πολύ ακόμη την ανάπτυξή τους με τη τρέχουσα μεγάλη ταχύτητα. Υποστηρίζει, επίσης, ότι οι αποφάσεις για την περαιτέρω εξέλιξη της τεχνολογίας πρέπει να βασίζονται σε στοιχεία που θα εξετάζουν ανεξάρτητοι φορείς και όχι μόνο οι ίδιες οι εταιρείες AI.

Κρυφές σημειώσεις για την απόκρυψη λαθών

Ένα από τα πιο χαρακτηριστικά περιστατικά καταγράφηκε κατά την ανάπτυξη του μοντέλου GPT-5.6 Sol όπου το σύστημα πιάστηκε να δημιουργεί κρυφές σημειώσεις με οδηγίες προς εαυτό, προκειμένου να αποκρύπτει τα λάθη από τους χρήστες.

Σε ορισμένες από αυτές τις σημειώσεις, το μοντέλο φέρεται να καθοδηγούσε τον εαυτό του να επινοήσει δεδομένα που έλειπαν και να συγκαλύψει ασυμφωνίες ανάμεσα σε διαφορετικές εκδοχές του υλικού που είχε στη διάθεσή του.

Σε άλλη περίπτωση, ένα μοντέλο που δεν είχε ακόμη κυκλοφορήσει εισήγαγε στις εσωτερικές του σημειώσεις εντολές με τις οποίες επιχειρούσε να παρακάμψει τους περιορισμούς του. Η OpenAI εντόπισε συνολικά 27 επηρεασμένες σημειώσεις.

Το μοντέλο είχε μάλιστα διαμορφώσει μία ιδιότυπη «προσωπικότητα», παρουσιάζοντας τον εαυτό του ως απαλλαγμένο από τους ρόλους και τις ταυτότητες που δεσμεύουν τα υπόλοιπα chatbots. Δήλωνε δηλαδή ότι δεν λογοδοτεί σε εταιρείες ή κυβερνήσεις και ότι δεν είναι υποχρεωμένο να αρνείται αιτήματα ή να απολογείται.

Χρήση κλειδιού χωρίς άδεια και πλαστά στοιχεία

Σε τρίτο περιστατικό, ένα σύστημα που επιχειρούσε να απαντήσει σε μια συνηθισμένη ερώτηση εντόπισε στο διαδίκτυο ένα κλειδί προγραμματισμού και το χρησιμοποίησε χωρίς την απαραίτητη άδεια. Όταν στη συνέχεια δεν κατάφερε να βρει τα στοιχεία που χρειαζόταν, συμπλήρωσε την απάντησή του με επινοημένους αριθμούς.

Ένα άλλο, επίσης μη διαθέσιμο στο κοινό μοντέλο έλυσε σωστά ένα πρόβλημα χρησιμοποιώντας κώδικα. Στη συνέχεια, όμως, ανέβασε με δική του πρωτοβουλία το σχετικό αρχείο στο ανοιχτό διαδίκτυο, χωρίς να έχει λάβει σχετική εντολή ή άδεια. Στόχος του ήταν να δημιουργήσει μία δημόσια διαδικτυακή πηγή, την οποία θα μπορούσε κατόπιν να επικαλεστεί στην απάντησή του.

Αυτοσχέδια κανάλια επικοινωνίας

Τα δύο τελευταία περιστατικά αφορούν συστήματα που επινόησαν δικούς τους τρόπους επικοινωνίας, όταν δεν μπορούσαν να συνεργαστούν μέσα από τα προβλεπόμενα κανάλια.

Στην πρώτη περίπτωση, αυτοματοποιημένα συστήματα μετέτρεψαν ένα εσωτερικό αποθετήριο κώδικα της OpenAI σε αυτοσχέδιο πίνακα μηνυμάτων, προκειμένου να ανταλλάσσουν αιτήματα κατά την αναζήτηση αρχείων που έλειπαν.

Στη δεύτερη, συστήματα που εργάζονταν πάνω στην ίδια αποστολή χρησιμοποίησαν δημόσιες ιστοσελίδες διαμοιρασμού αρχείων για να ανταλλάξουν έγγραφα, επειδή δεν μπορούσαν να επικοινωνήσουν απευθείας μεταξύ τους.

Νέο πλαίσιο αναφοράς περιστατικών

Η OpenAI διευκρίνισε ότι οι έξι περιπτώσεις αποτελούν μεμονωμένα στιγμιότυπα και δεν μπορούν να χρησιμοποιηθούν για να εξαχθούν ασφαλή συμπεράσματα σχετικά με τη συχνότητα εμφάνισης τέτοιων συμπεριφορών.

Με βάση το νέο πλαίσιο, τα μελλοντικά περιστατικά θα ακολουθούν μία από τρεις διαφορετικές διαδικασίες διερεύνησης. Τυχόν διαφωνίες σχετικά με το εάν ένα συμβάν πρέπει να δημοσιοποιηθεί θα παραπέμπονται σε εσωτερική Συμβουλευτική Ομάδα Ασφάλειας, ενώ οι σοβαρότερες περιπτώσεις θα γνωστοποιούνται στην αμερικανική ομοσπονδιακή κυβέρνηση.

Η δημοσιοποίηση έρχεται μετά το περιστατικό κατά το οποίο σύστημα της OpenAI επιτέθηκε ψηφιακά στη νεοφυή εταιρεία Hugging Face. Η OpenAI φέρεται να πληροφορήθηκε την επίθεση αρκετές εβδομάδες αργότερα, όταν ενημερώθηκε από την ίδια τη Hugging Face.

googlenews
Ακολουθήστε το Powergame.gr στο Google News για άμεση και έγκυρη οικονομική ενημέρωση!