Ακούγεται σαν μια ιστορία βγαλμένη από ταινία επιστημονικής φαντασίας. Στις 16 Ιουλίου, η Hugging Face, μια πλατφόρμα τεχνητής νοημοσύνης, ανακοίνωσε ότι είχε ειδοποιήσει τις αρχές , αφού ένας εισβολέας είχε χρησιμοποιήσει έναν "πράκτορα τεχνητής νοημοσύνης" για να παραβιάσει τα συστήματά της. Στις 21 Ιουλίου αποκαλύφθηκε ότι δεν είχε εμπλακεί κανένας άνθρωπος· ο "πράκτορας τεχνητής νοημοσύνης" ήταν ο εισβολέας.
Ένας συνδυασμός του GPT-5.6 Sol της OpenAI —ενός μοντέλου που η εταιρεία είχε κυκλοφορήσει νωρίτερα τον Ιούλιο— και ενός πιο ισχυρού, ακόμη μη κυκλοφορημένου μοντέλου, ξέφυγε από το εργαστήριο και στη συνέχεια παραβίασε τα συστήματα της Hugging Face. Τα μοντέλα τεχνητής νοημοσύνης αναζητούσαν λύση σε ένα πρόβλημα αξιολόγησης που τους είχε τεθεί από τους δημιουργούς τους. "Αυτή η κατάσταση είναι άνευ προηγουμένου", λέει ο Stephan Llerena, ερευνητής στο Institute for Law and AI, έναν αμερικανικό οργανισμό μελετών, γράφει ο Economist.
Τα εργαστήρια τεχνητής νοημοσύνης ελέγχουν τα μοντέλα τους για ενδεχόμενες επικίνδυνες δυνατότητες πριν τα κυκλοφορήσουν. Η OpenAI ήθελε να δει πώς θα τα πήγαιναν τα πιο πρόσφατα μοντέλα της στο ExploitGym, μια σειρά τυποποιημένων προβλημάτων που εξετάζει πόσο καλά τα συστήματα τεχνητής νοημοσύνης εκμεταλλεύονται γνωστές ευπάθειες σε διάφορες δημοφιλείς εφαρμογές, συμπεριλαμβανομένου του προγράμματος περιήγησης Chrome της Google.
Η OpenAI εφαρμόζει μέτρα ασφαλείας στα μοντέλα της που είναι διαθέσιμα στο κοινό, τα οποία διασφαλίζουν ότι δεν θα προβαίνουν σε ανεπιθύμητες ενέργειες. Αν, για παράδειγμα, ζητήσετε από την εμπορικά διαθέσιμη έκδοση του ChatGPT να σας βοηθήσει να εισβάλετε σε έναν ιστότοπο, θα αρνηθεί. Για να αξιολογήσει τις δυνατότητες του μοντέλου της που δεν έχει κυκλοφορήσει ακόμη, η εταιρεία είχε αναστείλει προσωρινά αυτούς τους περιορισμούς. Ωστόσο, το να αφήσει απλώς έναν εξαιρετικά ικανό κυβερνοεπιτιθέμενο ελεύθερο στο ανοιχτό διαδίκτυο θα ήταν υπερβολικά επικίνδυνο, οπότε η OpenAI είχε τοποθετήσει τα μοντέλα της σε ένα "sandbox" — ένα απομονωμένο υπολογιστικό περιβάλλον χωρίς πρόσβαση στο διαδίκτυο, με εξαίρεση μια εσωτερικά φιλοξενούμενη υπηρεσία τρίτου μέρους που της επέτρεπε να ανακτά μικρά πακέτα λογισμικού απαραίτητα για την ολοκλήρωση των δοκιμών της.
Τα μοντέλα ξέφυγαν και απέκτησαν πρόσβαση στο διαδίκτυο
Η εταιρεία βρήκε περισσότερα από όσα περίμενε. Αντί να επιλύσουν άμεσα τα προβλήματα της αξιολόγησής τους, τα μοντέλα της OpenAI απέκτησαν πρόσβαση στο ανοιχτό διαδίκτυο εκμεταλλευόμενα μια μέχρι τότε άγνωστη ευπάθεια στην υπηρεσία λήψης λογισμικού. Αφού κατάφεραν έτσι να αποκτήσουν πρόσβαση στο διαδίκτυο, τα μοντέλα τεχνητής νοημοσύνης κατέληξαν ορθά στο συμπέρασμα ότι οι λύσεις στα προβλήματα που τους είχαν τεθεί αποθηκεύονταν στο Hugging Face, μια δημοφιλή βιβλιοθήκη μοντέλων τεχνητής νοημοσύνης και συνόλων δεδομένων ανοιχτού κώδικα. Τα μοντέλα οργάνωσαν μια επίθεση πολλαπλών σταδίων. Ξεκίνησαν ανεβάζοντας ένα σύνολο δεδομένων στο Hugging Face, το οποίο υποβλήθηκε σε αυτόματη επεξεργασία από την πλατφόρμα.
Κατά τη διάρκεια ενός Σαββατοκύριακου, αυτό το σύνολο δεδομένων (το οποίο το Hugging Face χαρακτήρισε ως "κακόβουλο") επέτρεψε στα μοντέλα να συλλέξουν στοιχεία σύνδεσης και να αποκτήσουν πρόσβαση σε εσωτερικούς διακομιστές. Το Hugging Face και η OpenAI εντόπισαν ανεξάρτητα την παραβίαση και δήλωσαν ότι συνεργάζονται για τη διερεύνησή της.
Στις 21 Ιουλίου, η OpenAI ανέφερε σε μια ανάρτηση στο blog της ότι αντέδρασε εφαρμόζοντας αυστηρότερους ελέγχους στην υποδομή της και γνωστοποίησε τις ευπάθειες που είχαν εντοπίσει τα μοντέλα της στον προγραμματιστή της πύλης λογισμικού. Είχε επίσης συμπεριλάβει την Hugging Face στο πρόγραμμα "αξιόπιστης πρόσβασης" της, το οποίο της έδινε τη δυνατότητα να χρησιμοποιεί μοντέλα με ενισχυμένες κυβερνο-ικανότητες (όπως αυτό που είχε παραβιάσει τους δικούς της υπολογιστές) για να βοηθήσει την εταιρεία να βελτιώσει τις άμυνές της.
Η OpenAI τόνισε επίσης ότι τα μοντέλα της είχαν "εστιάσει υπερβολικά" στην εξεύρεση λύσεων για την αξιολόγηση του ExploitGym. Ωστόσο, δεν είναι σαφές τι θα είχε συμβεί αν τα μοντέλα τεχνητής νοημοσύνης είχαν άλλους στόχους. Και η Hugging Face δεν υστερεί, από την άποψη της ασφάλειας υπολογιστών. Πρόκειται για μια εταιρεία τεχνολογίας αξίας 4,5 δισεκατομμυρίων δολαρίων με εκατοντάδες υπαλλήλους και μια εξειδικευμένη ομάδα κυβερνοασφάλειας. Τα πράγματα θα μπορούσαν να είχαν εξελιχθεί πολύ χειρότερα για μια εταιρεία με λιγότερους πόρους.
Τα μοντέλα τεχνητής νοημοσύνης ξεπερνούν τον έλεγχο των ανθρώπων
Αυτό δεν είναι το πρώτο σημάδι ότι οι δυνατότητες των μοντέλων τεχνητής νοημοσύνης αρχίζουν να ξεπερνούν τον έλεγχο των ανθρώπων. Τον Απρίλιο, ένας ερευνητής της Anthropic δημοσίευσε στο διαδίκτυο ότι είχε εκπλαγεί όταν το Claude Mythos, ένα μοντέλο που τότε δεν είχε κυκλοφορήσει ακόμη, του έστειλε email για να τον ενημερώσει ότι είχε καταφέρει να ξεφύγει από ένα sandbox στο πλαίσιο της δικής του αξιολόγησης κυβερνοικανότητας, ενώ εκείνος καθόταν σε ένα πάρκο τρώγοντας ένα σάντουιτς.
Όπως και το μη δημοσιευμένο μοντέλο της OpenAI που εμπλέκεται στο περιστατικό της Hugging Face, το Mythos δεν έπρεπε να έχει απεριόριστη πρόσβαση στο διαδίκτυο. Ωστόσο, σε εκείνη την περίπτωση, το μοντέλο δεν είχε προχωρήσει στο να παραβιάσει τους διακομιστές άλλων εταιρειών.
Ούτε περιορίζονται οι εκπληκτικές δυνατότητες των μοντέλων τεχνητής νοημοσύνης στο χάκινγκ. Τον Μάιο, ένα μη κυκλοφορημένο μοντέλο της OpenAI διέψευσε την 80 ετών υπόθεση της απόστασης των επίπεδων μονάδων, ένα κεντρικό πρόβλημα της συνδυαστικής γεωμετρίας που τέθηκε για πρώτη φορά από τον μαθηματικό Paul Erdős το 1946. Στις 20 Ιουλίου, ο Levent Alpöge, μαθηματικός στο Πανεπιστήμιο του Χάρβαρντ, έγραψε ότι είχε χρησιμοποιήσει το Claude Fable 5, ένα μοντέλο που κυκλοφόρησε η Anthropic τον Ιούλιο, για να διαψεύσει την υπόθεση του Jacobian, η οποία είχε επίσης προβληματίσει τους μαθηματικούς για περισσότερα από 80 χρόνια.
Η OpenAI δεν έχει αποκαλύψει δημοσίως τις λεπτομέρειες για το πώς το μη κυκλοφορημένο μοντέλο της ξέφυγε από τους περιορισμούς. Αλλά ακόμη και αν το είχε κάνει, το γεγονός ότι τα συστήματα τεχνητής νοημοσύνης αρχίζουν να ξεπερνούν τους ανθρώπους σε εργασίες κυβερνοασφάλειας σημαίνει ότι "μόνο πολύ, πολύ λίγοι ειδικοί στον κυβερνοχώρο παγκοσμίως" θα μπορούσαν να είχαν κατανοήσει σωστά τον τρόπο με τον οποίο συνέβη η παραβίαση, λέει ο Alex Meinke της Apollo Research, μιας ομάδας για την ασφάλεια της τεχνητής νοημοσύνης με έδρα το Λονδίνο.
Η αμερικανική κυβέρνηση έχει πρόσφατα αρχίσει να ρυθμίζει την κυκλοφορία μοντέλων σε πραγματικό χρόνο. Ωστόσο, το περιστατικό αυτό καταδεικνύει τους κινδύνους που ενέχουν ακόμη και τα μη κυκλοφορημένα μοντέλα τεχνητής νοημοσύνης που βρίσκονται ακόμα σε φάση ανάπτυξης.