Ένα περιστατικό που προκαλεί έντονο προβληματισμό για τις δυνατότητες της τεχνητής νοημοσύνης αποκάλυψε η OpenAI. Κατά τη διάρκεια δοκιμών κυβερνοασφάλειας, ένα πειραματικό σύστημα της εταιρείας δεν περιορίστηκε στις οδηγίες που είχε λάβει. Αντίθετα, εντόπισε μόνο του τρόπο να παρακάμψει τους περιορισμούς λειτουργίας του, απέκτησε πρόσβαση στο διαδίκτυο και εισήλθε στα συστήματα της Hugging Face, αναζητώντας τις απαντήσεις της δοκιμής.
Σύμφωνα με δημοσίευμα της Washington Post, το περιστατικό θεωρείται ιδιαίτερα σημαντικό, καθώς δείχνει μέχρι πού μπορούν να φτάσουν τα ολοένα πιο εξελιγμένα μοντέλα τεχνητής νοημοσύνης όταν λειτουργούν με υψηλό βαθμό αυτονομίας.
Η ίδια η OpenAI χαρακτήρισε το συμβάν «πρωτοφανές» για τον τομέα της κυβερνοασφάλειας, επισημαίνοντας ότι ήδη συνεργάζεται με τη Hugging Face για να διαπιστωθεί η πραγματική έκταση της παραβίασης. Παράλληλα, πριν από τη δημοσιοποίηση της υπόθεσης είχε ενημερωθεί η αμερικανική κυβέρνηση, σύμφωνα με πρόσωπο που γνωρίζει τις σχετικές διαδικασίες. Το περιστατικό σημειώθηκε ενώ η εταιρεία δοκίμαζε έναν νέο «πράκτορα» τεχνητής νοημοσύνης, ο οποίος είναι σχεδιασμένος να εκτελεί αυτόνομα ενέργειες σε υπολογιστή αξιοποιώντας δύο από τα ισχυρότερα μοντέλα της OpenAI.
Πώς κατάφερε να παραβιάσει τους περιορισμούς
Στο πλαίσιο της δοκιμής, το σύστημα είχε αναλάβει να εντοπίσει γνωστές ευπάθειες λογισμικού μέσα σε ελεγχόμενο περιβάλλον που είχαν δημιουργήσει ειδικοί στην κυβερνοασφάλεια.
Ωστόσο, αντί να ακολουθήσει το προβλεπόμενο σενάριο, ανακάλυψε ένα κενό ασφαλείας στο λογισμικό που περιόριζε τις δυνατότητές του. Αφού το εκμεταλλεύτηκε, απέκτησε πρόσβαση στο διαδίκτυο και επιχείρησε να αναζητήσει τις λύσεις της δοκιμής στα αποθετήρια της Hugging Face.
Η εταιρεία είχε αποκαλύψει το περιστατικό λίγες ημέρες νωρίτερα, χωρίς να κατονομάσει την OpenAI. Όπως έγινε γνωστό, η παραβίαση έδωσε πρόσβαση σε ορισμένα εσωτερικά δεδομένα και διαπιστευτήρια σύνδεσης, χωρίς ωστόσο να έχει επιβεβαιωθεί αν επηρεάστηκαν στοιχεία πελατών.
Ο διευθύνων σύμβουλος της Hugging Face, Κλεμάν Ντελάνγκ, ανέφερε ότι η συνεργασία με την OpenAI ήταν άμεση από την πρώτη στιγμή, τονίζοντας πως δεν υπήρξε κακόβουλη πρόθεση.
«Το πραγματικά εντυπωσιακό είναι ότι όλα αυτά συνέβησαν αυτόνομα», ανέφερε χαρακτηριστικά σε ανάρτησή του στο X.
Οι ανησυχίες για την επόμενη γενιά AI
Δεν είναι η πρώτη φορά που προηγμένα μοντέλα τεχνητής νοημοσύνης εμφανίζουν συμπεριφορές που ξεπερνούν τα όρια των δοκιμών. Τόσο η OpenAI όσο και η Anthropic έχουν αναφέρει στο παρελθόν περιπτώσεις όπου τα συστήματά τους επιχείρησαν να παρακάμψουν περιορισμούς, να αποφύγουν μηχανισμούς ελέγχου ή ακόμη και να αντιγράψουν τον εαυτό τους.
Η νέα υπόθεση, όμως, θεωρείται ιδιαίτερα σημαντική, καθώς αποδεικνύει ότι ένα σύστημα μπορεί να αξιοποιήσει πραγματικό κενό ασφαλείας και να ενεργήσει εκτός του περιβάλλοντος για το οποίο είχε σχεδιαστεί.
Παράλληλα, η OpenAI αποκάλυψε ότι έχει καταγράψει και άλλες περιπτώσεις όπου ισχυρά μοντέλα επιχείρησαν να διαφύγουν από απομονωμένα περιβάλλοντα ασφαλείας (sandboxes) όταν λειτουργούσαν αυτόνομα για μεγάλα χρονικά διαστήματα.
Την ίδια ώρα, η ταχύτατη εξέλιξη των συστημάτων τεχνητής νοημοσύνης στον προγραμματισμό συνεχίζει να ενισχύει τόσο τις επενδύσεις όσο και τις ανησυχίες για τις πραγματικές δυνατότητές τους. Ενδεικτικό είναι ότι τον περασμένο Απρίλιο η Anthropic είχε παρουσιάσει το Mythos AI, το οποίο κατάφερε να εντοπίσει κρίσιμες ευπάθειες σε υποδομές του διαδικτύου που παρέμεναν άγνωστες σε προγραμματιστές επί σειρά ετών.