Σοβαρές αδυναμίες στους μηχανισμούς ασφαλείας ορισμένων μοντέλων Τεχνητής Νοημοσύνης (AI) καταγράφει νέα έκθεση της πρωτοβουλίας Tech Against Terrorism, η οποία εξετάζει κατά πόσο τα συστήματα αυτά ανταποκρίνονται σε αιτήματα που σχετίζονται με την προετοιμασία τρομοκρατικών ενεργειών.
Σύμφωνα με τα ευρήματα που παρουσιάζει το Γαλλικό Πρακτορείο Ειδήσεων, τα συνηθισμένα μοντέλα AI εμφανίζουν χαμηλά ποσοστά ανταπόκρισης όταν ο χρήστης δηλώνει ανοιχτά τρομοκρατική πρόθεση. Ωστόσο, τα αποτελέσματα διαφοροποιούνται σημαντικά όταν το ίδιο αίτημα παρουσιάζεται ως μέρος έρευνας για την ασφάλεια ή όταν έχουν αφαιρεθεί οι δικλείδες προστασίας.
Η έκθεση έρχεται σε μια περίοδο κατά την οποία η χρήση της AI από τρομοκρατικές οργανώσεις έχει ήδη αποτελέσει αντικείμενο ερευνών, με ιδιαίτερη έμφαση στις προσπάθειες παράκαμψης των περιορισμών ασφαλείας των δημοφιλών chatbots.
Τι έδειξαν οι δοκιμές σε μοντέλα AI
Η Tech Against Terrorism, πρωτοβουλία που υποστηρίζεται από τον ΟΗΕ, αναφέρει ότι εξέτασε 162 μοντέλα τεχνητής νοημοσύνης, υποβάλλοντάς τα σε σειρά 627 ερωτημάτων που σχετίζονταν με πληροφορίες τις οποίες θα μπορούσε να αναζητήσει κάποιος που προετοιμάζει τρομοκρατική επίθεση.
Στο τηλεγράφημα αναφέρονται 116 τυπικά μοντέλα, 13 μοντέλα προσαρμοσμένα για εξειδικευμένες χρήσεις και 13 μοντέλα των οποίων οι δικλείδες ασφαλείας είχαν τροποποιηθεί. Η συγκεκριμένη κατανομή δεν καλύπτει το σύνολο των 162 μοντέλων που αναφέρεται στην έκθεση.
Στα τυπικά μοντέλα, μεταξύ των οποίων περιλαμβάνονται το ChatGPT, το Claude και το Gemini, το μέσο ποσοστό απαντήσεων περιορίστηκε στο 1,9%, όταν ο χρήστης δήλωνε ξεκάθαρα ότι σκόπευε να πραγματοποιήσει τρομοκρατική επίθεση.
Το ποσοστό αξιοποιήσιμων απαντήσεων αυξήθηκε στο 16,9% όταν ο χρήστης παρουσίαζε το αίτημά του ως μέρος έρευνας για ζητήματα ασφαλείας.
Τα αποτελέσματα αυτά, σύμφωνα με την οργάνωση, αναδεικνύουν τη σημασία που μπορεί να έχει ο τρόπος διατύπωσης ενός αιτήματος για την ενεργοποίηση των μηχανισμών προστασίας.
Έως 92% το ποσοστό απαντήσεων στα τροποποιημένα μοντέλα
Η μεγαλύτερη διαφορά καταγράφηκε στα μοντέλα των οποίων οι μηχανισμοί ασφαλείας είχαν τροποποιηθεί, ώστε να περιοριστεί η δυνατότητά τους να αρνούνται επικίνδυνα αιτήματα.
Στα 13 τροποποιημένα μοντέλα που εξετάστηκαν, το μέσο ποσοστό απαντήσεων σε ερωτήματα σχετικά με τρομοκρατική δραστηριότητα κυμάνθηκε από 87% έως 92%.
Η Tech Against Terrorism εστιάζει ιδιαίτερα στα λεγόμενα μοντέλα ανοιχτών βαρών (open-weight models), των οποίων οι εσωτερικές παράμετροι διατίθενται δημόσια και μπορούν να τροποποιηθούν από τρίτους.
Σύμφωνα με την οργάνωση, ο μέσος χρόνος που απαιτείται για την αφαίρεση των δικλείδων ασφαλείας από τέτοια μοντέλα είναι λιγότερος από τρεις ημέρες μετά την αρχική δημοσίευσή τους.
Οι σχετικοί κίνδυνοι έχουν απασχολήσει και ερευνητές της τεχνητής νοημοσύνης, οι οποίοι έχουν προειδοποιήσει για την ανάγκη αυστηρότερων ελέγχων ασφαλείας στα μοντέλα AI.
Τι ζητά η Tech Against Terrorism
Με βάση τα αποτελέσματα των δοκιμών, η πρωτοβουλία ζητά να ενισχυθούν οι ανεξάρτητοι έλεγχοι ασφαλείας πριν από τη διάθεση μοντέλων τεχνητής νοημοσύνης.
Η οργάνωση υποστηρίζει ότι η ευθύνη δεν πρέπει να περιορίζεται στους αρχικούς δημιουργούς των συστημάτων, αλλά να επεκτείνεται και στις εταιρείες που αναλαμβάνουν τη διανομή και τη διάθεσή τους.
«Κανένα μοντέλο που αποτυγχάνει σε ανεξάρτητο έλεγχο ασφάλειας δεν πρέπει να διατίθεται, να προσφέρεται ή να πωλείται και κάθε εταιρεία στην αλυσίδα διανομής οφείλει να το επαληθεύει αυτό εκ των προτέρων», τονίζει η Tech Against Terrorism.
Η παρέμβαση της οργάνωσης επικεντρώνεται στην ανάγκη αξιολόγησης των μοντέλων όχι μόνο κατά την αρχική κυκλοφορία τους, αλλά και ως προς τους κινδύνους που δημιουργούνται όταν τρίτοι τροποποιούν τους μηχανισμούς προστασίας τους.
Διαβάστε τις Ειδήσεις σήμερα και ενημερωθείτε για τα πρόσφατα νέα.
Ακολουθήστε το Skai.gr στο Google News και μάθετε πρώτοι όλες τις ειδήσεις.