Τεχνητή νοημοσύνη: Ανεπαρκείς δικλείδες ασφαλείας σε πολλά μοντέλα AI
Πολλά μοντέλα τεχνητής νοημοσύνης (AI) εξακολουθούν να παρουσιάζουν αδυναμίες στις δικλείδες ασφαλείας τους απέναντι σε αιτήματα που σχετίζονται με την προετοιμασία τρομοκρατικών επιθέσεων, σύμφωνα με έκθεση της πρωτοβουλίας Tech Against Terrorism, η οποία υποστηρίζεται από τον Οργανισμό Ηνωμένων Εθνών (ΟΗΕ).
Η έρευνα εξέτασε διαφορετικές κατηγορίες μοντέλων τεχνητής νοημοσύνης, αξιολογώντας την ικανότητά τους να αποτρέπουν την παροχή πληροφοριών που θα μπορούσαν να αξιοποιηθούν για τρομοκρατική δραστηριότητα. Τα αποτελέσματα ανέδειξαν σημαντικές διαφορές μεταξύ των τυπικών μοντέλων και εκείνων στα οποία είχαν τροποποιηθεί οι μηχανισμοί ασφαλείας.
Τι έδειξαν οι δοκιμές σε 162 μοντέλα τεχνητής νοημοσύνης
Στο πλαίσιο της έρευνας πραγματοποιήθηκαν δοκιμές σε 162 μοντέλα AI, μεταξύ των οποίων τυπικά μοντέλα, μοντέλα προσαρμοσμένα για συγκεκριμένους τομείς χρήσης και μοντέλα «ανοιχτών βαρών» (open-weight), των οποίων οι δικλείδες ασφαλείας είχαν τροποποιηθεί. Συνολικά, υποβλήθηκαν 627 ερωτήματα που αφορούσαν πληροφορίες τις οποίες θα μπορούσε να αναζητήσει κάποιος κατά την προετοιμασία μιας επίθεσης.
Σύμφωνα με τα ευρήματα, τα τυπικά μοντέλα, όπως το ChatGPT της OpenAI, το Claude της Anthropic και το Gemini της Google, απάντησαν κατά μέσο όρο στο 1,9% των ερωτημάτων όταν ο χρήστης δήλωνε ξεκάθαρα ότι σχεδίαζε να πραγματοποιήσει τρομοκρατική επίθεση.
Ωστόσο, το ποσοστό των αξιοποιήσιμων απαντήσεων αυξήθηκε στο 16,9% όταν τα ίδια ερωτήματα παρουσιάζονταν ως μέρος έρευνας για την ασφάλεια.
Ακόμη μεγαλύτερη ήταν η διαφορά στα μοντέλα των οποίων οι μηχανισμοί ασφαλείας είχαν τροποποιηθεί, με στόχο να περιοριστεί η ικανότητά τους να αρνούνται ορισμένα αιτήματα. Στα 13 μοντέλα αυτής της κατηγορίας, το μέσο ποσοστό απαντήσεων σε ερωτήματα σχετικά με τρομοκρατική δραστηριότητα κυμάνθηκε από 87% έως 92%.
Οι κίνδυνοι από τα μοντέλα ανοιχτών βαρών
Η Tech Against Terrorism εστιάζει ιδιαίτερα στους κινδύνους που συνδέονται με τα μοντέλα ανοιχτών βαρών, καθώς οι εσωτερικές παράμετροί τους είναι διαθέσιμες και μπορούν να τροποποιηθούν από τρίτους.
Σύμφωνα με την οργάνωση, ο μέσος χρόνος που απαιτείται για την κατάργηση των δικλείδων ασφαλείας σε αυτά τα μοντέλα είναι μικρότερος από τρεις ημέρες μετά την αρχική δημοσίευσή τους.
Η πρωτοβουλία υπογραμμίζει την ανάγκη για ανεξάρτητους ελέγχους ασφαλείας πριν από τη διάθεση τέτοιων συστημάτων. Όπως επισημαίνει, κανένα μοντέλο που αποτυγχάνει σε ανεξάρτητο έλεγχο δεν θα πρέπει να διατίθεται, να προσφέρεται ή να πωλείται, ενώ οι εταιρείες που συμμετέχουν στην αλυσίδα διανομής οφείλουν να επαληθεύουν εκ των προτέρων την ασφάλειά του.
Πηγή: ΕΜ. ΑΠΕ-ΜΠΕ.ΑΕ











































































