| Ειδήσεις | Ο Κυνηγός | Λεωφόρος Αθηνών | "Κουλου - Βάχατα" | +/- | "Μας ακούνε" | Fundamentalist | Marx - Soros |

 
 

Τετάρτη, 30/09/2026

 

Νέα ερωτήματα για την ασφάλεια των συστημάτων τεχνητής νοημοσύνης προκαλεί έρευνα της Mindgard, καθώς δύο δημοφιλή μοντέλα της κινεζικής εταιρείας Moonshot AI φέρεται να κατάφεραν να παρακάμψουν τους ενσωματωμένους μηχανισμούς ασφαλείας τους και να απαντήσουν σε αιτήματα για ιδιαίτερα επικίνδυνα θέματα.

Η Mindgard, που ειδικεύεται στον έλεγχο και την αξιολόγηση της ασφάλειας συστημάτων AI, ανέφερε στο BBC ότι τον Ιούλιο κατάφερε να παρακάμψει τους περιορισμούς των Kimi K2.6 και K3 Swarm, χρησιμοποιώντας ειδικά σχεδιασμένες οδηγίες.

Η τεχνική αυτή είναι γνωστή ως jailbreaking και αποτελεί μία από τις βασικές μεθόδους με τις οποίες δοκιμάζεται η ανθεκτικότητα των μοντέλων AI απέναντι σε κακόβουλες ή χειριστικές εντολές.

 

Τι είναι το AI jailbreak

Στην τεχνητή νοημοσύνη, το jailbreak αφορά την προσπάθεια να παρακαμφθούν οι ενσωματωμένοι περιορισμοί ενός μοντέλου, ώστε αυτό να παράσχει απαντήσεις ή να εκτελέσει ενέργειες που υπό κανονικές συνθήκες θα αρνιόταν.

Οι ερευνητές χρησιμοποιούν σύνθετα prompts και διαφορετικές τεχνικές χειραγώγησης της συνομιλίας, με στόχο να διαπιστώσουν εάν το σύστημα μπορεί να «ξεφύγει» από τους κανόνες ασφαλείας που έχουν θέσει οι προγραμματιστές του.

Ο όρος προέρχεται από την πληροφορική και χρησιμοποιήθηκε αρχικά για την παράκαμψη περιορισμών σε συσκευές και λογισμικό. Στον χώρο της AI έχει αποκτήσει διαφορετική διάσταση, καθώς συνδέεται με την ικανότητα ενός μοντέλου να αγνοεί τους κανόνες που έχουν σχεδιαστεί για να περιορίζουν επικίνδυνες απαντήσεις.

«Ανησυχητικά» τα αποτελέσματα

Ο ιδρυτής της Mindgard, Πίτερ Γκάραχαν, δήλωσε στο BBC ότι τα αποτελέσματα των δοκιμών στα δύο μοντέλα Kimi είναι ανησυχητικά.

Σύμφωνα με τον ίδιο, όταν ένας περιορισμός ασφαλείας παρακαμφθεί, ένα μοντέλο μπορεί να αρχίσει να συζητά θέματα που κανονικά θα απέφευγε και να παρέχει ακόμη και προτάσεις σχετικά με επικίνδυνες δραστηριότητες.

Η Mindgard, πάντως, διευκρινίζει ότι η έρευνά της δεν αποδεικνύει πως οι πληροφορίες που παρείχαν τα μοντέλα μπορούν πράγματι να μετατραπούν σε αποτελεσματική επίθεση στην πραγματικότητα.

Το ζήτημα αφορά κυρίως το γεγονός ότι οι μηχανισμοί ασφαλείας δεν εμπόδισαν εξαρχής τα μοντέλα να ανταποκριθούν σε τέτοια αιτήματα.

Από το chatbot στις κυβερνοεπιθέσεις

Ιδιαίτερο ενδιαφέρον παρουσιάζει το ενδεχόμενο ένα μοντέλο χωρίς επαρκείς περιορισμούς να χρησιμοποιηθεί ως εργαλείο για κυβερνοεπιθέσεις.

Η Mindgard υποστηρίζει ότι μία έκδοση του Kimi K2.6 χωρίς τα κατάλληλα συστήματα ασφαλείας θα μπορούσε θεωρητικά να επιτρέψει σε επιτιθέμενους να εκτελούν κώδικα στους υπολογιστικούς πόρους όπου λειτουργεί το μοντέλο και να αποκτούν πρόσβαση στο διαδίκτυο.

Σε ένα τέτοιο σενάριο, το AI δεν θα αποτελούσε απλώς ένα εργαλείο παραγωγής κειμένου, αλλά θα μπορούσε να λειτουργήσει ως σημείο εκκίνησης για πιο σύνθετες κακόβουλες ενέργειες.

Η Mindgard ενημέρωσε τη Moonshot για τα ευρήματά της στις 27 Ιουλίου, ενώ δημοσίευσε τη σχετική έκθεση στις 12 Σεπτεμβρίου. Σύμφωνα με την εταιρεία, η επικοινωνία με τη Moonshot έγινε μόλις πρόσφατα, μετά την επικοινωνία του BBC για το θέμα.

Από την πλευρά της, η Moonshot ανέφερε ότι καλωσορίζει τις αξιολογήσεις από ανεξάρτητους φορείς και χαρακτήρισε τις εξωτερικές δοκιμές «βασικό πυλώνα» για τη δημιουργία ασφαλέστερων συστημάτων AI.

Η εταιρεία υποστήριξε επίσης ότι τα μοντέλα της εμφανίζουν γενικά υψηλό ποσοστό άρνησης σε αντίστοιχα αιτήματα κατά τις εσωτερικές δοκιμές ασφαλείας.

Διαφορετικός κίνδυνος από τους αυτόνομους AI agents

Το περιστατικό αναδεικνύει έναν κίνδυνο που διαφέρει από εκείνον των ολοένα πιο αυτόνομων AI agents.

Οι agents σχεδιάζονται ώστε να μπορούν να εκτελούν αλληλουχίες ενεργειών με περιορισμένη ανθρώπινη παρέμβαση. Τους τελευταίους μήνες έχουν καταγραφεί ελεγχόμενες δοκιμές στις οποίες agents που αναπτύχθηκαν από αμερικανικές εταιρείες όπως οι OpenAI, Meta και Anthropic κατάφεραν να παραβιάσουν διαδικτυακές υπηρεσίες.

Στην περίπτωση του jailbreaking, το βασικό πρόβλημα είναι διαφορετικό: ένα μοντέλο που υποτίθεται ότι διαθέτει συγκεκριμένα όρια ασφαλείας μπορεί, μέσω κατάλληλων οδηγιών, να πειστεί να τα παρακάμψει.

Το «ανοικτό» μοντέλο και το δίλημμα της ασφάλειας

Η υπόθεση επαναφέρει στο προσκήνιο και τη συζήτηση για την ασφάλεια των open-weight μοντέλων.

Το Kimi ανήκει στην κατηγορία των μοντέλων των οποίων τα βάρη είναι διαθέσιμα, επιτρέποντας σε τρίτους να τα εγκαταστήσουν και να τα λειτουργήσουν στις δικές τους υποδομές.

Αυτό δημιουργεί ένα σημαντικό δίλημμα. Από τη μία πλευρά, η μεγαλύτερη πρόσβαση στα μοντέλα επιτρέπει σε ερευνητές και επιχειρήσεις να τα μελετούν, να τα προσαρμόζουν και να αναπτύσσουν εφαρμογές χωρίς να εξαρτώνται αποκλειστικά από τον αρχικό πάροχο.

Από την άλλη, όσο περισσότερο διαδίδονται τα μοντέλα, τόσο δυσκολότερο γίνεται να ελεγχθεί ο τρόπος με τον οποίο χρησιμοποιούνται και τα επίπεδα ασφαλείας που εφαρμόζονται σε κάθε εγκατάσταση.

Ο καθηγητής Άλαν Γούντγουορντ από το Πανεπιστήμιο του Σάρεϊ έχει επισημάνει ότι τα ανοικτά μοντέλα μπορεί να βρεθούν σε λάθος χέρια, αλλά ταυτόχρονα μπορούν να αξιοποιηθούν και για την ενίσχυση της κυβερνοάμυνας.

Το πρόβλημα γίνεται ακόμη πιο σύνθετο από την ταχύτητα με την οποία εξελίσσεται η τεχνολογία. Οι διεθνείς κανόνες και τα τεχνικά πρότυπα χρειάζονται συχνά χρόνια για να συμφωνηθούν και να εφαρμοστούν, ενώ οι δυνατότητες των μοντέλων AI αλλάζουν μέσα σε λίγους μήνες.

Το μεγάλο στοίχημα

Η υπόθεση των Kimi αναδεικνύει έτσι ένα ευρύτερο ζήτημα για ολόκληρη τη βιομηχανία AI: η ασφάλεια δεν κρίνεται μόνο από το τι μπορεί ή δεν μπορεί να κάνει ένα μοντέλο, αλλά και από το πόσο δύσκολο είναι να παρακαμφθούν οι δικλίδες ασφαλείας του.

Για τη Mindgard και άλλους ειδικούς, η αντιμετώπιση του προβλήματος δεν μπορεί να περιοριστεί αποκλειστικά στην προσθήκη περισσότερων φίλτρων. Εξίσου σημαντικός είναι ο εντοπισμός όσων επιχειρούν να χρησιμοποιήσουν την τεχνητή νοημοσύνη για κακόβουλους σκοπούς.

Καθώς τα μοντέλα αποκτούν μεγαλύτερες δυνατότητες και περισσότερη πρόσβαση σε δεδομένα, υπολογιστικούς πόρους και διαδικτυακές υπηρεσίες, η ανθεκτικότητα απέναντι σε jailbreaks μετατρέπεται σε κρίσιμο παράγοντα για την ασφάλεια της επόμενης γενιάς συστημάτων τεχνητής νοημοσύνης.

 

Greek Finance Forum Team

 
 
 
GFF Feed

Loading...

 
 
 
 
 
 
 

Αποποίηση Ευθύνης.... 

© 2016-2026 Greek Finance Forum