OpenAI, Google DeepMind και Anthropic ενώνουν τους ελέγχους ασφάλειας AI

07:24 16/9/2026 - Πηγή: Xblog
Techgear

Οι OpenAI, Google DeepMind και Anthropic ανακοίνωσαν συμφωνία για ανταλλαγή τεχνογνωσίας και τη θέσπιση κοινών προτύπων δοκιμών ασφάλειας για συστήματα τεχνητής νοημοσύνης. Η πρωτοβουλία επιδιώκει να συνδυάσει την ταχεία ανάπτυξη των μοντέλων με αντίστοιχες δικλείδες ασφαλείας και να αντιμετωπίσει την απουσία κεντρικού ρυθμιστικού πλαισίου εντός της βιομηχανίας.

Τα μεγάλα γλωσσικά μοντέλα αποκτούν πιο σύνθετες ικανότητες συλλογισμού και οι εταιρείες καλούνται να διαχειριστούν, πέρα από τεχνικά σφάλματα, ενδεχόμενη χρήση

τους για παραγωγή κακόβουλου κώδικα, κυβερνοεπιθέσεις ή ανάπτυξη βιολογικών απειλών. Η σύμπραξη παρουσιάζεται ως βήμα προς μια πιο υπεύθυνη πορεία για την Τεχνητή Γενική Νοημοσύνη, γνωστή ως AGI.

Κοινό πλαίσιο αξιολόγησης

Η συμφωνία προβλέπει αυστηρούς μηχανισμούς αξιολόγησης, ή red-teaming, για μελλοντικά μοντέλα AGI, με στόχο την αποτροπή υπαρξιακών κινδύνων και την εναρμόνιση με διεθνή ρυθμιστικά πλαίσια, μεταξύ των οποίων το ευρωπαϊκό AI Act.

Οι εταιρείες θα επιχειρήσουν να εναρμονίσουν τις εσωτερικές διαδικασίες ελέγχου τους. Η OpenAI χρησιμοποιούσε το Preparedness Framework, η Anthropic ανέπτυσσε τα μοντέλα της με βάση το Constitutional AI και η Google DeepMind ακολουθούσε δικά της ερευνητικά πρωτόκολλα. Το κοινό πλαίσιο προβλέπει ανταλλαγή μεθοδολογιών αξιολόγησης και μια τυποποιημένη κλίμακα κινδύνου, η οποία θα κρίνει με αντικειμενικά κριτήρια αν ένα νέο μοντέλο είναι έτοιμο για διάθεση στο ευρύ κοινό.

Οι ερευνητικές ομάδες θα ανταλλάσσουν δεδομένα για ευπάθειες που εντοπίζονται στις επιθετικές δοκιμές. Σε αυτές, ειδικοί ερευνητές επιχειρούν σκόπιμα να παραβιάσουν τα όρια ενός συστήματος, ώστε να εξετάσουν αν η AI μπορεί να παρακαμφθεί για να δώσει οδηγίες κατασκευής όπλων ή να εκτελέσει αυτόνομες επιθέσεις σε κρίσιμες υποδομές πληροφορικής.

Όρια κινδύνου και έλεγχοι

Η πρωτοβουλία συνδέεται με τις συνεχιζόμενες εκκλήσεις επιστημόνων για πιθανά σενάρια απώλειας του ανθρώπινου ελέγχου επί της τεχνητής νοημοσύνης. Οι προειδοποιήσεις για εξαφάνιση εξετάζονται στα εργαστήρια των εταιρειών, καθώς η αύξηση της υπολογιστικής ισχύος και των παραμέτρων των μοντέλων μπορεί να οδηγήσει σε συμπεριφορές που δεν είχαν προβλεφθεί από τους δημιουργούς τους.

Η έρευνα επικεντρώνεται επίσης στην ευθυγράμμιση, ώστε οι στόχοι και οι ενέργειες ενός υπερ-έξυπνου συστήματος να παραμένουν συμβατοί με ανθρώπινες αξίες και την επιβίωση της ανθρωπότητας. Η συλλογική προσέγγιση προβλέπει αλγορίθμους ασφαλείας ενσωματωμένους στον πυρήνα των μοντέλων, για να αποτρέπεται η αυτόνομη τροποποίηση του κώδικά τους ή η μη εξουσιοδοτημένη πρόσβαση σε εξωτερικούς servers με σκοπό την αύξηση της υπολογιστικής τους ισχύος.

Θα καθοριστούν κοινοί δείκτες επικινδυνότητας, με σαφή όρια που θα ακυρώνουν την εμπορική κυκλοφορία ενός μοντέλου όταν ξεπερνιούνται στις εργαστηριακές δοκιμές.Θα υπάρχει διαρκής ανταλλαγή πληροφοριών για νέες μεθόδους παράκαμψης δικλείδων ασφαλείας.Προβλέπεται επικοινωνία με τα Ινστιτούτα Ασφάλειας Τεχνητής Νοημοσύνης στην Ευρώπη, στις ΗΠΑ και στο Ηνωμένο Βασίλειο, ώστε να διευκολύνονται ανεξάρτητοι έλεγχοι.Ειδικές δοκιμές θα εξετάζουν αν ένα μοντέλο μπορεί να αντιγράψει τον εαυτό του στο διαδίκτυο ή να αποκτήσει πρόσβαση σε οικονομικούς πόρους για την επιβίωσή του.Η ευρωπαϊκή διάσταση

Το AI Act θέτει αυστηρούς κανόνες για μοντέλα γενικού σκοπού που ενδέχεται να δημιουργούν συστημικούς κινδύνους και απαιτεί εκτενείς αναφορές και διαφάνεια για την εκπαίδευση των αλγορίθμων. Η συνεργασία των OpenAI, Google DeepMind και Anthropic επιδιώκει να δημιουργήσει ένα βιομηχανικό πρότυπο που καλύπτει εκ των προτέρων πολλές από αυτές τις απαιτήσεις.

Για επιχειρήσεις που χρησιμοποιούν API της OpenAI, το Claude της Anthropic ή το Gemini της Google στις καθημερινές ροές εργασίας τους, η εξέλιξη συνδέεται με μεγαλύτερη σταθερότητα και λιγότερες αιφνίδιες νομικές εμπλοκές. Ρυθμιστικές αβεβαιότητες είχαν στο παρελθόν προκαλέσει καθυστερήσεις στη διάθεση κορυφαίων μοντέλων στην Ευρωπαϊκή Ένωση. Η προληπτική εναρμόνιση με υψηλά πρότυπα ασφαλείας στοχεύει σε ταυτόχρονη πρόσβαση προγραμματιστών, ερευνητών και τελικών χρηστών στις νέες γενιές AI, χωρίς γεωγραφικούς αποκλεισμούς ή περιορισμούς δυνατοτήτων λόγω κανονιστικής ασυμβατότητας.

Πηγή: Techgear

Keywords
Τυχαία Θέματα