OpenAI, Google DeepMind και Anthropic ενώνουν τους ελέγχους ασφάλειας AI
Οι OpenAI, Google DeepMind και Anthropic ανακοίνωσαν συμφωνία για ανταλλαγή τεχνογνωσίας και τη θέσπιση κοινών προτύπων δοκιμών ασφάλειας για συστήματα τεχνητής νοημοσύνης. Η πρωτοβουλία επιδιώκει να συνδυάσει την ταχεία ανάπτυξη των μοντέλων με αντίστοιχες δικλείδες ασφαλείας και να αντιμετωπίσει την απουσία κεντρικού ρυθμιστικού πλαισίου εντός της βιομηχανίας.
Τα μεγάλα γλωσσικά μοντέλα αποκτούν πιο σύνθετες ικανότητες συλλογισμού και οι εταιρείες καλούνται να διαχειριστούν, πέρα από τεχνικά σφάλματα, ενδεχόμενη χρήση
Η συμφωνία προβλέπει αυστηρούς μηχανισμούς αξιολόγησης, ή red-teaming, για μελλοντικά μοντέλα AGI, με στόχο την αποτροπή υπαρξιακών κινδύνων και την εναρμόνιση με διεθνή ρυθμιστικά πλαίσια, μεταξύ των οποίων το ευρωπαϊκό AI Act.
Οι εταιρείες θα επιχειρήσουν να εναρμονίσουν τις εσωτερικές διαδικασίες ελέγχου τους. Η OpenAI χρησιμοποιούσε το Preparedness Framework, η Anthropic ανέπτυσσε τα μοντέλα της με βάση το Constitutional AI και η Google DeepMind ακολουθούσε δικά της ερευνητικά πρωτόκολλα. Το κοινό πλαίσιο προβλέπει ανταλλαγή μεθοδολογιών αξιολόγησης και μια τυποποιημένη κλίμακα κινδύνου, η οποία θα κρίνει με αντικειμενικά κριτήρια αν ένα νέο μοντέλο είναι έτοιμο για διάθεση στο ευρύ κοινό.
Οι ερευνητικές ομάδες θα ανταλλάσσουν δεδομένα για ευπάθειες που εντοπίζονται στις επιθετικές δοκιμές. Σε αυτές, ειδικοί ερευνητές επιχειρούν σκόπιμα να παραβιάσουν τα όρια ενός συστήματος, ώστε να εξετάσουν αν η AI μπορεί να παρακαμφθεί για να δώσει οδηγίες κατασκευής όπλων ή να εκτελέσει αυτόνομες επιθέσεις σε κρίσιμες υποδομές πληροφορικής.
Όρια κινδύνου και έλεγχοιΗ πρωτοβουλία συνδέεται με τις συνεχιζόμενες εκκλήσεις επιστημόνων για πιθανά σενάρια απώλειας του ανθρώπινου ελέγχου επί της τεχνητής νοημοσύνης. Οι προειδοποιήσεις για εξαφάνιση εξετάζονται στα εργαστήρια των εταιρειών, καθώς η αύξηση της υπολογιστικής ισχύος και των παραμέτρων των μοντέλων μπορεί να οδηγήσει σε συμπεριφορές που δεν είχαν προβλεφθεί από τους δημιουργούς τους.
Η έρευνα επικεντρώνεται επίσης στην ευθυγράμμιση, ώστε οι στόχοι και οι ενέργειες ενός υπερ-έξυπνου συστήματος να παραμένουν συμβατοί με ανθρώπινες αξίες και την επιβίωση της ανθρωπότητας. Η συλλογική προσέγγιση προβλέπει αλγορίθμους ασφαλείας ενσωματωμένους στον πυρήνα των μοντέλων, για να αποτρέπεται η αυτόνομη τροποποίηση του κώδικά τους ή η μη εξουσιοδοτημένη πρόσβαση σε εξωτερικούς servers με σκοπό την αύξηση της υπολογιστικής τους ισχύος.
Θα καθοριστούν κοινοί δείκτες επικινδυνότητας, με σαφή όρια που θα ακυρώνουν την εμπορική κυκλοφορία ενός μοντέλου όταν ξεπερνιούνται στις εργαστηριακές δοκιμές.Θα υπάρχει διαρκής ανταλλαγή πληροφοριών για νέες μεθόδους παράκαμψης δικλείδων ασφαλείας.Προβλέπεται επικοινωνία με τα Ινστιτούτα Ασφάλειας Τεχνητής Νοημοσύνης στην Ευρώπη, στις ΗΠΑ και στο Ηνωμένο Βασίλειο, ώστε να διευκολύνονται ανεξάρτητοι έλεγχοι.Ειδικές δοκιμές θα εξετάζουν αν ένα μοντέλο μπορεί να αντιγράψει τον εαυτό του στο διαδίκτυο ή να αποκτήσει πρόσβαση σε οικονομικούς πόρους για την επιβίωσή του.Η ευρωπαϊκή διάστασηΤο AI Act θέτει αυστηρούς κανόνες για μοντέλα γενικού σκοπού που ενδέχεται να δημιουργούν συστημικούς κινδύνους και απαιτεί εκτενείς αναφορές και διαφάνεια για την εκπαίδευση των αλγορίθμων. Η συνεργασία των OpenAI, Google DeepMind και Anthropic επιδιώκει να δημιουργήσει ένα βιομηχανικό πρότυπο που καλύπτει εκ των προτέρων πολλές από αυτές τις απαιτήσεις.
Για επιχειρήσεις που χρησιμοποιούν API της OpenAI, το Claude της Anthropic ή το Gemini της Google στις καθημερινές ροές εργασίας τους, η εξέλιξη συνδέεται με μεγαλύτερη σταθερότητα και λιγότερες αιφνίδιες νομικές εμπλοκές. Ρυθμιστικές αβεβαιότητες είχαν στο παρελθόν προκαλέσει καθυστερήσεις στη διάθεση κορυφαίων μοντέλων στην Ευρωπαϊκή Ένωση. Η προληπτική εναρμόνιση με υψηλά πρότυπα ασφαλείας στοχεύει σε ταυτόχρονη πρόσβαση προγραμματιστών, ερευνητών και τελικών χρηστών στις νέες γενιές AI, χωρίς γεωγραφικούς αποκλεισμούς ή περιορισμούς δυνατοτήτων λόγω κανονιστικής ασυμβατότητας.
Πηγή: Techgear
- Δημοφιλέστερες Ειδήσεις Κατηγορίας Τεχνολογία
- Marvel’s Wolverine review
- Apple Reference Image: πώς τα iPhone 18 Pro και Pro Max πιστοποιούν φωτογραφίες
- Το Suyu 0.0.4 κάνει μεγάλο άλμα στην εξομοίωση του Nintendo Switch σε PC
- Επίσημη επιβεβαίωση: Οι ΗΠΑ έχουν αναπτύξει στρατιωτικά οπλικά συστήματα σε τροχιά γύρω από τη Γη
- Slow Horses: Επιστρέφει για 8η σεζόν η κατασκοπευτική σειρά του Apple TV
- Καταιγιστικές εξελίξεις για τις νέες σεζόν των Chicago Med, Fire και P.D. (trailer)
- Microsoft Word από το μηδέν: Ο πλήρης οδηγός για αρχάριους
- Κινέζικο AI σχεδόν σαν το αμερικανικό, με το 1/5 του κόστους
- Samsung M16 OLED: Η οθόνη των 10.000 nits κάνει ντεμπούτο στο iQOO 16
- Χίλιες εικόνες από το αρχείο του Met περνούν δωρεάν στο Unsplash
- Δημοφιλέστερες Ειδήσεις Xblog
- Τελευταία Νέα Xblog
- OpenAI, Google DeepMind και Anthropic ενώνουν τους ελέγχους ασφάλειας AI
- Apple Reference Image: πώς τα iPhone 18 Pro και Pro Max πιστοποιούν φωτογραφίες
- Η Siri AI στο iOS 27 απαιτεί λίστα αναμονής για να ενεργοποιηθεί
- Η Amazon μειώνει έως $20 τις προπαραγγελίες για νέα Apple Watch
- Η Apple μειώνει τις αξίες ανταλλαγής iPhone και αυξάνει Mac και iPad
- Το Widow’s Bay οδηγεί το Apple TV σε 29 βραβεία Emmy και νέο ρεκόρ
- Το εργαλείο της Apple για αφαίρεση του άλμπουμ των U2 κλείνει 12 χρόνια
- Η Apple έκρυψε την Clarus, τη διάσημη Dogcow, στο iOS 27
- Bill Gates: Το ίδρυμά του διαθέτει 1 δισ. δολάρια για AI στις κυβερνήσεις
- Τελευταία Νέα Κατηγορίας Τεχνολογία
- Apple: 6 νέα προϊόντα μέχρι το τέλος του 2026 – και το HomePad;
- Meta One: Ανακοινώθηκαν επίσημα οι νέες συνδρομές για Facebook, Instagram και WhatsApp
- Συνεργασία OpenAI, Google DeepMind και Anthropic για την ασφάλεια της AI
- TranscriptFormer: Η νέα AI προβλέπει τη γονιδιακή έκφραση και επιταχύνει την ανακάλυψη νέων θεραπειών
- Slow Horses: Επιστρέφει για 8η σεζόν η κατασκοπευτική σειρά του Apple TV
- Αποστολή Tianwen-3: Το χρονοδιάγραμμα της Κίνας για την επιστροφή δειγμάτων από τον Άρη το 2031
- Νέες φωνητικές δυνατότητες AI με τα Gemini 3.8 Live και Gemini 3.5 Transcribe
- Επίσημη επιβεβαίωση: Οι ΗΠΑ έχουν αναπτύξει στρατιωτικά οπλικά συστήματα σε τροχιά γύρω από τη Γη
- Marvel’s Wolverine review
- Το Suyu 0.0.4 κάνει μεγάλο άλμα στην εξομοίωση του Nintendo Switch σε PC



