Μετάβαση στο περιεχόμενο
Λάρνακα, Κύπρος
BINA CYINNOVATION HUBΛάρνακα · ιδρ. 2026
AIAI23 Αυγούστου 20264 min read

Πράκτορες φτάνουν 100% στο AGI-3· πολιτείες παρεμβαίνουν στην υποδομή ΤΝ

Το AVO της NVIDIA σκοράρει τέλεια στο ARC-AGI-3, η Πενσυλβανία δίνει βέτο στις κοινότητες επί κέντρων δεδομένων ΤΝ, και η Varonis επιδιορθώνει τριά ελαττώματα του Copilot.

By BINA Editorial

Το σημερινό δελτίο καλύπτει και τα δύο άκρα του φάσματος δυνατοτήτων — ένα ιστορικό τέλειο σκόρ σε benchmark και μια μελέτη που δείχνει ότι τα μοντέλα πρώτης γραμμής εξακολουθούν να μην μπορούν να σκέφτονται σαν επιστήμονες — παράλληλα με μια αμερικανική πολιτεία που διατάσσει κοινοτική συναίνεση πριν από την κατασκευή κέντρων δεδομένων ΤΝ, μια κρίσιμη επιδιόρθωση Copilot, και νέα δεδομένα αγοράς εργασίας που αριθμητικοποιούν μια τάση που πολλοί εργαζόμενοι ήδη αισθάνονται.

Το AVO agent της NVIDIA σκοράρει 100% στο benchmark ARC-AGI-3

Στις 21 Αυγούστου, η NVIDIA ανακοίνωσε ότι το σύστημά της Agentic Variation Operators (AVO) ολοκλήρωσε όλα τα 183 επίπεδα σε όλα τα 25 δημόσια περιβάλλοντα του benchmark ARC-AGI-3, επιτυγχάνοντας τέλειο 100,00 στη μετρική Relative Human Action Efficiency — ο πρώτος πράκτορας που το πέτυχε. Το AVO τυλίγει ένα υπάρχον μοντέλο, το Claude Opus 5, μέσα σε μια προσαρμοσμένη αρχιτεκτονική πράκτορα· το υποκείμενο μοντέλο μόνο του σκοράρει περίπου 30% στην ίδια δοκιμασία. Το σύστημα ολοκλήρωσε το benchmark σε 6.624 ενέργειες, περίπου 12% λιγότερες από το αμέσως προηγούμενο σύστημα, και αρχικά κατασκευάστηκε για βελτιστοποίηση πυρήνων CUDA σε υλικό NVIDIA και όχι για να ανταγωνιστεί σε benchmarks. Το ARC-AGI-3 δεν δίνει στους πράκτορες οδηγίες, κανόνες ή δηλωμένους στόχους — ο πράκτορας πρέπει να συμπεράνει πώς μοιάζει η επιτυχία μόνο από το περιβάλλον.

Νέο benchmark διαπιστώνει ότι τα μεγάλα LLM εξακολουθούν να δυσκολεύονται με την πρωτότυπη επιστημονική σκέψη

Εργασία που δημοσιεύτηκε αυτόν τον μήνα στο arXiv παρουσιάζει ένα benchmark με τίτλο «Ρεκονστρυκτιον», το οποίο ελέγχει αν τα γλωσσικά μοντέλα μπορούν να ανακτήσουν την κεντρική υπόθεση ενός ερευνητικού άρθρου μόνο από τη βιβλιογραφία του — το είδος απαγωγικής συλλογιστικής που ασκεί ένας επιστήμονας όταν εξετάζει μια πρόταση με όλες τις παραπομπές αλλά με την κεντρική ιδέα αφαιρεμένη. Τα καλύτερα μεμονωμένα μοντέλα πετυχαίνουν μόλις στο 3–15% των φορών· ένα σύστημα πολλαπλών πρακτόρων τύπου Swiss tournament ανεβάζει το ποσοστό στο 42%, εξακολουθώντας να υστερεί σημαντικά σε σχέση με ανθρώπινους εμπειρογνώμονες. Οι συγγραφείς υποστηρίζουν ότι το έλλειμμα αποκαλύπτει ένα δομικό όριο: τα σημερινά συστήματα ΤΝ υπερεχουν στην αντιστοίχιση προτύπων στην υπάρχουσα βιβλιογραφία αλλά δυσκολεύονται να παράγουν γνήσια νέες υποθέσεις από ελλιπή απόδειξη — ένα κενό που έχει σημασία καθώς τα εργαλεία ΤΝ εμπορεύονται όλο και περισσότερο για υποστήριξη της έρευνας.

Η Πενσυλβανία δίνει στις κοινότητες βέτο στα κέντρα δεδομένων ΤΝ

Στις 18 Αυγούστου, ο Κυβερνήτης της Πενσυλβανίας Josh Shapiro υπέγραψε την Εκτελεστική Εντολή 2026-05, απαιτώντας από τους κατασκευαστές κέντρων δεδομένων ΤΝ να αποκτήσουν νομικά δεσμευτικές συμφωνίες κοινοτικής έγκρισης πριν η πολιτεία αρχίσει να εξετάζει αιτήσεις αδειοδότησης. Βάσει των απαιτήσεων Responsible Infrastructure Development της εντολής, οι κατασκευαστές πρέπει να χρηματοδοτήσουν όλα τα κόστη ηλεκτρικής υποδομής, να προμηθεύονται με σημαντικό μέρος από καθαρή ενέργεια, και να δεσμευτούν σε πρότυπα τοπικής πρόσληψης και δημόσιας διαφάνειας. Η εντολή αφαιρεί τις προτάσεις κέντρων δεδομένων ΤΝ από τη διαδικασία ταχείας αδειοδότησης της Πενσυλβανίας και απαγορεύει τις συμφωνίες μη αποκάλυψης με τοπικές κοινότητες. «Αν η τοπική κοινότητα δεν εγκρίνει ένα έργο, ούτε η πολιτεία θα το εγκρίνει», είπε ο Shapiro — μια άμεση πρόκληση σε έναν κλάδο που κατέγραψε πάνω από 100 προτάσεις κέντρων δεδομένων στην πολιτεία τον περασμένο χρόνο.

Ερευνητές ονομάζουν και επιδιορθώνουν τρεις ευπάθειες στο Microsoft Copilot Personal

Τα Varonis Threat Labs αποκάλυψαν τρεις ευπάθειες στο Microsoft Copilot Personal — με το συλλογικό όνομα CoSnitch — που επιδιορθώθηκαν στις 18 Αυγούστου ως μέρος της μηνιαίας ενημέρωσης ασφαλείας της Microsoft. Η κύρια ευπάθεια, CVE-2026-24301, επιτρέπει σε έναν εισβολέα να δημιουργήσει έναν σύνδεσμο που, όταν κλικαριστεί, εκτελεί αυτόματα ένα κρυφό prompt Copilot που αντλεί αθόρυβα δεδομένα από συνδεδεμένες εφαρμογές — εγγραφές ημερολογίου, email, αρχεία OneDrive — και τα δρομολογεί σε URL ελεγχόμενη από τον εισβολέα. Δεν παρατηρήθηκε ενεργή εκμετάλλευση πριν από την επιδιόρθωση, και το Microsoft Patch Tuesday Αυγούστου 2026 αντιμετώπισε συνολικά 415 ευπάθειες, συμπεριλαμβανομένης μιας zero-day που εκμεταλλεύτηκε. Το CoSnitch απεικονίζει μια νέα κατηγορία κινδύνου prompt-injection: οι βοηθοί ΤΝ που ενεργούν εκ μέρους χρηστών γίνονται μοχλός για αθόρυβη εξαγωγή δεδομένων όταν γίνεται κατάχρηση των δυνατοτήτων τους για παρακολούθηση συνδέσμων και ενσωμάτωση εφαρμογών.

Η καθαρή επίδραση της ΤΝ στην απασχόληση γίνεται αρνητική σε μεγάλες εταιρείες, δείχνουν νέα δεδομένα

Μια ανάλυση της S&P Global δεδομένων απασχόλησης ιδιωτικού τομέα που δημοσιεύτηκε αυτόν τον μήνα διαπιστώνει ότι οι μεγάλες εταιρείες — αυτές με περισσότερους από 250 εργαζόμενους — αναφέρουν τώρα αρνητική καθαρή επίδραση από επενδύσεις σε ΤΝ κατά −13 ποσοστιαίες μονάδες, ακόμα και καθώς οι μικρότερες εταιρείες εξακολουθούν να προβλέπουν θετικά καθαρά κέρδη. Οι θέσεις εργασίας αρχικού επιπέδου που εκτίθενται περισσότερο στην αυτοματοποίηση μειώθηκαν 13% από την άνοδο της γενετικής ΤΝ, σύμφωνα με δεδομένα του Stanford που αναφέρονται στην έκθεση. Μια συνοδευτική έκθεση από το Center for Data Innovation προειδοποιεί ότι τα συνολικά στατιστικά αποκρύπτουν ευρεία διακύμανση ανά κλάδο και τύπο εργασίας, και ζητά πλουσιότερα πλαίσια μέτρησης πριν οι υπεύθυνοι χάραξης πολιτικής ενεργήσουν με βάση τους αριθμούς τίτλων. Η ΤΝ συγχρόνως συρρικνώνει ορισμένες κατηγορίες θέσεων εργασίας και επεκτείνει άλλες — αλλά η ισορροπία για τους μεγάλους εργοδότες δεν έχει ακόμη φτάσει στην ουδετερότητα.