Przejdź do treści
Larnaka, Cypr
BINA CYINNOVATION HUBLarnaka · zał. 2026
AIAI23 sierpnia 20264 min read

Agenci osiągają 100% na AGI-3; stany interweniują w infrastrukturę AI

AVO firmy NVIDIA osiąga perfekcyjny wynik na ARC-AGI-3, Pensylwania daje społecznościom prawo weta wobec centrów danych AI, a Varonis łata trzy luki w Copilot.

By BINA Editorial

Dzisiejszy biuletyn obejmuje oba krańce spektrum możliwości — historyczny wynik 100% na benchmarku i badanie pokazujące, że czołowe modele wciąż nie potrafią myśleć jak naukowcy — obok amerykańskiego stanu nakazującego uzyskanie zgody społeczności przed budową centrów danych AI, krytycznej łatki dla Copilot i nowych danych rynku pracy, które liczbowo wyrażają tendencję, którą wielu pracowników już odczuwa.

Agent AVO firmy NVIDIA osiąga 100% na benchmarku ARC-AGI-3

21 sierpnia NVIDIA ogłosiła, że jej system Agentic Variation Operators (AVO) ukończył wszystkie 183 poziomy we wszystkich 25 publicznych środowiskach benchmarku ARC-AGI-3, osiągając idealny wynik 100,00 w metryce Relative Human Action Efficiency — jako pierwszy agent, któremu to się udało. AVO opakowuje istniejący model, Claude Opus 5, w niestandardową architekturę agenta; sam model bazowy uzyskuje około 30% na tym samym teście. System ukończył benchmark w 6 624 akcjach — o około 12% mniej niż poprzedni najlepszy system — i pierwotnie został zbudowany do optymalizacji jąder CUDA na sprzęcie NVIDIA, a nie do rywalizacji na benchmarkach. ARC-AGI-3 nie daje agentom żadnych instrukcji, zasad ani zadeklarowanych celów — agent musi wywnioskowac, jak wygląda sukces, wyłącznie z otoczenia.

Nowy benchmark ujawnia, że czołowe LLM wciąż mają trudności z oryginalnym myśleniem naukowym

Artykuł opublikowany w tym miesiącu na arXiv przedstawia benchmark o nazwie „Reconstruction”, który sprawdza, czy modele językowe potrafią odtworzyć centralną hipotezę artykułu badawczego wyłącznie na podstawie jego bibliografii — rodzaj abdukcyjnego rozumowania, które stosuje naukowiec, recenzując propozycję z wszystkimi cytowaniami, ale bez usuniytej idei centralnej. Najlepsze pojedyncze modele odnoszą sukces tylko w 3–15% przypadków; wieloagentowy potok w stylu turnieju szwajcarskiego podnosi tę liczbę do 42%, wciąż znacznie poniżej poziomu ludzkich ekspertów. Autorzy twierdzą, że deficyt ujawnia strukturalne ograniczenie: obecne systemy AI doskonałe radzą sobie z dopasowywaniem wzrców w istniejącej literaturze, ale mają trudności z generowaniem naprawdę nowych hipotez na podstawie niepełnych dowodów — luka, która ma znaczenie, ponieważ narzędzia AI są coraz częściej reklamowane jako wsparcie dla badań.

Pensylwania daje społecznościom prawo weta wobec centrów danych AI

18 sierpnia gubernator Pensylwanii Josh Shapiro podpisał Rozporządzenie Wykonawcze 2026-05, zobowiązując deweloperów centrów danych AI do uzyskania prawnie wiążących umów zatwierdzenia społeczności przed tym, jak stan zacznie rozpatrywać wnioski o pozwolenia. Zgodnie z wymaganiami Responsible Infrastructure Development zawartymi w rozporządzeniu, deweloperzy muszą sfinansować wszystkie koszty infrastruktury elektrycznej, pozyskiwać znaczącą część energii z czystych źródeł i zobowiązać się do standardów lokalnego zatrudnienia i publicznej przejrzystości. Rozporządzenie wyklucza propozycje centrów danych AI z przyspieszonego procesu wydawania pozwoleń w Pensylwanii i zakazuje umów o nieujawnianiu informacji z lokalnymi społecznościami. „Jeśli lokalna społeczność nie zatwierdzi projektu, stan też go nie zatwierdzi” — powiedział Shapiro — bezpośrednie wyzwanie dla branży, która zarejestowała ponad 100 propozycji centrów danych w stanie w ciągu ostatniego roku.

Badacze identyfikują i łatają trzy luki w Microsoft Copilot Personal

Varonis Threat Labs ujawniło trzy luki w Microsoft Copilot Personal — zbiorczo nazwane CoSnitch — załatane 18 sierpnia w ramach miesięcznej aktualizacji zabezpieczeń Microsoft. Główna luka, CVE-2026-24301, pozwala atakującemu spreparować link, który po kliknięciu automatycznie uruchamia ukryty prompt Copilot, po cichu pobierający dane z połączonych aplikacji — wpisy kalendarza, e-maile, pliki OneDrive — i przekierowujący je na URL kontrolowany przez atakującego. Przed wydaniem łatki nie odnotowano aktywnego wykorzystania luki, a Patch Tuesday Microsoft za sierpień 2026 uwzględnił łącznie 415 luk, w tym jeden wykorzystywany zero-day. CoSnitch ilustruje nową klasę ryzyka prompt-injection: asystenci AI działający w imieniu użytkowników stają się dźwignią do cichej eksfiltracji danych, gdy ich możliwości śledzenia linków i integracji z aplikacjami są nadużywane.

Netto wpływ AI na zatrudnienie stał się negatywny w dużych firmach, pokazują nowe dane

Analiza S&P Global danych o zatrudnieniu w sektorze prywatnym opublikowana w tym miesiącu pokazuje, że duże firmy — te zatrudniające ponad 250 pracowników — raportują teraz netto negatywny wpływ inwestycji w AI na zatrudnienie na poziomie −13 punktów procentowych, nawet gdy mniejsze firmy nadal prognozują pozytywne zyski netto. Stanowiska poziomu podstawowego najbardziej narażone na automatyzację zmniejszyły się o 13% od czasu wzrostu generatywnej AI, według danych Stanforda cytowanych w raporcie. Towarzyszący raport Centrum Innowacji w Danych ostrzega, że zagregowane statystyki ukrywają szerokie zróżnicowanie według sektora i rodzaju zadań, i wzywa do bogatszych ram pomiarowych, zanim decydenci podejmą działania na podstawie nagłówkowych liczb. AI jednocześnie kurczy pewne kategorie miejsc pracy i rozszerza inne — ale bilans dla dużych pracodawców nie osiągnął jeszcze neutralności.