Агенты достигают 100% на AGI-3; штаты вмешиваются в инфраструктуру ИИ
AVO от NVIDIA набирает идеальный балл на ARC-AGI-3, Пенсильвания даёт общинам право вето на центры обработки данных ИИ, а Varonis устраняет три уязвимости в Copilot.
By BINA Editorial
Сегодняшний выпуск охватывает оба конца спектра возможностей — исторически значимый результат 100% на бенчмарке и исследование, показывающее, что передовые модели по-прежнему не умеют мыслить как учёные, — а также американский штат, требующий согласия общества перед строительством центров обработки данных ИИ, критическое исправление Copilot и новые данные рынка труда, которые числово выражают тенденцию, которую многие работники уже ощущают.
Агент AVO от NVIDIA набирает 100% на бенчмарке ARC-AGI-3
21 августа NVIDIA объявила, что её система Agentic Variation Operators (AVO) прошла все 183 уровня во всех 25 публичных средах бенчмарка ARC-AGI-3, достигнув идеального результата 100,00 по метрике Relative Human Action Efficiency — первый агент, которому это удалось. AVO оборачивает существующую модель, Claude Opus 5, в собственную агентную архитектуру; сама по себе базовая модель набирает около 30% на том же тесте. Система завершила бенчмарк за 6 624 действия — примерно на 12% меньше, чем ближайшая предыдущая система, — и изначально создавалась для оптимизации ядер CUDA на оборудовании NVIDIA, а не для участия в бенчмарках. ARC-AGI-3 не даёт агентам никаких инструкций, правил и заявленных целей — агент должен самостоятельно вывести, как выглядит успех, исключительно из среды.
Новый бенчмарк обнаруживает, что передовые LLM по-прежнему испытывают трудности с оригинальным научным мышлением
Статья, опубликованная в этом месяце на arXiv, представляет бенчмарк под названием «Реконструкция», проверяющий, способны ли языковые модели восстановить центральную гипотезу исследовательской статьи только по её библиографии — вид абдуктивного рассуждения, который учёный применяет при рецензировании предложения со всеми цитатами, но без основной идеи. Лучшие одиночные модели справляются лишь в 3–15% случаев; мультиагентный конвейер по принципу швейцарского турнира поднимает показатель до 42%, что всё равно существенно ниже уровня экспертов-людей. Авторы утверждают, что этот разрыв обнажает структурное ограничение: современные системы ИИ хорошо справляются с поиском шаблонов в существующей литературе, но испытывают трудности с генерацией подлинно новых гипотез на основе неполных данных — пробел, который важен, поскольку инструменты ИИ всё активнее продвигаются как средство поддержки науки.
Пенсильвания даёт общинам право вето на центры обработки данных ИИ
18 августа губернатор Пенсильвании Джош Шапиро подписал Исполнительный указ 2026-05, обязывающий застройщиков центров обработки данных ИИ получить юридически обязывающие соглашения об одобрении со стороны сообщества до того, как штат начнёт рассматривать заявки на выдачу разрешений. Согласно требованиям указа об ответственном развитии инфраструктуры, застройщики должны финансировать все затраты на электросетевую инфраструктуру, получать значительную долю электроэнергии из чистых источников и соблюдать стандарты местного трудоустройства и публичной прозрачности. Указ исключает предложения по строительству центров обработки данных ИИ из ускоренного порядка выдачи разрешений в Пенсильвании и запрещает соглашения о неразглашении с местными сообществами. «Если местное сообщество не одобряет проект, штат его тоже не одобрит», заявил Шапиро — прямой вызов отрасли, зафиксировавшей более 100 предложений по строительству центров обработки данных в штате за прошлый год.
Исследователи выявляют и устраняют три уязвимости в Microsoft Copilot Personal
Varonis Threat Labs раскрыли три уязвимости в Microsoft Copilot Personal — под общим названием CoSnitch, — исправленные 18 августа в рамках ежемесячного обновления безопасности Microsoft. Основная уязвимость, CVE-2026-24301, позволяет злоумышленнику создать ссылку, при клике на которую автоматически запускается скрытый промпт Copilot, незаметно извлекающий данные из подключённых приложений — записи календаря, письма, файлы OneDrive — и переправляющий их на подконтрольный злоумышленнику URL. До момента выхода патча активного использования уязвимости не зафиксировано, а Patch Tuesday Microsoft за август 2026 года в совокупности устранил 415 уязвимостей, включая одну уже эксплуатируемую уязвимость нулевого дня. CoSnitch демонстрирует новый класс рисков prompt-injection: ИИ-ассистенты, действующие от имени пользователей, становятся рычагом для тайной утечки данных, когда злоумышленники злоупотребляют их возможности перехода по ссылкам и интеграции с приложениями.
Чистый эффект ИИ на занятость стал отрицательным в крупных компаниях, свидетельствуют новые данные
Анализ S&P Global данных о занятости в частном секторе, опубликованный в этом месяце, показывает: крупные компании — с численностью свыше 250 сотрудников — теперь фиксируют чистый отрицательный эффект инвестиций в ИИ на занятость на уровне −13 процентных пункта, даже несмотря на то, что небольшие фирмы по-прежнему прогнозируют положительный чистый эффект. Должности начального уровня, наиболее подверженные автоматизации, сократились на 13% с момента распространения генеративного ИИ, согласно данным Стэнфорда, цитируемым в докладе. Сопроводительный доклад центра Center for Data Innovation предупреждает, что агрегированные показатели скрывают широкую вариативность по отраслям и типам задач, и призывает к созданию более детальных систем измерения прежде, чем политики будут действовать на основе заголовочных цифр. ИИ одновременно сокращает одни категории рабочих мест и расширяет другие — но баланс для крупных работодателей пока не достиг нейтральности.