דלג לתוכן
לרנקה, קפריסין
מרכז בינה לחדשנותלרנקה · נוסד 2026
AIAI23 באוגוסט 20263 min read

סוכנים מגיעים ל-100% על AGI-3; מדינות מתערבות בתשתיות AI

ה-AVO של NVIDIA מקבל ציון מושלם על ARC-AGI-3, פנסילבניה מעניקה לקהילות זכות וטו על מרכזי נתונים של AI, ו-Varonis מתקנת שלושה פגמים ב-Copilot.

By BINA Editorial

גיליון היום משתרע על שני קצות ספקטרום היכולות — ציון benchmark מושלם היסטורי ומחקר המראה שמודלים מובילים עדיין אינם מסוגלים לחשוב כמדענים — לצד מדינה אמריקאית המחייבת הסכמת קהילה לפני הקמת מרכזי נתונים של AI, עדכון אבטחה קריטי ל-Copilot, ונתוני שוק עבודה חדשים המספרתים מגמה שעובדים רבים כבר חשים.

ה-AVO של NVIDIA משיג 100% על ה-benchmark ARC-AGI-3

ב-21 באוגוסט, NVIDIA הכריזה כי מערכת Agentic Variation Operators (AVO) שלה השלימה את כל 183 הרמות בכל 25 הסביבות הציבוריות של ה-benchmark ARC-AGI-3, והשיגה 100.00 מושלם במדד Relative Human Action Efficiency — הסוכן הראשון שעשה זאת. AVO עוטפת מודל קיים, Claude Opus 5, בתוך ארכיטקטורת סוכן מותאמת; המודל הבסיסי לבדו מקבל כ-30% באותו מבחן. המערכת השלימה את ה-benchmark ב-6,624 פעולות — כ-12% פחות מהמערכת הקרובה ביותר לפניה — ונבנתה במקור לאופטימיזציה של ליבות CUDA על חומרת NVIDIA ולא כדי להתחרות ב-benchmarks. ARC-AGI-3 אינו מספק לסוכנים הוראות, כללים או מטרות מוצהרות — הסוכן חייב להסיק כיצד נראה הצלחה מהסביבה בלבד.

benchmark חדש מגלה שמודלי שפה מובילים עדיין מתקשים בחשיבה מדעית מקורית

מאמר שפורסם החודש ב-arXiv מציג benchmark בשם "Reconstruction", הבוחן האם מודלי שפה יכולים לשחזר את ההשערה המרכזית של מאמר מחקרי מרשימת הביבליוגרפיה שלו בלבד — סוג של הסקה אבדוקטיבית שמדען מפעיל בעת סקירת הצעה עם כל הציטוטים שלמים אך הרעיון המרכזי מוסר. המודלים הטובים ביותר מצליחים רק ב-3–15% מהמקרים; מסלול רב-סוכן בסגנון Swiss tournament מעלה את הנתון ל-42%, עדיין הרבה מתחת לרמת מומחים אנושיים. המחברים טוענים כי הפער חושף מגבלה מבנית: מערכות AI נוכחיות מצטיינות בהתאמת דפוסים בספרות קיימת אך מתקשות לייצר השערות חדשות ממש מעדויות חלקיות — פער חשוב ככלי AI משווקים יותר ויותר לתמיכת מחקר.

פנסילבניה מעניקה לקהילות זכות וטו על מרכזי נתונים של AI

ב-18 באוגוסט, מושל פנסילבניה ג'וש שפירו חתם על צו מנהלי 2026-05, המחייב מפתחי מרכזי נתונים של AI להשיג הסכמי אישור קהילתי מחייבים משפטית לפני שהמדינה תתחיל לבחון בקשות רישיון. בהתאם לדרישות Responsible Infrastructure Development של הצו, המפתחים חייבים לממן את כל עלויות תשתית החשמל, לקחת חלק מהחשמל מאנרגיה נקייה, ולהתחייב לסטנדרטים של העסקה מקומית ושקיפות ציבורית. הצו מסיר הצעות מרכזי נתונים של AI מהתהליך המזורז של פנסילבניה ואוסר על הסכמי אי-גילוי עם קהילות מקומיות. "אם הקהילה המקומית לא מאשרת פרויקט, גם המדינה לא תאשר אותו", אמר שפירו — אתגר ישיר לתעשייה שרשמה יותר מ-100 הצעות מרכזי נתונים במדינה בשנה האחרונה.

חוקרים מגלים ומתקנים שלוש פגיעויות ב-Microsoft Copilot Personal

Varonis Threat Labs חשפה שלוש פגיעויות ב-Microsoft Copilot Personal — הנקראות יחד CoSnitch — שתוקנו ב-18 באוגוסט כחלק מעדכון האבטחה החודשי של Microsoft. הפגיעות המובילה, CVE-2026-24301, מאפשרת לתוקף לנסח קישור שכאשר לוחצים עליו, מפעיל אוטומטית הנחיית Copilot נסתרת השולפת בשקט נתונים מאפליקציות מחוברות — רשומות לוח שנה, מיילים, קבצי OneDrive — ומנתבת אותם לכתובת URL בשליטת התוקף. לא נצפה ניצול פעיל לפני התיקון, וPatch Tuesday של Microsoft לאוגוסט 2026 טיפל ב-415 פגיעויות בסך הכל, כולל יום אפס אחד שנוצל. CoSnitch ממחיש סוג חדש של סיכון הזרקת הנחיות: עוזרי AI שפועלים בשם משתמשים הופכים למנוף לסינון נתונים שקט כאשר נעשה שימוש לרעה ביכולות המעקב אחר קישורים ואינטגרציית האפליקציות שלהם.

השפעת ה-AI על התעסוקה הופכת שלילית בנטו בחברות גדולות, מנתונים חדשים עולה

ניתוח של S&P Global של נתוני תעסוקה בסקטור הפרטי שפורסם החודש מגלה כי חברות גדולות — אלה עם יותר מ-250 עובדים — מדווחות כעת על השפעת תעסוקה שלילית נטו מהשקעה ב-AI של −13 נקודות אחוז, גם כשחברות קטנות יותר עדיין חוזות רווחים נטו חיוביים. תפקידי רמת כניסה הנחשפים ביותר לאוטומציה ירדו ב-13% מאז עלייתו של ה-AI הגנרטיבי, לפי נתוני סטנפורד המצוטטים בדוח. דוח מלווה ממרכז Data Innovation מזהיר כי סטטיסטיקות מצטברות מסתירות שונות רחבה לפי מגזר וסוג משימה, וקורא למסגרות מדידה עשירות יותר לפני שקובעי מדיניות יפעלו על מספרים מובילים. ה-AI מכווץ בו-זמנית קטגוריות עבודה מסוימות ומרחיב אחרות — אך האיזון עבור מעסיקים גדולים טרם הגיע לנייטרליות.