יוזמה עצמאית לציבור ידע על בינה מלאכותית · 21.09.2026
שמירה, שיתוף וכלי קריאה
רשימת הקריאה שלי

התאמת הקריאה

ההעדפות נשמרות בדפדפן הזה בלבד.

→ לספריית הידע
פתרונות ובטיחות

AI Control: פיקוח גם כשאי אפשר להניח שהמודל משתף פעולה

מחקרגרסה 5; פרסום ראשון בדצמבר 2023: 2024-07-23תקציר מערכת בעברית
כתובת המקור
arxiv.org
סוג המקור
מחקר
הנושא
פתרונות ובטיחות
הקשר ומגבלות
מפורטים להלן ליד התקציר

מחבר או מפרסם המקור: Greenblatt, Shlegeris, Sachan & Roger · arXiv

בדיקת הרשומה: 2026-09-21

איך לקרוא את הרשומה

התקציר מציג את עיקרי הפרסום. הסעיפים שמתחתיו מפרטים את גבולות הטענה ואת היקף הבדיקה, כדי שתוכלו להחליט מה אפשר להסיק ממנו.

עיקר הדברים

בחינת פרוטוקולי פיקוח על מודל חזק בסביבה שבה נבדקת גם אפשרות של חבלה מכוונת. המחקר משתמש במשימות תכנות מוגדרות.

גבולות הטענה

תוצאות בסביבת ניסוי אינן מבטיחות שליטה במערכת עצמאית בעולם פתוח.

מה נקרא ונבדק?

נקראו התקציר ופרטי הגרסאות, לא המאמר המלא..

התקציר הוא סיכום מקורי בעברית. הוא אינו תרגום מלא של המקור ואינו תמלול. לפני ציטוט חשוב לקרוא את הניסוח המקורי ואת ההקשר.

למקור המקורי ↗

שאלות לקחת לקריאה

  1. מה המקור מדד או תיעד בפועל?
  2. אילו הנחות מפרידות בין הממצא למסקנה?
  3. איזה ממצא נוסף עשוי לשנות את ההערכה?
כך אנחנו מפרידים בין ראיה לפרשנות
להצליב את הקריאה

לחבר בין יכולת, סיכון ואחריות

קראו מסגרת מחקרית לצד מסגרת לניהול סיכונים. הבחינו בין תוצאה של ניסוי לבין החלטה על שימוש במציאות.

מחקרחמש בעיות מעשיות בבטיחות AIלמקור ולמגבלות ←מסגרת עבודהNIST: איך הופכים אחריות לניהול סיכונים?למקור ולמגבלות ←דוחדוח בטיחות ה־AI הבין־לאומי, 2026למקור ולמגבלות ←
מונח לא ברור? פותחים את המילון ←

להצליב ולהעמיק

Inspect: כלי פתוח לבדיקת מערכות AI

בטיחות עם ערבויות: מה בדיוק אפשר להוכיח?

Scientist AI: לחקור בלי להפוך לסוכן בעל יעד

מה תרצו לחקור?

קיצור מקלדת: / לפתיחה, Esc לסגירה. השאילתה מופיעה בכתובת עמוד התוצאות.