# AI Control: פיקוח גם כשאי אפשר להניח שהמודל משתף פעולה

תקציר מערכת בעברית, Pdoom.

עמוד הרשומה: https://ai-nation.pages.dev/library/safety-control/

מקור מקורי: https://arxiv.org/abs/2312.06942

סוג: מחקר
נושא: פתרונות ובטיחות
גרסה 5; פרסום ראשון בדצמבר 2023: 2024-07-23
בדיקת הרשומה: 2026-09-21
מפרסם המקור: Greenblatt, Shlegeris, Sachan & Roger · arXiv

## עיקר הדברים

בחינת פרוטוקולי פיקוח על מודל חזק בסביבה שבה נבדקת גם אפשרות של חבלה מכוונת. המחקר משתמש במשימות תכנות מוגדרות.

## גבולות הטענה

תוצאות בסביבת ניסוי אינן מבטיחות שליטה במערכת עצמאית בעולם פתוח.

## מה נקרא ונבדק

נקראו התקציר ופרטי הגרסאות, לא המאמר המלא.

זהו תקציר מקורי, לא תרגום מלא או תמלול. לפני ציטוט ממצא יש לבדוק את המקור המקורי.

שיטת הבדיקה: https://ai-nation.pages.dev/method/
