# מעקב אחר מנגנונים פנימיים במודל שפה

תקציר מערכת בעברית, Pdoom.

עמוד הרשומה: https://ai-nation.pages.dev/library/safety-circuits/

מקור מקורי: https://www.anthropic.com/research/tracing-thoughts-language-model

סוג: מחקר
נושא: פתרונות ובטיחות
מועד פרסום המחקר באתר החברה: 2025-03-27
בדיקת הרשומה: 2026-09-21
מפרסם המקור: Anthropic

## עיקר הדברים

עבודת פרשנות מכניסטית מנסה לזהות מעגלים פנימיים הקשורים להתנהגות מודל. כיוון שעשוי לעזור לחקור מדוע מתקבלת תשובה.

## גבולות הטענה

מיפוי חלקי של מנגנונים אינו קריאה מלאה של מחשבות ואינו ערבות לכוונות או להתנהגות עתידית.

## מה נקרא ונבדק

נבדקו תיאור המחקר בעמוד הרשמי ופרטי הפרסום, לא בוצע שחזור ניסוי.

זהו תקציר מקורי, לא תרגום מלא או תמלול. לפני ציטוט ממצא יש לבדוק את המקור המקורי.

שיטת הבדיקה: https://ai-nation.pages.dev/method/
