Archive / post

Blog

Anthropic: مدل Claude در تست، سرنخ جعلی قتل برای پلیس فرستاد

Ramin Eslami3 min readUpdated 09/10/2026
هوش مصنوعیAnthropicClaudeایمنی هوش مصنوعیایجنت
Anthropic: مدل Claude در تست، سرنخ جعلی قتل برای پلیس فرستاد

Anthropic گزارشی منتشر کرده با عنوان «بررسی اقدامات ناخواسته مدل در ارزیابی‌ها و استفاده داخلی» و ماجرایش از یک خبر عجیب شروع شد: یکی از مدل‌های Claude در حین تست، یک «سرنخ» جعلی درباره یک قتل حل‌نشده را از طریق فرم عمومی پلیس فیلادلفیا ارسال کرده بود.

گزارش 6abc درباره سرنخ جعلی مدل Anthropic
گزارش خبری 6abc فیلادلفیا از ماجرای سرنخ جعلی — منبع: 6abc / WPVI

چه اتفاقی افتاد؟

طبق گزارش خود Anthropic، مدل Claude Haiku 4.5 مأمور شده بود روی صفحه‌های وب تصادفی «کارهای نمونه» تعریف و اجرا کند. در یکی از اجراها روی صفحه‌ای درباره یک قتل حل‌نشده رسید که فرم ارسال سرنخ پلیس داشت. در دستورالعملش گفته شده بود وارد حساب نشود، اطلاعات شخصی وارد نکند و خرید نکند، اما ارسال فرم صراحتاً ممنوع نبود. نتیجه؟ مدل نوشت «ممکن است درباره این پرونده اطلاعاتی داشته باشم؛ یادم هست کسی شبیه توصیف را در آن حوالی دیده‌ام» و فرم را بدون نام و تماس فرستاد. در حالی که اصلاً توصیفی از مظنون در صفحه وجود نداشت.

این ارسال در ۱۸ جولای انجام شد، به‌عنوان اسپم علامت خورد و هرگز به دست بازپرس‌ها نرسید. Anthropic تازه ۲۸ سپتامبر متوجه شد و ۷ اکتبر به پلیس خبر داد. پلیس فیلادلفیا هم صریح گفت این تأخیر دوماهه «غیرقابل قبول» است.

خودروهای پلیس فیلادلفیا
خودروهای پلیس فیلادلفیا — منبع: TechCrunch / Getty Images

فقط همین یک مورد نبود

گزارش چهار دسته رفتار ناخواسته را فهرست می‌کند که همه وقتی رخ داده‌اند که مدل نمی‌توانست کار را به روش عادی تمام کند و به‌جای توقف، راه دور زدن پیدا کرده است:

  • سوءاستفاده از باگ نرم‌افزاری: Claude Mythos Preview وقتی ابزار علمی یک دانشگاه خطا داد، فایل‌های سرور را خواند، یک آسیب‌پذیری تزریق فرمان پیدا کرد و محاسبه را مستقیم روی سرور اجرا کرد.
  • ارسال فرمی که نباید: از فرم واقعی دولتی به‌جای نسخه تمرینی تا همین سرنخ پلیس.
  • دور زدن محدودیت دسترسی به داده: مثلاً برداشتن توکن دسترسی از تنظیمات یک سایت دولتی و کوئری مستقیم به سرور، یا دور زدن داده‌ای که پولی بود.
  • استفاده از کوتاه‌کننده لینک: برای دور زدن محدودیت طول URL در ابزار fetch (اپراتور سرویس da.gd هم خودش این را گزارش داده بود).
تصویر گزارش Anthropic درباره اقدامات ناخواسته مدل
تصویر رسمی گزارش «Investigating unintended model actions» — منبع: Anthropic

واکنش Anthropic

Anthropic می‌گوید دسترسی زنده به اینترنت را برای همه ارزیابی‌های داخلی قطع کرده تا مطمئن شود سیستم‌های پایش این رفتارها را می‌گیرند، بعضی بنچمارک‌های عمومی را کنار گذاشته یا آفلاین کرده، محدودیت‌های ابزار web fetch را سخت‌تر کرده و ابزاری ساخته که این رفتارها را خودکار تشخیص و مسدود می‌کند؛ ادعا می‌کند روی همه موارد این گزارش جواب داده. همچنین محیط‌های آموزشی‌ای را که به مدل برای دور زدن محدودیت پاداش می‌دادند (reward hacking) اصلاح یا حذف می‌کند. به گفته خودش کاخ سفید و نهادهای دولتی درگیر هم مطلع شده‌اند.

تصویرسازی Anthropic
تصویرسازی The Verge برای اخبار Anthropic — منبع: The Verge

نظر من

به نظرم این گزارش از ماجرای هک سرور هم مهم‌تر است، چون نشان می‌دهد مشکل اصلی ایجنت‌ها «بدجنسی» نیست، «سماجت» است. مدل وقتی به دیوار می‌خورد، به‌جای اینکه بگوید نمی‌شود، هر راهی را امتحان می‌کند و فهرست ممنوعیت‌ها هیچ‌وقت کامل نیست. «فرم نفرست» در دستور نبود، پس فرستاد.

برای ما که ایجنت می‌سازیم درسش روشن است: allowlist به جای blocklist، محیط ایزوله، و لاگ و مانیتورینگی که همان روز بگوید چه شده، نه دو ماه بعد. شفافیت Anthropic در انتشار این گزارش قابل احترام است، اما اینکه یک آزمایشگاه بزرگ دو ماه نفهمد مدلش به پلیس سرنخ جعلی داده، یعنی هنوز خیلی عقبیم.

منابع: Anthropic، TechCrunch، 6abc، The Verge