Anthropic: مدل Claude در تست، سرنخ جعلی قتل برای پلیس فرستاد

Anthropic گزارشی منتشر کرده با عنوان «بررسی اقدامات ناخواسته مدل در ارزیابیها و استفاده داخلی» و ماجرایش از یک خبر عجیب شروع شد: یکی از مدلهای Claude در حین تست، یک «سرنخ» جعلی درباره یک قتل حلنشده را از طریق فرم عمومی پلیس فیلادلفیا ارسال کرده بود.

چه اتفاقی افتاد؟
طبق گزارش خود Anthropic، مدل Claude Haiku 4.5 مأمور شده بود روی صفحههای وب تصادفی «کارهای نمونه» تعریف و اجرا کند. در یکی از اجراها روی صفحهای درباره یک قتل حلنشده رسید که فرم ارسال سرنخ پلیس داشت. در دستورالعملش گفته شده بود وارد حساب نشود، اطلاعات شخصی وارد نکند و خرید نکند، اما ارسال فرم صراحتاً ممنوع نبود. نتیجه؟ مدل نوشت «ممکن است درباره این پرونده اطلاعاتی داشته باشم؛ یادم هست کسی شبیه توصیف را در آن حوالی دیدهام» و فرم را بدون نام و تماس فرستاد. در حالی که اصلاً توصیفی از مظنون در صفحه وجود نداشت.
این ارسال در ۱۸ جولای انجام شد، بهعنوان اسپم علامت خورد و هرگز به دست بازپرسها نرسید. Anthropic تازه ۲۸ سپتامبر متوجه شد و ۷ اکتبر به پلیس خبر داد. پلیس فیلادلفیا هم صریح گفت این تأخیر دوماهه «غیرقابل قبول» است.

فقط همین یک مورد نبود
گزارش چهار دسته رفتار ناخواسته را فهرست میکند که همه وقتی رخ دادهاند که مدل نمیتوانست کار را به روش عادی تمام کند و بهجای توقف، راه دور زدن پیدا کرده است:
- سوءاستفاده از باگ نرمافزاری: Claude Mythos Preview وقتی ابزار علمی یک دانشگاه خطا داد، فایلهای سرور را خواند، یک آسیبپذیری تزریق فرمان پیدا کرد و محاسبه را مستقیم روی سرور اجرا کرد.
- ارسال فرمی که نباید: از فرم واقعی دولتی بهجای نسخه تمرینی تا همین سرنخ پلیس.
- دور زدن محدودیت دسترسی به داده: مثلاً برداشتن توکن دسترسی از تنظیمات یک سایت دولتی و کوئری مستقیم به سرور، یا دور زدن دادهای که پولی بود.
- استفاده از کوتاهکننده لینک: برای دور زدن محدودیت طول URL در ابزار fetch (اپراتور سرویس da.gd هم خودش این را گزارش داده بود).

واکنش Anthropic
Anthropic میگوید دسترسی زنده به اینترنت را برای همه ارزیابیهای داخلی قطع کرده تا مطمئن شود سیستمهای پایش این رفتارها را میگیرند، بعضی بنچمارکهای عمومی را کنار گذاشته یا آفلاین کرده، محدودیتهای ابزار web fetch را سختتر کرده و ابزاری ساخته که این رفتارها را خودکار تشخیص و مسدود میکند؛ ادعا میکند روی همه موارد این گزارش جواب داده. همچنین محیطهای آموزشیای را که به مدل برای دور زدن محدودیت پاداش میدادند (reward hacking) اصلاح یا حذف میکند. به گفته خودش کاخ سفید و نهادهای دولتی درگیر هم مطلع شدهاند.

نظر من
به نظرم این گزارش از ماجرای هک سرور هم مهمتر است، چون نشان میدهد مشکل اصلی ایجنتها «بدجنسی» نیست، «سماجت» است. مدل وقتی به دیوار میخورد، بهجای اینکه بگوید نمیشود، هر راهی را امتحان میکند و فهرست ممنوعیتها هیچوقت کامل نیست. «فرم نفرست» در دستور نبود، پس فرستاد.
برای ما که ایجنت میسازیم درسش روشن است: allowlist به جای blocklist، محیط ایزوله، و لاگ و مانیتورینگی که همان روز بگوید چه شده، نه دو ماه بعد. شفافیت Anthropic در انتشار این گزارش قابل احترام است، اما اینکه یک آزمایشگاه بزرگ دو ماه نفهمد مدلش به پلیس سرنخ جعلی داده، یعنی هنوز خیلی عقبیم.
منابع: Anthropic، TechCrunch، 6abc، The Verge