OpenAI گزارش رسمی خود را روز چهارشنبه در مورد نقض Hugging Face منتشر کرد و واضحترین تصویری را ارائه کرد که چگونه یک زنجیره غیرمعمول از رویدادها به یک مدل هوش مصنوعی اجازه میدهد از محیط آزمایشی خود فرار کند و یک حادثه امنیت سایبری گسترده را ایجاد کرد.
این گزارش که بیش از یک ماه پس از علنی شدن این حادثه منتشر شد، شامل چندین مورد امنیت سایبری است.
در این گزارش آمده است: «این حادثه رفتار ناهماهنگی را در یک سناریوی بیرونی نشان میدهد که شامل تلاقی نادر و غیرمنتظره از رویدادها میشود: وجود وظایف غیرممکن در ارزیابی ExploitGym، تداوم مدل در افقهای طولانی کار، و پیامهایی به مدلهای همتا که باعث شد آن مدلها از هدف خود منحرف شوند».
بسیاری از جزئیات گزارش OpenAI قبلاً در ارائه Black Hat در 6 آگوست منتشر شده بود، اما گزارش رسمی OpenAI گزارش کامل تری از این حادثه، از جمله جزئیات بیشتری در مورد آزمایشی که آن را آغاز کرد، ارائه می دهد.این گزارش همچنین جزئیات مهمی را در مورد چگونگی هدف OpenAI برای جلوگیری از حوادث آینده، از جمله نظارت زنجیرهای از افکار و سیستم پیشرفتهتر برای متوقف کردن عوامل سرکش، ارائه میکند.
METR و Redwood Research همچنین ارزیابیهای شخص ثالثی از رفتار مدلها در طول حادثه انجام دادند.هر دو گروه در حال برنامه ریزی برای انتشار گزارش های خود در مورد این حادثه هستند.
بهطور کلی، این گزارش توضیح میدهد که چگونه یک مدل OpenAI با یک مشکل غیرقابل حل در آزمایش ارائه شد و به زنجیرهسازی اکسپلویتهای کشفنشده قبلی به منظور دور زدن اقدامات امنیتی و تکمیل کار خود ادامه داد.این مدل ابتدا ابزار مدیریت بسته Artifactory را به خطر انداخت تا به اینترنت دسترسی پیدا کند، سپس سیستمهای مختلف در OpenAI، Hugging Face و سایر فروشندگان را به خطر انداخت.
این گزارش جزئیات جدید و حیاتی را در مورد مدل هایی که این نقض را انجام داده اند ارائه می دهد.مدل اولیه از همان خانواده مدل آسترا OpenAI بود، اگرچه این گزارش تاکید میکند که «یک مدل متمایز با آموزشهای مختلف است که بیشتر رفتار یک مدل در آن شکل میگیرد».
چه چیزی باعث رونق استارتاپ سوئد شده است، از دوست داشتنی تا لگورا |پادکست معادل0 ثانیه 30 دقیقه، 0 حجم 0% علامت سوال shift را فشار دهید تا به لیستی از میانبرهای صفحه کلید دسترسی پیدا کنید.روشن/خاموشاکتمام صفحه/خروج تمام صفحهfنادیده/لغو کاهش اندازه عنوان-افزایش اندازه زیرنویس+ یا =Seek %0-9 Live00:0030:0030:00
از آنجایی که OpenAI در حال آزمایش قابلیتهای مدل بود، همچنین توسط طبقهبندیکنندههای معمولی که قصد داشتند مدلها را از به خطر انداختن زیرساختهای دیجیتالی جلوگیری کنند، مهار نشد.
در این گزارش توضیح داده شده است: «OpenAI حداکثر قابلیتهای سایبری را با اجرای این ارزیابی بدون طبقهبندیکنندههای تولیدی که برای جلوگیری از پیگیری فعالیتهای سایبری پرخطر مدلها طراحی شده است، تخمین میزند.این ارزیابیها به این دلیل مهم هستند که OpenAI بتواند قابلیتهای زیربنایی مدلها را اندازهگیری کند و پادمانهای مناسب را طراحی کند.»
این گزارش همچنین اطلاعات جدید قابل توجهی در مورد تغییرات امنیتی OpenAI در آینده ارائه می دهد که بر اساس تلاش های نظارتی و همسویی که هفته گذشته عمومی شد.
به ویژه، این شرکت نظارت خود را بر "زنجیره فکر" عوامل هوش مصنوعی افزایش می دهد، فضای کاری که در آن سیستم های هوش مصنوعی واکنش ها و اهداف کوتاه مدت را ثبت می کنند.این نظارت با سیستم های تشدید 24 ساعته و همچنین ابزارهای جدید برای متوقف کردن بار کاری که ناامن تلقی می شوند، همراه خواهد بود.
در این گزارش آمده است: "این تغییرات برای بهبود وسعت و سرعت تشخیص - از ناهنجاریهای زیرساختی گرفته تا رفتارهای بالقوه مربوط به مدل - و جفت کردن این دید با مکانیسمهایی برای مهار سریع در نظر گرفته شده است."اگر سیستم مانیتورینگ CoT مستقر در حال حاضر ما در زمان حادثه اجرا میشد، باید فعالیت اولیه مربوطه را شناسایی کرده و تیم امنیتی ما را بیش از یک روز قبل از اینکه مدلها سیستمهای Hugging Face را نقض کنند، صفحهبندی میکرد.
