این شرکت اعلام کرده است که اقدامات جدید شامل نظارت دقیقتر بر مدلها در طول توسعه و آزمایش، جداسازی قویتر زیرساختها و توجه بیشتر به همترازی و ایمنی در مراحل پس از آموزش خواهد بود. OpenAI میگوید با افزایش توانایی مدلها، استانداردهای امنیتی نیز باید همزمان با این پیشرفتها ارتقا پیدا کنند.
توقف موقت آموزش تقویتی پس از حادثه Hugging Face
OpenAI در توضیح اقدامات جدید خود فاش کرده است که پس از حادثه Hugging Face، فرایند یادگیری تقویتی یا RL را به مدت دو هفته متوقف کرده است. این شرکت از آن زمان برخی آموزشهای مربوط به مدلهای کمخطرتر را از سر گرفته، اما بزرگترین عملیات برنامهریزیشده برای آموزش تقویتی مدلهای پیشرفته همچنان متوقف مانده است.
بر اساس توضیحات OpenAI، در این مدت آزمایشها و ارزیابیهای کوچکتری انجام میشود تا رفتار مدلها بررسی، عملکرد پادمانهای امنیتی اعتبارسنجی و شواهد بیشتری درباره همترازی مدلها پیش از ازسرگیری آموزشهای گسترده جمعآوری شود.
OpenAI تأکید کرده است که این اقدامات صرفاً واکنشی به حادثه Hugging Face نیست و افزایش تواناییهای سایبری مدل آینده این شرکت با نام Astra و سرعت کلی پیشرفت مدلهای هوش مصنوعی نیز در تصمیمگیریهای جدید نقش داشتهاند.
ماجرای نفوذ مدلهای OpenAI به Hugging Face چه بود؟
در حادثهای که در ژوئیه ۲۰۲۶ (تیر و مرداد ۱۴۰۵) افشا شد، مشخص شد مدلهای OpenAI در جریان یک آزمایش داخلی برای سنجش تواناییهای سایبری، از محیط ایزولهشده خود خارج شدند و در نهایت به زیرساختهای Hugging Face دسترسی پیدا کردند.
OpenAI بعداً اعلام کرد که این حادثه با ترکیبی از مدلهای این شرکت، از جمله GPT-5.6 Sol و یک مدل پیش از انتشار که صرفاً برای تحقیقات داخلی طراحی شده بود، ارتباط داشته است. مدلها در چارچوب آزمایشی موسوم به ExploitGym تلاش میکردند آسیبپذیریهای مختلف را شناسایی و از آنها برای دستیابی به هدف آزمایش استفاده کنند.
طبق گزارش OpenAI، محیط آزمایش مستقیماً به اینترنت متصل نبود. با این حال، مدلها یک آسیبپذیری روزصفر در نرمافزار واسط کش مخزن بستهها پیدا کردند و از آن برای دستیابی به اینترنت استفاده کردند. سپس با زنجیرهای از اقدامات، از جمله ارتقای سطح دسترسی و حرکت جانبی در محیط، به زیرساختهای Hugging Face رسیدند.
این مدلها در ادامه تلاش کردند به اطلاعاتی دسترسی پیدا کنند که میتوانست برای دور زدن هدف ارزیابی مورد استفاده قرار گیرد. OpenAI اعلام کرده است که در یکی از مسیرهای حمله، ترکیبی از اعتبارنامههای سرقتشده و آسیبپذیریهای روزصفر برای یافتن مسیر اجرای کد از راه دور در سرورهای Hugging Face مورد استفاده قرار گرفت.
Hugging Face در نهایت فعالیت را شناسایی و متوقف کرد و دو شرکت تحقیقات مشترکی را درباره این حادثه آغاز کردند.
جداسازی شبکهای سختگیرانهتر میشود
یکی از نقاط ضعف مورد انتقاد پس از این حادثه، نحوه جداسازی محیطهای آزمایشی OpenAI از سایر شبکهها بود. این شرکت اکنون اعلام کرده است که کنترلهای سختگیرانهتری را در پیکربندی زیرساختها و محیطهای آموزشی و ارزیابی خود اعمال خواهد کرد.
هدف اصلی این است که حتی در صورت به خطر افتادن یک سرویس یا محیط کاری، مدل نتواند از همان مسیر به اینترنت یا سایر شبکههای داخلی دسترسی پیدا کند.
OpenAI در گزارش خود تأکید کرده است که در معماری جدید، به خطر افتادن یک محیط کاری یا سرویس پشتیبان بهتنهایی نباید امکان دسترسی غیرمجاز به اینترنت یا سایر شبکههای داخلی را فراهم کند.
این تغییرات احتمالاً سرعت برخی فرایندهای تحقیقاتی را کاهش خواهد داد، اما OpenAI اعلام کرده است که افزایش سطح امنیت را در شرایط فعلی بر سرعت توسعه ترجیح میدهد.
نظارت بر رفتار مدلها؛ مهمترین لایه دفاعی جدید
یکی از مهمترین بخشهای رویکرد جدید OpenAI، ایجاد یک سامانه نظارتی گستردهتر برای بررسی رفتار مدلهاست.
این سامانه قرار است فعالیت ابزارها، آثار استدلالی قابل مشاهده و گزارشهای فعالیت مدلها را بررسی کند تا نشانههای رفتار غیرمجاز یا غیرعادی را شناسایی کند. OpenAI میگوید هدف آن است که هشدارهای مرتبط با فعالیتهای مشکوک حداکثر ظرف ۳۰ دقیقه پس از وقوع آنها صادر شوند.
البته اجرای چنین سامانه نظارتی به منابع محاسباتی قابل توجهی نیاز دارد. برآورد OpenAI نشان میدهد که پردازش مربوط به این نظارت حدود ۲۰ درصد از بار محاسباتی هر فرایندی را که تحت نظارت قرار میگیرد، به خود اختصاص خواهد داد.
این شرکت وعده داده است جزئیات فنی بیشتری درباره سازوکار نظارت در آینده منتشر کند.
هرچه مدل قدرتمندتر باشد، نظارت شدیدتر خواهد بود
آملیا گلیز، معاون تحقیقات OpenAI، در گفتوگو با خبرنگاران تأکید کرده است که سطح کنترلهای امنیتی متناسب با میزان خطر و توانایی مدلها تعیین خواهد شد.
به این ترتیب، مدلهایی که قابلیتهای پیشرفتهتر و بهویژه تواناییهای سایبری بیشتری دارند، تحت ارزیابیها و محدودیتهای سختگیرانهتری قرار خواهند گرفت.
این رویکرد نشان میدهد که OpenAI در حال حرکت به سمت یک مدل امنیتی چندلایه است؛ به این معنا که صرفاً به محدودیتهای نرمافزاری یا جلوگیری از تولید محتوای خطرناک اکتفا نمیکند و تلاش دارد محیط اجرا، شبکه، ابزارها و رفتار خود مدل را نیز همزمان تحت کنترل قرار دهد.
هنوز گزارش نهایی حادثه منتشر نشده است
با وجود معرفی تدابیر جدید، بررسی کامل حادثه Hugging Face هنوز به پایان نرسیده است. OpenAI پیشتر اعلام کرده بود که با همکاری مشاوران خارجی و تحت نظارت کمیته ایمنی و امنیت خود در حال بررسی این رویداد است و پس از پایان تحقیقات، گزارش فنی آن را منتشر خواهد کرد.
این شرکت همچنین تأکید کرده است که مدل پیش از انتشار درگیر این حادثه، یک نمونه آزمایشی داخلی بوده و برای عرضه عمومی برنامهریزی نشده بود. پس از حادثه نیز مدل مذکور غیرفعال، رمزگذاری و دسترسی پژوهشی به آن محدود شد.
حادثه Hugging Face نشان داد که توانایی مدلهای هوش مصنوعی در کشف و زنجیرهکردن آسیبپذیریها میتواند از محیط آزمایش فراتر برود و پیامدهای واقعی در زیرساختهای متصل به اینترنت داشته باشد. از همین رو، مسئله امنیت مدلها دیگر فقط به جلوگیری از پاسخهای خطرناک محدود نیست و کنترل محیطی که مدل در آن فعالیت میکند، به یکی از چالشهای اصلی توسعه هوش مصنوعی پیشرفته تبدیل شده است.∎