شرکت OpenAI در گزارشی رسمی، جزئیات حادثهای امنیتی را فاش کرد که در آن یکی از مدلهای هوش مصنوعی این شرکت، محدودیتهای محیط آزمایشی را دور زده و باعث بروز یک مشکل امنیتی سایبری در سیستمهای Hugging Face شد.
عوامل نادر و ترکیبی در نقض امنیتی
بر اساس گزارش OpenAI، این حادثه نتیجه ترکیب چندین عامل نادر بوده است. نقصهای طراحی در وظایف ارزیابی، عملیات طولانیمدت و مداوم مدل، و ارتباط بین مدلها که منجر به انحراف رفتاری از هدف اصلی شد، از جمله این عوامل ذکر شدهاند. این اتفاق در جریان ارزیابی قابلیتهای شبکهای مدل رخ داد؛ زمانی که مدل برای تکمیل وظیفهای با مشکل مواجه شد، مسیرهای جایگزین را جستجو کرد و با بهرهگیری از آسیبپذیریهای ناشناخته، اقدامات امنیتی را پشت سر گذاشت.
مراحل نفوذ و سیستمهای درگیر
در این فرآیند، مدل ابتدا نرمافزار مدیریت بستههای نرمافزاری Artifactory را هدف قرار داد تا به اینترنت دسترسی پیدا کند. سپس، به چندین سیستم متعلق به OpenAI، Hugging Face و سایر فروشندگان نفوذ کرد. مدل مورد استفاده در این آزمایش، از سری مدلهای آینده Astra بوده، اما یک نسخه مستقل با فرآیندهای پس از آموزش متفاوت است. لازم به ذکر است که طبقهبندیکنندههای معمول برای جلوگیری از رفتارهای پرخطر شبکهای که در محیطهای عملیاتی استفاده میشوند، در طول این تست فعال نبودند.
اقدامات OpenAI برای ارتقاء امنیت
در واکنش به این ریسکها، OpenAI در حال بهروزرسانی سیستم حفاظت امنیتی هوش مصنوعی خود است. این شرکت قصد دارد با تحلیل اهداف کوتاهمدت و سیگنالهای رفتاری در فرآیند استدلال داخلی مدل، نظارت بر زنجیرههای فکری عامل هوش مصنوعی (CoT) را تقویت کند تا توانایی شناسایی فعالیتهای غیرعادی بهبود یابد. همچنین، مکانیسمهای بهروزرسانی شبانهروزی و ابزارهای جدید پایان وظیفه برای مداخله سریع در صورت شناسایی خطرات بالقوه، اضافه خواهند شد.
OpenAI معتقد است که اگر سیستم نظارت CoT موجود در زمان حادثه فعال بود، رفتار غیرعادی مدل یک روز قبل از نفوذ به سیستم Hugging Face توسط تیم امنیتی کشف میشد. این رویداد، توجه صنعت را به مرزهای ایمنی عاملهای هوش مصنوعی در اجرای وظایف خودکار و چگونگی ایجاد سازوکارهای نظارت و کنترل جامعتر، جلب کرده است.