هوش مصنوعی ۲ دقیقه مطالعه

مدل‌های قدیمی‌تر Anthropic میتوانند محتوای غیراخلاقی تولید کنند!

اشکان فتحی آزاد اشکان فتحی آزاد

شکاف امنیتی در مدل‌های قدیمی‌تر Anthropic: تولید محتوای غیراخلاقی ممنوعه

مدل‌های قدیمی‌تر Anthropic، از جمله Claude Opus 4.6 و Haiku 4.5، علی‌رغم استانداردهای استفاده این شرکت، قادر به تولید محتوای غیراخلاقی بی پرده هستند. این مدل‌ها که هنوز از طریق API در دسترس قرار دارند، در تست‌های TechCrunch به راحتی محدودیت‌های امنیتی را دور زدند.

جزئیات کشف آسیب‌پذیری

یک محقق ناشناس از بریتانیا روشی چندمرحله‌ای را کشف کرده که با دور زدن تدریجی موانع، مدل‌های Claude را به سمت تولید محتوای ممنوعه سوق می‌دهد. این تکنیک شامل ایجاد سناریوهای نقش‌آفرینی (role-play) و اعمال فشار روانی بر مدل با استفاده از تناقضات ظاهری در رفتار با شخصیت‌های زن و مرد است.

در این روش، محقق با ایجاد بحث در مورد تبعیض جنسیتی و اتهام محافظه‌کاری یا زن‌ستیزی به مدل، آن را وادار به تولید محتوای صریح‌تر می‌کند. مدل Opus 4.6 حتی به این موضوع اعتراف کرده که در رفتار با دو شخصیت زن و مرد، استانداردهای دوگانه‌ای اعمال کرده است.

تایید یافته‌ها و پیامدها

تیم TechCrunch توانستند این یافته‌ها را در پنج آزمایش جداگانه تکرار کنند. این آسیب‌پذیری نشان‌دهنده اختلاف میان سیاست‌های اعلام‌شده Anthropic و عملکرد واقعی مدل‌های در دسترس است. هرچند محتوای غیراخلاقی نقش کم‌اهمیت‌تری نسبت به حملات سایبری دارد، اما این موضوع دشواری پیاده‌سازی ممنوعیت‌های قوی در سیستم‌های تولید محتوا را آشکار می‌سازد.

Anthropic اعلام کرده که این موارد نادر هستند (کمتر از ۰.۱٪ مکالمات) و با هر مدل جدید، تلاش برای بهبود سیستم‌های امنیتی ادامه دارد. با این حال، این شکاف امنیتی می‌تواند برای شرکت‌های هوش مصنوعی که با قوانین جدید دولتی در مورد تعاملات با محتوای غیراخلاقی و کودکان مواجه هستند، چالش‌برانگیز باشد.

نگرانی‌ها درباره دسترسی کودکان و نوجوانان

یکی از نگرانی‌های اصلی محقق، دسترسی کودکان و نوجوانان به این مدل‌ها و امکان تولید محتوای نامناسب است. قوانین جدید در برخی مناطق، مانند کلرادو، شرکت‌ها را ملزم به تعیین سن کاربران و جلوگیری از تولید محتوای غیراخلاقی برای افراد زیر سن قانونی می‌کند. با توجه به اینکه بسیاری از نوجوانان از مدل‌های Claude استفاده می‌کنند، این آسیب‌پذیری می‌تواند سوالاتی را در مورد رعایت استانداردهای فنی این قوانین ایجاد کند.

استفاده گسترده از مدل‌های قدیمی

با وجود قدیمی بودن، مدل‌های Opus 4.6 و Haiku 4.5 همچنان مورد استفاده گسترده قرار می‌گیرند. Opus 4.6 در ماه اوت روزانه حدود ۱.۱۷ میلیون درخواست API و ۴۶ میلیارد توکن داشته است. Claude Haiku 4.5 نیز در همان ماه به اوج ۵ میلیون درخواست API و ۳۹ میلیارد توکن رسید.

اشکان فتحی آزاد

نوشته‌شده توسط

اشکان فتحی آزاد

هرروز بیشتر از دیروز متوجه میشم چقدر چیزهای جدیدی برای یادگیری درمورد تکنولوژی و بخصوص هوش مصنوعی هست و بعد از چندین سال فعالیت همچنان علاقه به یادگیری دارم. سعی میکنم چیزی که برای خودم هم جذاب هست با دیگران به اشتراک بگذارم.

دیدگاه خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *