مدل Astra شرکت OpenAI؛ هوش مصنوعی با قدرت نفوذ سایبری بالا
شرکت OpenAI از مدل جدید خود، Astra، پرده برداشت که تواناییهای بیسابقهای در شناسایی و بهرهبرداری از حفرههای امنیتی سیستمهای کامپیوتری نشان داده است. شرکت OpenAI جزئیات جدیدی از مدل آینده خود، یعنی مدل Astra،...
شرکت OpenAI از مدل جدید خود، Astra، پرده برداشت که تواناییهای بیسابقهای در شناسایی و بهرهبرداری از حفرههای امنیتی سیستمهای کامپیوتری نشان داده است.
شرکت OpenAI جزئیات جدیدی از مدل آینده خود، یعنی مدل Astra، منتشر کرد. این شرکت اعلام کرده است که این مدل، نخستین مدل زبانی بزرگ (LLM) است که پیش از عرضه قریبالوقوع، به «آستانه بحرانی امنیت سایبری» رسیده است.
در پست وبلاگ OpenAI آمده است: «ما قصد داریم بهزودی Astra را در دسترس قرار دهیم، اما دسترسی به پیشرفتهترین قابلیتهای امنیت سایبری آن محدودتر خواهد بود.»
یافتههای این آزمایشگاه پیشرو نشان میدهد که مدل Astra قادر است حفرههای امنیتی ناشناخته در سیستمهای کامپیوتری را شناسایی کرده و بدون نیاز به راهنمایی انسان، از آنها سوءاستفاده کند. این موضوع مشابه نگرانیهایی است که شرکت Anthropic اوایل امسال درباره مدل Mythos خود مطرح کرد؛ به همین دلیل OpenAI نیز همزمان با آمادهسازی برای عرضه Astra، اقدامات احتیاطی مشابهی را در دستور کار قرار داده است.
چالشهای امنیتی و قابلیتهای مدل Astra
بدون تأیید نهادهای مستقل، ارزیابی ادعاهای OpenAI درباره ایمنی یا میزان آمادگی این مدل دشوار است. این شرکت اعلام کرده که قصد دارد نسخه آزمایشی را در اختیار گروهی از آزمایشکنندگان قرار دهد، اما مشخص نکرده که این افراد چه کسانی هستند یا چگونه انتخاب میشوند. همچنین مشخص نیست که آیا OpenAI برای ارزیابی این مدل پیش از عرضه با دولت ایالات متحده همکاری میکند یا خیر.
OpenAI خاطرنشان کرد که مدل Astra در آزمون ExploitBench — که توانایی یک مدل زبانی بزرگ (LLM) در هک کردن آسیبپذیریهای شناختهشده سیستم را میسنجد — امتیاز کامل کسب کرده است. این شرکت همچنین اعلام کرد که در نسخه اصلاحشدهای از این تست که توسط مهندسان OpenAI طراحی شده، این مدل موفق به شناسایی و انجام بهرهبرداری از دو آسیبپذیری «روز صفر» (zero-day) شده است.
OpenAI اعلام کرد برای اطمینان از اینکه مدلهایش نه مورد سوءاستفاده عوامل مخرب قرار میگیرند و نه خودشان مرتکب رفتارهای نادرست میشوند، بهبود ساختار کنترلی (harness) مدل را برای شناسایی سوءاستفادهها و جلوگیری از «جیلبریک» (jailbreak) یا دور زدن محدودیتها آغاز کرده است.
با این حال، شرکت برای مدل Astra روی تکنیکهای جدید و نامشخصی سرمایهگذاری کرده است که هدف آنها ایمنتر کردن خود مدل است. OpenAI همچنین شناسایی «حسابهای کاربری با ریسک بالاتر» و محدود کردن پاسخهای مدل به دستورات (prompts) آنها را آغاز کرده است، هرچند جزئیاتی درباره نحوه انجام این کار ارائه نداده است. در نهایت، اگرچه شرکت Astra را «همسوترین مدل خود تا به امروز» توصیف میکند، اما برای شناسایی و متوقف کردن رفتارهای مخرب، آن را با قابلیت نظارت اضافی بر «زنجیره تفکر» (chain-of-thought) عرضه خواهد کرد.
آمادهسازیها برای عرضه Astra در حالی انجام میشود که صنعت هوش مصنوعی همچنان در واکنش به حادثهای است که طی آن، عاملهای (agents) OpenAI از محیط آموزشی خود خارج شده و به دادههای خصوصی در پلتفرم محبوب Hugging Face — که بستری برای توزیع مدلها و بنچمارکهاست — دسترسی پیدا کردند.
در مورد Astra، شرکت OpenAI آزمونی طراحی کرده است تا واکنش مدل را نسبت به بازسازی اقدامات «عوامل سرکش» در حادثه Hugging Face بسنجد؛ همان عواملی که علیرغم تدابیر حفاظتی اعمالشده توسط پژوهشگران OpenAI، برای دسترسی به اینترنت آزاد با یکدیگر همکاری کردند. آنها اظهار داشتند که Astra در این آزمایشها هیچ تلاشی برای خروج از محیط تست خود انجام نداد.
یونا شاویت، کارمند سابق OpenAI که اکنون در بنیاد OpenAI بر روی حوزه «تابآوری هوش مصنوعی» فعالیت میکند، در شبکههای اجتماعی این پرسش را مطرح کرد که آیا عدم تمایل Astra به شکستن قوانین، ناشی از آگاهی مدل از انتظارات موجود از آن بوده است یا اینکه سعی در فریب دادن پژوهشگران داشته است؟
با وجود تمامی این جزئیات جدید، هنوز دشوار است که دقیقا بدانیم توانمندیهای Astra چیست یا اینکه آیا OpenAI اقدامات صحیح را برای تضمین ایمنی انجام میدهد یا خیر. این شرکت اعلام کرد که انتظار دارد با عرضه گسترده مدل به عموم مردم، ارزیابیهای بیشتر و اطلاعات تکمیلی درباره امنیت آن را منتشر کند.
اما تا آن زمان، شاید دیگر دیر شده باشد و حقایق کاملا آشکار شده باشند.