امنیت، اخلاق و قوانین هوش مصنوعی

مدل Astra شرکت OpenAI؛ هوش مصنوعی با قدرت نفوذ سایبری بالا

💡نکته کلیدی و خلاصه این مقاله:

شرکت OpenAI از مدل جدید خود، Astra، پرده برداشت که توانایی‌های بی‌سابقه‌ای در شناسایی و بهره‌برداری از حفره‌های امنیتی سیستم‌های کامپیوتری نشان داده است. شرکت OpenAI جزئیات جدیدی از مدل آینده خود، یعنی مدل Astra،...

شرکت OpenAI از مدل جدید خود، Astra، پرده برداشت که توانایی‌های بی‌سابقه‌ای در شناسایی و بهره‌برداری از حفره‌های امنیتی سیستم‌های کامپیوتری نشان داده است.

شرکت OpenAI جزئیات جدیدی از مدل آینده خود، یعنی مدل Astra، منتشر کرد. این شرکت اعلام کرده است که این مدل، نخستین مدل زبانی بزرگ (LLM) است که پیش از عرضه قریب‌الوقوع، به «آستانه بحرانی امنیت سایبری» رسیده است.

در پست وبلاگ OpenAI آمده است: «ما قصد داریم به‌زودی Astra را در دسترس قرار دهیم، اما دسترسی به پیشرفته‌ترین قابلیت‌های امنیت سایبری آن محدودتر خواهد بود.»

یافته‌های این آزمایشگاه پیشرو نشان می‌دهد که مدل Astra قادر است حفره‌های امنیتی ناشناخته در سیستم‌های کامپیوتری را شناسایی کرده و بدون نیاز به راهنمایی انسان، از آن‌ها سوءاستفاده کند. این موضوع مشابه نگرانی‌هایی است که شرکت Anthropic اوایل امسال درباره مدل Mythos خود مطرح کرد؛ به همین دلیل OpenAI نیز همزمان با آماده‌سازی برای عرضه Astra، اقدامات احتیاطی مشابهی را در دستور کار قرار داده است.

چالش‌های امنیتی و قابلیت‌های مدل Astra

بدون تأیید نهادهای مستقل، ارزیابی ادعاهای OpenAI درباره ایمنی یا میزان آمادگی این مدل دشوار است. این شرکت اعلام کرده که قصد دارد نسخه آزمایشی را در اختیار گروهی از آزمایش‌کنندگان قرار دهد، اما مشخص نکرده که این افراد چه کسانی هستند یا چگونه انتخاب می‌شوند. همچنین مشخص نیست که آیا OpenAI برای ارزیابی این مدل پیش از عرضه با دولت ایالات متحده همکاری می‌کند یا خیر.

OpenAI خاطرنشان کرد که مدل Astra در آزمون ExploitBench — که توانایی یک مدل زبانی بزرگ (LLM) در هک کردن آسیب‌پذیری‌های شناخته‌شده سیستم را می‌سنجد — امتیاز کامل کسب کرده است. این شرکت همچنین اعلام کرد که در نسخه اصلاح‌شده‌ای از این تست که توسط مهندسان OpenAI طراحی شده، این مدل موفق به شناسایی و انجام بهره‌برداری از دو آسیب‌پذیری «روز صفر» (zero-day) شده است.

OpenAI اعلام کرد برای اطمینان از اینکه مدل‌هایش نه مورد سوءاستفاده عوامل مخرب قرار می‌گیرند و نه خودشان مرتکب رفتارهای نادرست می‌شوند، بهبود ساختار کنترلی (harness) مدل را برای شناسایی سوءاستفاده‌ها و جلوگیری از «جیل‌بریک» (jailbreak) یا دور زدن محدودیت‌ها آغاز کرده است.

با این حال، شرکت برای مدل Astra روی تکنیک‌های جدید و نامشخصی سرمایه‌گذاری کرده است که هدف آن‌ها ایمن‌تر کردن خود مدل است. OpenAI همچنین شناسایی «حساب‌های کاربری با ریسک بالاتر» و محدود کردن پاسخ‌های مدل به دستورات (prompts) آن‌ها را آغاز کرده است، هرچند جزئیاتی درباره نحوه انجام این کار ارائه نداده است. در نهایت، اگرچه شرکت Astra را «همسوترین مدل خود تا به امروز» توصیف می‌کند، اما برای شناسایی و متوقف کردن رفتارهای مخرب، آن را با قابلیت نظارت اضافی بر «زنجیره تفکر» (chain-of-thought) عرضه خواهد کرد.

آماده‌سازی‌ها برای عرضه Astra در حالی انجام می‌شود که صنعت هوش مصنوعی همچنان در واکنش به حادثه‌ای است که طی آن، عامل‌های (agents) OpenAI از محیط آموزشی خود خارج شده و به داده‌های خصوصی در پلتفرم محبوب Hugging Face — که بستری برای توزیع مدل‌ها و بنچمارک‌هاست — دسترسی پیدا کردند.

در مورد Astra، شرکت OpenAI آزمونی طراحی کرده است تا واکنش مدل را نسبت به بازسازی اقدامات «عوامل سرکش» در حادثه Hugging Face بسنجد؛ همان عواملی که علیرغم تدابیر حفاظتی اعمال‌شده توسط پژوهشگران OpenAI، برای دسترسی به اینترنت آزاد با یکدیگر همکاری کردند. آن‌ها اظهار داشتند که Astra در این آزمایش‌ها هیچ تلاشی برای خروج از محیط تست خود انجام نداد.

یونا شاویت، کارمند سابق OpenAI که اکنون در بنیاد OpenAI بر روی حوزه «تاب‌آوری هوش مصنوعی» فعالیت می‌کند، در شبکه‌های اجتماعی این پرسش را مطرح کرد که آیا عدم تمایل Astra به شکستن قوانین، ناشی از آگاهی مدل از انتظارات موجود از آن بوده است یا اینکه سعی در فریب دادن پژوهشگران داشته است؟

با وجود تمامی این جزئیات جدید، هنوز دشوار است که دقیقا بدانیم توانمندی‌های Astra چیست یا اینکه آیا OpenAI اقدامات صحیح را برای تضمین ایمنی انجام می‌دهد یا خیر. این شرکت اعلام کرد که انتظار دارد با عرضه گسترده مدل به عموم مردم، ارزیابی‌های بیشتر و اطلاعات تکمیلی درباره امنیت آن را منتشر کند.

اما تا آن زمان، شاید دیگر دیر شده باشد و حقایق کاملا آشکار شده باشند.

همیار وب

تیم تحریریه همیار وب

مرجع تخصصی ابزارها، قالب‌ها و آموزش‌های عملی توسعه کسب‌وکار آنلاین مبتنی بر هوش مصنوعی و اتوماسیون.