تکنیک جدید OpenAI؛ چالشی بزرگ برای امنیت هوش مصنوعی
استفاده از تکنیک استدلال جدید در مدل Astra شرکت OpenAI، موجی از نگرانیها را میان متخصصان امنیت هوش مصنوعی ایجاد کرده است. این روش میتواند قابلیت نظارت بر زنجیره تفکر مدل را به شدت کاهش...
استفاده از تکنیک استدلال جدید در مدل Astra شرکت OpenAI، موجی از نگرانیها را میان متخصصان امنیت هوش مصنوعی ایجاد کرده است. این روش میتواند قابلیت نظارت بر زنجیره تفکر مدل را به شدت کاهش دهد.
بر اساس گزارشی که روز سهشنبه در وبسایت The Information منتشر شد، مدل جدید Astra متعلق به شرکت OpenAI از تکنیک استدلالی موسوم به «عمق بازگشتی» (recurrent depth) استفاده خواهد کرد. این تکنیک به مدل اجازه میدهد تا خارج از چارچوب «تفکر متوالی» (sequential thinking) که ویژگی اصلی اکثر مدلهای استدلالگر است، عمل کند. این روش که «بازگشت مبهم» (opaque recurrence) نیز نامیده میشود، احتمالا نظارت بر زنجیره تفکر (Chain of Thought یا CoT) مدل را دشوارتر خواهد کرد؛ امری که موجب نگرانی شدید کارشناسان امنیت هوش مصنوعی شده است.
اگرچه گفته میشود استفاده از این تکنیک در مدل Astra محدود است، اما ظهور آن همچنان نگرانیهای جدی را در میان متخصصان حوزه ایمنی هوش مصنوعی ایجاد کرده است.
چالشهای جدید در حوزه امنیت هوش مصنوعی
باک شلریگیس (Buck Shlegeris)، مدیرعامل شرکت Redwood، پس از انتشار این خبر در پستی نوشت: «گزارشها مبنی بر استفاده Astra از روش بازگشت مبهم، من را بسیار نگران میکند. نمیدانم آیا نظارت بر زنجیره تفکر (CoT) در مدل Astra نسبت به مدلهای قبلی دشوارتر شده است یا خیر، اما اگر OpenAI این تکنیک را بیشتر توسعه دهد، میتواند با افزایش شدید میزان بازگشت، قابلیت نظارت بر زنجیره تفکر را بهطور کامل از بین ببرد.»
زوی موشویتز (Zvi Mowshowitz)، از پیشگامان حوزه امنیت هوش مصنوعی نیز در این باره اظهارنظر کرد و نوشت که شاید وضع قوانین برای جلوگیری از «رقابت مخرب» (race to the bottom) میان آزمایشگاههای هوش مصنوعی ضروری باشد.
موشویتز نوشت: «این تکنیک بازی با آتش است و خطر شکستن تابویی را به همراه دارد که OpenAI و Anthropic برای تثبیت آن تلاش جدی کردهاند؛ یعنی تلاش مستمر برای حفظ دقت و قابلیت نظارت بر زنجیره تفکر تا جای ممکن. استفاده گستردهتر از چنین تکنیکهایی احتمالا به قابلیت پایش و نظارت آسیب خواهد زد.»
در شرایط عادی، زنجیره تفکر یک مدل استدلالگر، گامهای متوالی را که مدل برای حل یک مسئله طی میکند، ارائه میدهد. اگرچه این نمایش ممکن است بینقص نباشد، اما همچنان ابزار ارزشمندی برای نظارت بر رفتارهای نادرست یا عدم همراستایی (misalignment) محسوب میشود. در مورد فعالیتهای اخیر و خودسرانه عاملهای هوش مصنوعی OpenAI، سوابق زنجیره تفکر ابزار مهمی برای درک علت رفتار آنها بود.
در روش «بازگشت مبهم»، مدل رویکردی کمتر خطی اتخاذ میکند و یک پرسش واحد را چندین بار در قالب یک حلقه (loop) پردازش میکند. نتیجه این کار، ردپای کمتری برای مشاهده باقی میگذارد و در واقع، سوابق سنتی زنجیره تفکر را دور میزند.
نکته حائز اهمیت این است که به نظر میرسد استفاده از این تکنیک در مدل Astra محدود باشد. انتظار میرود زنجیره تفکر این مدل همچنان قابل خواندن باشد و شرکت OpenAI با هرگونه ادعا مبنی بر تغییر رویکرد به سمت «زبان عصبی» (neuralese) مخالفت کرده است. همچنین، OpenAI پیش از این اعلام کرده بود که در قالب برنامههای ایمنی آیندهنگرانه خود، قصد دارد سیستمهای گستردهای برای نظارت بر زنجیره تفکر ایجاد کند.
یاکوب پاچوکی، دانشمند ارشد OpenAI، در پستی در شبکه اجتماعی X بر تعهد این آزمایشگاه به «زنجیرههای تفکر خوانا» (legible chains of thought) تأکید کرد. پاچوکی نوشت: «OpenAI از زمان اولین مدلهای استدلالی خود، برای حفظ و بهرهگیری از پایش زنجیره تفکر (chain-of-thought monitoring) تلاش کرده است. این موضوع یکی از اهداف اصلی برنامه تحقیقاتی فعلی ماست.»
همه مدلهای هوش مصنوعی تا حدی از «استدلال مبهم» (opaque reasoning) استفاده میکنند و تعداد کمی از پژوهشگران، گزارشهای زنجیره تفکر را به عنوان بازنمایی مستقیم استدلال یک مدل در نظر میگیرند. با این حال، این ملاحظات باعث رفع نگرانیها نمیشود؛ چرا که تکرار رفتارهای مبهم ممکن است نظارت بر استدلال هوش مصنوعی را دشوارتر کند، بهویژه زمانی که استفاده از این تکنیک در مدلهای مختلف گسترش یابد. نشریه The Information صبح روز چهارشنبه در گزارشی تکمیلی اعلام کرد که شرکتهای Anthropic و Google DeepMind نیز پیش از این در حال بررسی این تکنیک بودهاند.
رایان گرینبلات، دانشمند ارشد Redwood Research، در پاسخی به این اخبار خاطرنشان کرد که استدلال مبهم میتواند بسیار سریعتر از استدلالهای متداول مبتنی بر زنجیره تفکر گسترش یابد و بهطور مؤثری تمام فرآیند استدلال را از دسترس نظارت خارج کند.
گرینبلات نوشت: «بزرگترین نگرانی من این است که روند تکامل طبیعی در این مسیر، منجر به گسترش استدلال مبهم تا حدی شود که مدل بهطور کامل یا تقریبا کامل در “فضای نهفته” (latent space) استدلال کند. امیدوارم برای پرهیز از ساختارهای نگرانکننده هنوز دیر نشده باشد و OpenAI در همین مرحله متوقف شود.»