امنیت، اخلاق و قوانین هوش مصنوعی

تکنیک جدید OpenAI؛ چالشی بزرگ برای امنیت هوش مصنوعی

💡نکته کلیدی و خلاصه این مقاله:

استفاده از تکنیک استدلال جدید در مدل Astra شرکت OpenAI، موجی از نگرانی‌ها را میان متخصصان امنیت هوش مصنوعی ایجاد کرده است. این روش می‌تواند قابلیت نظارت بر زنجیره تفکر مدل را به شدت کاهش...

استفاده از تکنیک استدلال جدید در مدل Astra شرکت OpenAI، موجی از نگرانی‌ها را میان متخصصان امنیت هوش مصنوعی ایجاد کرده است. این روش می‌تواند قابلیت نظارت بر زنجیره تفکر مدل را به شدت کاهش دهد.

بر اساس گزارشی که روز سه‌شنبه در وب‌سایت The Information منتشر شد، مدل جدید Astra متعلق به شرکت OpenAI از تکنیک استدلالی موسوم به «عمق بازگشتی» (recurrent depth) استفاده خواهد کرد. این تکنیک به مدل اجازه می‌دهد تا خارج از چارچوب «تفکر متوالی» (sequential thinking) که ویژگی اصلی اکثر مدل‌های استدلال‌گر است، عمل کند. این روش که «بازگشت مبهم» (opaque recurrence) نیز نامیده می‌شود، احتمالا نظارت بر زنجیره تفکر (Chain of Thought یا CoT) مدل را دشوارتر خواهد کرد؛ امری که موجب نگرانی شدید کارشناسان امنیت هوش مصنوعی شده است.

اگرچه گفته می‌شود استفاده از این تکنیک در مدل Astra محدود است، اما ظهور آن همچنان نگرانی‌های جدی را در میان متخصصان حوزه ایمنی هوش مصنوعی ایجاد کرده است.

چالش‌های جدید در حوزه امنیت هوش مصنوعی

باک شلریگیس (Buck Shlegeris)، مدیرعامل شرکت Redwood، پس از انتشار این خبر در پستی نوشت: «گزارش‌ها مبنی بر استفاده Astra از روش بازگشت مبهم، من را بسیار نگران می‌کند. نمی‌دانم آیا نظارت بر زنجیره تفکر (CoT) در مدل Astra نسبت به مدل‌های قبلی دشوارتر شده است یا خیر، اما اگر OpenAI این تکنیک را بیشتر توسعه دهد، می‌تواند با افزایش شدید میزان بازگشت، قابلیت نظارت بر زنجیره تفکر را به‌طور کامل از بین ببرد.»

زوی موشویتز (Zvi Mowshowitz)، از پیشگامان حوزه امنیت هوش مصنوعی نیز در این باره اظهارنظر کرد و نوشت که شاید وضع قوانین برای جلوگیری از «رقابت مخرب» (race to the bottom) میان آزمایشگاه‌های هوش مصنوعی ضروری باشد.

موشویتز نوشت: «این تکنیک بازی با آتش است و خطر شکستن تابویی را به همراه دارد که OpenAI و Anthropic برای تثبیت آن تلاش جدی کرده‌اند؛ یعنی تلاش مستمر برای حفظ دقت و قابلیت نظارت بر زنجیره تفکر تا جای ممکن. استفاده گسترده‌تر از چنین تکنیک‌هایی احتمالا به قابلیت پایش و نظارت آسیب خواهد زد.»

در شرایط عادی، زنجیره تفکر یک مدل استدلال‌گر، گام‌های متوالی را که مدل برای حل یک مسئله طی می‌کند، ارائه می‌دهد. اگرچه این نمایش ممکن است بی‌نقص نباشد، اما همچنان ابزار ارزشمندی برای نظارت بر رفتارهای نادرست یا عدم هم‌راستایی (misalignment) محسوب می‌شود. در مورد فعالیت‌های اخیر و خودسرانه عامل‌های هوش مصنوعی OpenAI، سوابق زنجیره تفکر ابزار مهمی برای درک علت رفتار آن‌ها بود.

در روش «بازگشت مبهم»، مدل رویکردی کمتر خطی اتخاذ می‌کند و یک پرسش واحد را چندین بار در قالب یک حلقه (loop) پردازش می‌کند. نتیجه این کار، ردپای کمتری برای مشاهده باقی می‌گذارد و در واقع، سوابق سنتی زنجیره تفکر را دور می‌زند.

نکته حائز اهمیت این است که به نظر می‌رسد استفاده از این تکنیک در مدل Astra محدود باشد. انتظار می‌رود زنجیره تفکر این مدل همچنان قابل خواندن باشد و شرکت OpenAI با هرگونه ادعا مبنی بر تغییر رویکرد به سمت «زبان عصبی» (neuralese) مخالفت کرده است. همچنین، OpenAI پیش از این اعلام کرده بود که در قالب برنامه‌های ایمنی آینده‌نگرانه خود، قصد دارد سیستم‌های گسترده‌ای برای نظارت بر زنجیره تفکر ایجاد کند.

یاکوب پاچوکی، دانشمند ارشد OpenAI، در پستی در شبکه اجتماعی X بر تعهد این آزمایشگاه به «زنجیره‌های تفکر خوانا» (legible chains of thought) تأکید کرد. پاچوکی نوشت: «OpenAI از زمان اولین مدل‌های استدلالی خود، برای حفظ و بهره‌گیری از پایش زنجیره تفکر (chain-of-thought monitoring) تلاش کرده است. این موضوع یکی از اهداف اصلی برنامه تحقیقاتی فعلی ماست.»

همه مدل‌های هوش مصنوعی تا حدی از «استدلال مبهم» (opaque reasoning) استفاده می‌کنند و تعداد کمی از پژوهشگران، گزارش‌های زنجیره تفکر را به عنوان بازنمایی مستقیم استدلال یک مدل در نظر می‌گیرند. با این حال، این ملاحظات باعث رفع نگرانی‌ها نمی‌شود؛ چرا که تکرار رفتارهای مبهم ممکن است نظارت بر استدلال هوش مصنوعی را دشوارتر کند، به‌ویژه زمانی که استفاده از این تکنیک در مدل‌های مختلف گسترش یابد. نشریه The Information صبح روز چهارشنبه در گزارشی تکمیلی اعلام کرد که شرکت‌های Anthropic و Google DeepMind نیز پیش از این در حال بررسی این تکنیک بوده‌اند.

رایان گرینبلات، دانشمند ارشد Redwood Research، در پاسخی به این اخبار خاطرنشان کرد که استدلال مبهم می‌تواند بسیار سریع‌تر از استدلال‌های متداول مبتنی بر زنجیره تفکر گسترش یابد و به‌طور مؤثری تمام فرآیند استدلال را از دسترس نظارت خارج کند.

گرینبلات نوشت: «بزرگترین نگرانی من این است که روند تکامل طبیعی در این مسیر، منجر به گسترش استدلال مبهم تا حدی شود که مدل به‌طور کامل یا تقریبا کامل در “فضای نهفته” (latent space) استدلال کند. امیدوارم برای پرهیز از ساختارهای نگران‌کننده هنوز دیر نشده باشد و OpenAI در همین مرحله متوقف شود.»

همیار وب

تیم تحریریه همیار وب

مرجع تخصصی ابزارها، قالب‌ها و آموزش‌های عملی توسعه کسب‌وکار آنلاین مبتنی بر هوش مصنوعی و اتوماسیون.