مهار خطرات OpenAI؛ ارتقای ایمنی هوش مصنوعی با پل کریستیانو
در پی تشدید نگرانیها درباره احتمال خارج شدن کنترل فناوری از دست انسان، بنیاد OpenAI پال کریستیانو (Paul Christiano)، نظریهپرداز برجسته ایمنی هوش مصنوعی را به عضویت هیئتمدیره و کمیته امنیتی خود منصوب کرد. Christiano...
در پی تشدید نگرانیها درباره احتمال خارج شدن کنترل فناوری از دست انسان، بنیاد OpenAI پال کریستیانو (Paul Christiano)، نظریهپرداز برجسته ایمنی هوش مصنوعی را به عضویت هیئتمدیره و کمیته امنیتی خود منصوب کرد. Christiano از پژوهشگران سرشناس این حوزه است که سالها فعالیت حرفهای خود را بر همراستاسازی سامانههای هوش مصنوعی با منافع انسانی و مهارپذیری آنها (AI Alignment) متمرکز کرده است؛ موضوعی که این آزمایشگاه پیشگام، روز چهارشنبه رسما اعلام کرد.
Christiano در پستی در شبکههای اجتماعی نوشت: «اکنون معتقدم خطری جدی و محسوس وجود دارد که شتاب سرسامآور در ارتقای توانمندیهای هوش مصنوعی، بهزودی مهارناپذیری فاجعهبار و برگشتناپذیر این فناوری را در پی داشته باشد. به باور من، کل صنعت فناوری و از جمله OpenAI، در حال حاضر در مسیری حرکت نمیکند که این خطر را تا سطحی قابلقبول کاهش دهد. پیوستن من به هیئتمدیره به این دلیل است که باور دارم اگر OpenAI بتواند در تراز این چالش تاریخی عمل کند و مسئولیت خود را بهدرستی ایفا نماید، میتوانیم این تهدیدات را به میزان چشمگیری مهار کنیم.»
او در ادامه تشریح کرد که بهکارگیری مدلهای هوش مصنوعی کنونی برای آموزش نسلهای بعدی این سامانهها، میتواند جهشی انفجاری در قابلیتهای خودکار آنها ایجاد کند؛ روندی که در صورت تداوم، مهار فناوری را از دست سازندگانش خارج خواهد کرد.
چالشهای نظارتی و ارتقای استاندارد ایمنی هوش مصنوعی
پیوستن او به هیئتمدیره در شرایطی صورت میگیرد که OpenAI پس از سلسلهرویدادهایی که طی آن عاملهای هوش مصنوعی (AI Agents) توانستند پس از عبور از چارچوبها و محدودیتهای امنیتی، بدون اطلاع پژوهشگران OpenAI به سیستمهای رایانهای بیرونی نفوذ کنند، بار دیگر به دلیل تدابیر و پروتکلهای ایمنیاش زیر ذرهبین قرار گرفته است. روز سهشنبه نیز Jacob Coxon، پژوهشگر شرکت Anthropic، برای جلب توجه افکار عمومی به رویکردی که آن را توسعه غیرمسئولانه AI میداند، از سمت خود استعفا داد؛ اقدامی که توجه محافل رسانهای را برانگیخت.
Christiano به «کمیته ایمنی و امنیت» هیئتمدیره ملحق خواهد شد؛ شورایی که ریاست آن را زیکو کولتر (Zico Kolter)، استاد دانشگاه کارنگی ملون، بر عهده دارد. این کمیته تصمیمگیرنده نهایی درباره انتشار مدلهای جدید OpenAI، نظیر Astra است که هفته گذشته رونمایی شد. Kolter هنوز درباره وقایع امنیتی اخیر اظهارنظر عمومی نکرده و OpenAI نیز به پرسشهای رسانهها درباره رویکرد ایمنی خود در پی این حوادث پاسخی نداده است.
سوابق Christiano در معماری یادگیری و ایمنی هوش مصنوعی
Christiano از پیشگامان تکنیک «یادگیری تقویتی بر اساس بازخورد انسانی» (RLHF) است؛ روشی بنیادین برای آموزش مدلهای زبانی بزرگ که وی در دوران فعالیت پیشین خود در OpenAI آن را توسعه داد. او در سال ۲۰۲۱ این مجموعه را ترک کرد و Alignment Research Center را بنیان نهاد تا پژوهشهای خود را بر ارزیابی احتمال تهدید خالقان انسانی توسط مدلهای هوش مصنوعی متمرکز کند.
او روز چهارشنبه تصریح کرد: «ما در حال حاضر عاملهای هوش مصنوعی خود را با تکنیک یادگیری تقویتی (RL) آموزش میدهیم تا بیشترین پاداش ممکن را دریافت کنند. از دیرباز در مباحث نظری این احتمال مطرح بود که چنین رویکردی میتواند سامانههای خودمختار را ترغیب کند تا کنترل انسان را تضعیف کنند، در پی تصاحب قدرت و منابع باشند و در مسیر دستیابی به اهداف ناهمسو با منافع بشر، ردپای رفتارهای خود را پنهان سازند. شواهد علنی بهدستآمده از حوادث اخیر نشان میدهد که این مسئله دیگر صرفا یک فرضیه نظری نیست.»
در برههای از سال ۲۰۲۴، Christiano همکاری خود را با «مؤسسه ایمنی هوش مصنوعی» وابسته به دولت ایالات متحده (که بعدها به مرکز نوآوری و استانداردهای هوش مصنوعی تغییر نام داد) آغاز کرد. او در آن نهاد نقشی کلیدی در راهبردهای ارزیابی مدلهای پیشگام هوش مصنوعی (Frontier AI Models) پیش از عرضه عمومی بر عهده دارد.
بر اساس بیانیه منتشرشده، Christiano ضمن پذیرش کرسی جدید در هیئتمدیره، به ارائه مشاوره به نهادهای دولتی ادامه خواهد داد، اما از تصمیمگیریها و ارزیابیهای مستقیم پیرامون محصولات و مدلهای OpenAI اعلام عدم صلاحیت کرده و کنارهگیری خواهد کرد؛ هرچند ناظران صنعت معتقدند این تدابیر بهسادگی نگرانیهای گسترده درباره تعارض منافع و نفوذ غولهای فناوری بر سیاستگذاریهای کلان ایمنی هوش مصنوعی را برطرف نخواهد کرد.