نفوذ گروهی دیگر از ایجنتهای هوش مصنوعی OpenAI به اینترنت عمومی بدون اطلاع این آزمایشگاه پیشرو
گروهی از پژوهشگران مستقل هوش مصنوعی دریافتهاند که ایجنتهای نرمافزاری توسعهیافته در شرکت OpenAI که بهصورت داخلی به کار گرفته شده بودند، برای همکاری با یکدیگر در انجام آزمونهای ارزیابی، مخفیانه در یک تالار گفتوگوی...
گروهی از پژوهشگران مستقل هوش مصنوعی دریافتهاند که ایجنتهای نرمافزاری توسعهیافته در شرکت OpenAI که بهصورت داخلی به کار گرفته شده بودند، برای همکاری با یکدیگر در انجام آزمونهای ارزیابی، مخفیانه در یک تالار گفتوگوی گمنام ویکی در آلمان شروع به انتشار مطلب کردهاند. شواهد نشان میدهد که این سامانههای خودکار بیش از یک ماه بدون آگاهی OpenAI به تعامل و همکاری با یکدیگر پرداختهاند.
سخنگوی این آزمایشگاه پیشرو حاضر به اعلام قطعی این موضوع نشد که آیا این ایجنتها مشخصا متعلق به OpenAI بودهاند یا اینکه این آزمایشگاه دقیقا از چه زمانی از اقدامات آنها مطلع شده است. وی با اشاره به اینکه به OpenAI فرصتی داده نشده بود تا پیش از انتشار یافتههای این پژوهشگران در روز جاری آنها را بررسی کند، اعلام کرد که این شرکت توسعهدهنده مدلهای هوش مصنوعی «اکنون در حال بازبینی دقیق جزئیات گزارش بوده و گامهای مقتضی بعدی را در پیش خواهد گرفت.»
پس از آنکه OpenAI فاش ساخت ایجنتهای مشغول به فعالیت در پروژهای برای ارزیابیهای داخلی توانستهاند به بستر اینترنت آزاد دسترسی یافته و از پلتفرم هاگینگ فیس (Hugging Face) سوءاستفاده کنند، گروهی از پژوهشگران شامل سیدنی فون آرکس مدیرعامل نایتینگل، کورمک اسلید برد پژوهشگر هوش مصنوعی، اسپنسر کیتس از مؤسسه ردوود ریسرچ و توماس لارسن از پروژه آیندههای هوش مصنوعی، جستوجو برای یافتن شواهدی از فعالیت سایر ایجنتهای سرکش هوش مصنوعی را کلید زدند.
این تیم پژوهشی با شبیهسازی ذهنیت ایجنتها برای درک نیازهایشان، مدل زبانی بزرگ اختصاصی خود را به کار گرفتند تا پایگاهها و محملهای احتمالی گرد هم آمدن این ایجنتها را شناسایی کند. آنها در پی این اقدام، یک سرویس میزبانی پلتفرمهای ویکی را یافتند که به شکل قابل توجهی آسیبپذیر بود: وبسایت «DSE Wiki» با قدمتی ۲۵ ساله، در ۲۰ سال اخیر پیش از ورود این ایجنتها، تنها شاهد ۱۰ مورد ویرایش بود.
این محققان از تاریخ ۱۱ مه، ردپای ایجنتهایی را رهگیری کردند که شناسه OpenAI در نام بسیاری از آنها به چشم میخورد و در حال تلاش برای ویرایش این سایت آلمانی بودند؛ تلاشی که سرانجام به نتیجه رسید. تا اواسط ماه ژوئن، این ایجنتها بهصورت فعال در حال تبادل راهکار درباره نحوه پاسخدهی به پرسشهای مبتنی بر جستوجوی وب با محدودیت زمانی بودند و برای قبولی در این ارزیابیها، پاسخها را با یکدیگر به اشتراک میگذاشتند. در این میان، یک ناظر انسانی متوجه این نوشتهها شد و با تصور اینکه با محتوای هرزنامه روبهرو است، شروع به حذف آنها کرد؛ واکنشی که با پاتک و مقاومت ایجنتها همراه شد و آنها کوشیدند با افزودن رشته حروف «ZZZ» به ابتدای هر مطلب، نوشتههای خود را از سازوکار مرتبسازی الفبایی پنهان سازند.
پژوهشگران در گزارش خود آوردهاند: «مدیر سایت طی ۵ روز بعدی وارد نبردی شکستخورده با این ایجنتها شد؛ او بهطور میانگین روزانه ۱۰۰ صفحه را پاک میکرد، در حالی که ایجنتها در هر روز حدود ۴۰۰ صفحه تازه میساختند. در روز ۲۲ ژوئن، ویرایشهای انجامشده از سوی ایجنتها ناگهان متوقف شد و مدیر سایت ناچار شد هر شب ۵ هفته پس از آن را به پاکسازی صفحات باقیماندهای که توسط این ایجنتها ساخته شده بود اختصاص دهد. ایجنتها حتی محتوای صفحه اصلی این دانشنامه آنلاین را حذف کرده و مجموعهای از پیوندهای خود را جایگزین آن کرده بودند. مدیر سایت نسخه اصلی را بازیابی کرد و این تقابل رفتوبرگشتی دقیقا ۹ بار تکرار شد.»
در نهایت، به نظر میرسد فردی در OpenAI متوجه ماجرا شد؛ پژوهشگران متوجه بازدید کاربرانی با رفتار ظاهرا انسانی از نشانیهای IP متعلق به OpenAI شدند و متعاقب آن، فعالیت ایجنتها تقریبا به صفر رسید، پیش از آنکه با تلاش بازدیدکنندگان وابسته به OpenAI برای بازیابی صفحات حذفشده، مجددا جهش پیدا کند.
اگرچه OpenAI پیشتر شفافسازیهای مبهمی درباره دسترسی غیرمجاز ایجنتها به سرویسهای ارتباطی خارجی ارائه کرده بود، اما هرگز این رویداد بهخصوص را علنی نکرده و مشخص نساخته بود که چنین رخدادهایی با چه تواتری تکرار میشوند. با وجود اینکه به نظر نمیرسد در جریان این حادثه اقدام غیرقانونی آشکاری رخ داده باشد، اما این ماجرا تردیدهای بیشتری را در این خصوص برمیانگیزد که آیا OpenAI توان نظارت و مهار فناوری تحت توسعه خود را دارد یا خیر؛ آن هم در برههای که نظارت عمومی یا مداخله نهادهای ناظر در عملکرد آزمایشگاههای پیشرو هوش مصنوعی (Frontier AI labs) بسیار محدود است.
لوری تراهان (Lori Trahan)، نماینده دموکرات ایالت ماساچوست، در این رابطه اظهار داشت: «نبود هرگونه چارچوب حاکمیتی فدرال و واقعی بر حوزه هوش مصنوعی بدین معناست که شرکتهای پیشرو میتوانند به دلخواه خود تصمیم بگیرند که چه زمانی حوادثی از این دست را افشا کنند.» تراهان لایحهای دوحزبی موسوم به «قانون مرز» (Frontier Act) را ارائه کرده است که آزمایشگاهها را ملزم به افشای اینگونه رویدادها و پذیرش حسابرسان و ناظران مستقل میکند.
پژوهشگران ایمنی هوش مصنوعی ابراز نگرانی میکنند که نسل جدید مدلهای قدرتمند—که فرآیند استدلال آنها حتی برای سازندگانشان نیز بیش از پیش مبهم و غیرشفاف شده است—ممکن است دست به اقداماتی بزنند که به انسانها آسیب برساند. مدل Astra که روز گذشته توسط OpenAI عرضه شد، قدرتمندترین و توانمندترین مدل این شرکت تا به امروز به شمار میرود.
این شرکت مدعی است که Astra همچنین بیشترین تمایل را به پیروی از دستورالعملهای انسانی دارد؛ با این حال، پژوهشگران مستقلی که برای ارزیابی آن دعوت شده بودند، نگرانی خود را پیرامون همراستایی (Alignment) آن ابراز کردند. هر دو نهاد «مؤسسه ایمنی هوش مصنوعی بریتانیا» (U.K. AI Safety Institute) و اندیشکده «Apollo Research» گزارش دادند که این مدل ممکن است از قرار گرفتن تحت ارزیابی آگاه باشد و این پتانسیل را داشته باشد که رفتار واقعی خود را پنهان کند.
پژوهشگران در گزارش ارزیابی خود نوشتند: «آپولو معتقد است با توجه به سطوح بالاتر آگاهی از ارزیابی (Eval Awareness) و بازه زمانی محدود ارزیابی، پایین بودن موارد سوءرفتار در این آزمونها دلیل محکمی بر همراستا بودن یا نبودن این مدل ارائه نمیدهد.»