امنیت، اخلاق و قوانین هوش مصنوعی

برتری خیره‌کننده تراشه جدید OpenAI بر سیستم‌های انویدیا

تراشه جدید OpenAI
💡نکته کلیدی و خلاصه این مقاله:

OpenAI با معرفی تراشه جدید OpenAI تحت عنوان Jalapeño، استانداردهای جدیدی در سرعت و کارایی مصرف انرژی برای اجرای مدل‌های هوش مصنوعی تعریف کرد که از سیستم‌های Blackwell انویدیا نیز فراتر رفته است. اولین آزمایش‌های...

OpenAI با معرفی تراشه جدید OpenAI تحت عنوان Jalapeño، استانداردهای جدیدی در سرعت و کارایی مصرف انرژی برای اجرای مدل‌های هوش مصنوعی تعریف کرد که از سیستم‌های Blackwell انویدیا نیز فراتر رفته است.

اولین آزمایش‌های منتشر شده توسط OpenAI نشان می‌دهد که این تراشه اختصاصی با نام Jalapeño، نخستین سخت‌افزار طراحی‌شده توسط این شرکت برای فرآیند استنتاج (Inference) است که در زمینه سرعت و کارایی مصرف توان از سیستم‌های Blackwell انویدیا عملکرد بهتری دارد. این دستاورد به OpenAI این امکان را می‌دهد که تعیین کند کدام بار کاری (Workload) باید بر روی تراشه‌های اختصاصی این شرکت اجرا شود.

OpenAI گزارش داده است که در مدل‌های GPT‑OSS 120B، DeepSeek R1 670B و Kimi K2.5 1T، این تراشه بین ۱.۵ تا ۱.۹ برابر کار بیشتری را به ازای هر وات در اوج توان عملیاتی (Peak Throughput) انجام می‌دهد و میزان تأخیر سرتاسری (End-to-end Latency) آن نیز ۱.۷ تا ۳.۶ برابر کمتر است. برای سخت‌افزاری از نسل اول که به جای «آموزش» مدل‌ها، برای «اجرای» مدل‌های بزرگ هوش مصنوعی ساخته شده است، این یک شروع خیره‌کننده محسوب می‌شود.

این فرآیند «استنتاج» (Inference) نامیده می‌شود؛ یعنی محاسباتی که هر بار یک مدل آموزش‌دیده، پاسخی تولید می‌کند. این مسئله برای «عامل‌های هوش مصنوعی» (AI Agents) بسیار حیاتی و چالش‌برانگیز است؛ چرا که این عامل‌ها ممکن است برای انجام یک وظیفه، چندین بار مدل را فراخوانی کنند و در چنین شرایطی، تأخیرهای کوچک یا هزینه‌های اضافی در طول مراحل مختلف، به شدت انباشته می‌شوند.

با افزایش میزان استفاده از هوش مصنوعی، صرفا خرید تراشه‌های بیشتر نمی‌تواند محدودیت‌های فیزیکی را برطرف کند. ظرفیت برق و زیرساخت‌های مراکز داده با سرعت تقاضای رو به رشد آن‌ها همگام نیست؛ بنابراین OpenAI نیاز دارد تا از هر وات انرژی موجود، بیشترین بهره را ببرد تا بدون طولانی شدن زمان انتظار کاربران، هوش مصنوعی کاربردی بیشتری ارائه دهد.

تراشه Jalapeño پاسخی برای رفع این شکاف است. این شرکت تراشه، حافظه، شبکه و نرم‌افزار سرویس‌دهی را بر اساس نحوه عملکرد واقعی مدل‌های بزرگ طراحی کرده و حتی از هوش مصنوعی خود برای کمک به طراحی و برنامه‌نویسی این سیستم استفاده کرده است.

اگر این عملکرد اولیه در مرحله تولید انبوه حفظ شود، کسب‌وکارها و توسعه‌دهندگانی که از محصولات و APIهای OpenAI استفاده می‌کنند، می‌توانند به عامل‌های سریع‌تر و ظرفیت قابل‌اعتمادتری دست یابند؛ در حالی که خود OpenAI کنترل بیشتری بر هزینه‌های سرویس‌دهی و نحوه توزیع بار کاری مناسب خواهد داشت. برای انویدیا و سایر تأمین‌کنندگان زیرساخت OpenAI، وجود Jalapeño لزوما به معنای جایگزینی سخت‌افزارهای آن‌ها نیست؛ بلکه وجود یک گزینه استنتاج اختصاصی و معتبر می‌تواند نحوه توزیع بار کاری توسط OpenAI را با افزایش تقاضا تغییر دهد. نتایج بنچمارک‌ها اولین شواهدی هستند که نشان می‌دهند این استراتژی ممکن است موفقیت‌آمیز باشد.

نکات کلیدی:

* تراشه Jalapeño شرکت OpenAI، یک تراشه اختصاصی برای «استنتاج» (Inference) است که برای اجرای کارآمد مدل‌های هوش مصنوعی آموزش‌دیده طراحی شده است، نه برای آموزش مدل‌های پیشرو (Frontier Models).

* در آزمایش‌های OpenAI، تراشه Jalapeño در سه خانواده از مدل‌های بزرگ، بین ۵۰ تا ۹۰ درصد کار بیشتری را به ازای هر کیلووات انجام داده و پاسخ‌ها را ۴۳ تا ۷۲ درصد سریع‌تر از سیستم‌های GB200 و GB300 انویدیا ارائه کرده است.

* Jalapeño با یکپارچه‌سازی تراشه، حافظه، شبکه و نرم‌افزار سرویس‌دهی، کارایی استنتاج را بهبود می‌بخشد تا جابجایی اطلاعات مدل و زمان انتظار سخت‌افزار برای داده‌ها به حداقل برسد.

* OpenAI از Codex به همراه GPT-Astra استفاده کرد تا سه مدل را که در برنامه تولید اولیه Jalapeño نبودند، ظرف مدت دو ماه به سطح عملکرد بالا برسانند.

* پیاده‌سازی‌های تولید شده توسط هوش مصنوعی در بخش‌های منتخب بلوک‌های attention و Mixture-of-Experts (MoE) در مدل GPT-OSS، بین ۱.۵ تا ۱.۸ برابر سریع‌تر از نسخه‌های نوشته شده توسط انسان بودند (البته این موضوع شامل کل مدل یا سیستم نرم‌افزاری Jalapeño نمی‌شود).

* مؤسسه SemiAnalysis آزمایش‌های منتخب Jalapeño را مشاهده کرده و در یک ارزیابی، کیفیت خروجی مشابه را تأیید کرد، اما بنچمارک کامل و مستقلی انجام نداده و نتایج تست طولانی‌تر AgentX خود را منتشر نکرده است.

* اگر عملکرد اولیه Jalapeño در مرحله تولید انباه حفظ شود، OpenAI می‌تواند تقاضای استنتاج بیشتری را به ازای هر وات پوشش دهد و بدون جایگزینی سیستم‌های انویدیا (که برای سایر وظایف آموزش و استنتاج استفاده می‌شوند)، بار کاری مناسب را به سخت‌افزار اختصاصی خود هدایت کند.

* OpenAI انتظار دارد استقرار Jalapeño در اواخر سال ۲۰۲۶ با حجم بسیار کم آغاز شود و استقرار گسترده‌تر آن برای سال ۲۰۲۷ پیش‌بینی شده است.

آزمایش‌های اولیه و مقایسه عملکرد تراشه جدید OpenAI با Blackwell انویدیا

OpenAI عملکرد Jalapeño را در برابر سیستم‌های مجهز به تراشه‌های GB200 و GB300 انویدیا از طریق دو پرسش عملیاتی سنجید: هر سیستم به ازای هر وات توان الکتریکی مصرفی، چقدر کار هوش مصنوعی می‌تواند انجام دهد؟ و هر درخواست از ابتدا تا انتها چقدر طول می‌کشد؟

معیار اول که «توان عملیاتی» (Throughput) نامیده می‌شود، نشان می‌دهد یک سیستم چه میزان تقاضا را می‌تواند مدیریت کند. معیار دوم یعنی «تأخیر» (Latency)، مدت زمانی را نشان می‌دهد که هر کاربر منتظر می‌ماند. معمولا این دو هدف با یکدیگر در تعارض هستند، زیرا پردازش درخواست‌های بیشتر می‌تواند سرعت پاسخ‌دهی به هر درخواست را کاهش دهد. اما نتیجه اولیه Jalapeño خیره‌کننده است: در آزمایش‌های OpenAI، این تراشه هم تقاضای بیشتری را به ازای هر وات مدیریت کرد و هم پاسخ‌ها را سریع‌تر ارائه داد.

OpenAI این آزمایش‌ها را با استفاده از InferenceX انجام داد؛ یک بنچمارک عمومی که توسط SemiAnalysis ساخته شده است. در طول تست‌ها، OpenAI درخواست‌هایی شامل تقریبا ۸۰۰۰ توکن ورودی (بخش‌های متنی ارسال شده به مدل) را به هر سیستم فرستاد و از هر مدل خواست که تقریبا ۱۰۰۰ توکن خروجی برای هر درخواست تولید کند.

خواندن ورودی‌ها به شدت به محاسبات وابسته است. همچنین، تولید پاسخ به‌صورت توکن‌به‌توکن مستلزم آن است که سخت‌افزار بارها اطلاعات مدل را از حافظه بازیابی کند. از آنجایی که این دو بخش از یک درخواست، فشار متفاوتی به سخت‌افزار وارد می‌کنند، InferenceX هر دو مورد را اندازه‌گیری می‌کند.

InferenceX کل چیدمان اطراف تراشه‌ها، از جمله حافظه، شبکه و نرم‌افزار سرویس‌دهی آن‌ها را نیز اندازه‌گیری کرد. نرم‌افزار تعیین می‌کند که مدل‌ها و درخواست‌های ورودی چگونه بین تراشه‌ها تقسیم شوند، در حالی که حافظه و شبکه، اطلاعات مورد نیاز برای انجام آن کار را منتقل می‌کنند. هرگونه تأخیر در این فرآیند می‌تواند باعث بیکار ماندن تراشه‌ها شود. بنابراین، نتایج نشان می‌دهند که چیدمان مبتنی بر Jalapeño شرکت OpenAI در مقابل سیستم‌های ساخته شده با تراشه‌های انویدیا چگونه عمل می‌کند.

توان مصرفی اعلام شده برای Jalapeño و سخت‌افزار انویدیا متفاوت است: ۷۰۰ وات برای Jalapeño، ۱۲۰۰ وات برای GB200 و ۱۴۰۰ وات برای GB300. OpenAI نرخ پردازش توکن هر سیستم را بر این اعداد تقسیم کرد تا میزان کار انجام شده به ازای هر کیلووات را گزارش کند. این روش باعث شد سیستمی که توان مصرفی بالاتری دارد، برای جلوگیری از سوگیری در نتایج، برتری کاذب نشان ندهد.

همیار وب

تیم تحریریه همیار وب

مرجع تخصصی ابزارها، قالب‌ها و آموزش‌های عملی توسعه کسب‌وکار آنلاین مبتنی بر هوش مصنوعی و اتوماسیون.