برتری خیرهکننده تراشه جدید OpenAI بر سیستمهای انویدیا
OpenAI با معرفی تراشه جدید OpenAI تحت عنوان Jalapeño، استانداردهای جدیدی در سرعت و کارایی مصرف انرژی برای اجرای مدلهای هوش مصنوعی تعریف کرد که از سیستمهای Blackwell انویدیا نیز فراتر رفته است. اولین آزمایشهای...
OpenAI با معرفی تراشه جدید OpenAI تحت عنوان Jalapeño، استانداردهای جدیدی در سرعت و کارایی مصرف انرژی برای اجرای مدلهای هوش مصنوعی تعریف کرد که از سیستمهای Blackwell انویدیا نیز فراتر رفته است.
اولین آزمایشهای منتشر شده توسط OpenAI نشان میدهد که این تراشه اختصاصی با نام Jalapeño، نخستین سختافزار طراحیشده توسط این شرکت برای فرآیند استنتاج (Inference) است که در زمینه سرعت و کارایی مصرف توان از سیستمهای Blackwell انویدیا عملکرد بهتری دارد. این دستاورد به OpenAI این امکان را میدهد که تعیین کند کدام بار کاری (Workload) باید بر روی تراشههای اختصاصی این شرکت اجرا شود.
OpenAI گزارش داده است که در مدلهای GPT‑OSS 120B، DeepSeek R1 670B و Kimi K2.5 1T، این تراشه بین ۱.۵ تا ۱.۹ برابر کار بیشتری را به ازای هر وات در اوج توان عملیاتی (Peak Throughput) انجام میدهد و میزان تأخیر سرتاسری (End-to-end Latency) آن نیز ۱.۷ تا ۳.۶ برابر کمتر است. برای سختافزاری از نسل اول که به جای «آموزش» مدلها، برای «اجرای» مدلهای بزرگ هوش مصنوعی ساخته شده است، این یک شروع خیرهکننده محسوب میشود.
این فرآیند «استنتاج» (Inference) نامیده میشود؛ یعنی محاسباتی که هر بار یک مدل آموزشدیده، پاسخی تولید میکند. این مسئله برای «عاملهای هوش مصنوعی» (AI Agents) بسیار حیاتی و چالشبرانگیز است؛ چرا که این عاملها ممکن است برای انجام یک وظیفه، چندین بار مدل را فراخوانی کنند و در چنین شرایطی، تأخیرهای کوچک یا هزینههای اضافی در طول مراحل مختلف، به شدت انباشته میشوند.
با افزایش میزان استفاده از هوش مصنوعی، صرفا خرید تراشههای بیشتر نمیتواند محدودیتهای فیزیکی را برطرف کند. ظرفیت برق و زیرساختهای مراکز داده با سرعت تقاضای رو به رشد آنها همگام نیست؛ بنابراین OpenAI نیاز دارد تا از هر وات انرژی موجود، بیشترین بهره را ببرد تا بدون طولانی شدن زمان انتظار کاربران، هوش مصنوعی کاربردی بیشتری ارائه دهد.
تراشه Jalapeño پاسخی برای رفع این شکاف است. این شرکت تراشه، حافظه، شبکه و نرمافزار سرویسدهی را بر اساس نحوه عملکرد واقعی مدلهای بزرگ طراحی کرده و حتی از هوش مصنوعی خود برای کمک به طراحی و برنامهنویسی این سیستم استفاده کرده است.
اگر این عملکرد اولیه در مرحله تولید انبوه حفظ شود، کسبوکارها و توسعهدهندگانی که از محصولات و APIهای OpenAI استفاده میکنند، میتوانند به عاملهای سریعتر و ظرفیت قابلاعتمادتری دست یابند؛ در حالی که خود OpenAI کنترل بیشتری بر هزینههای سرویسدهی و نحوه توزیع بار کاری مناسب خواهد داشت. برای انویدیا و سایر تأمینکنندگان زیرساخت OpenAI، وجود Jalapeño لزوما به معنای جایگزینی سختافزارهای آنها نیست؛ بلکه وجود یک گزینه استنتاج اختصاصی و معتبر میتواند نحوه توزیع بار کاری توسط OpenAI را با افزایش تقاضا تغییر دهد. نتایج بنچمارکها اولین شواهدی هستند که نشان میدهند این استراتژی ممکن است موفقیتآمیز باشد.
نکات کلیدی:
* تراشه Jalapeño شرکت OpenAI، یک تراشه اختصاصی برای «استنتاج» (Inference) است که برای اجرای کارآمد مدلهای هوش مصنوعی آموزشدیده طراحی شده است، نه برای آموزش مدلهای پیشرو (Frontier Models).
* در آزمایشهای OpenAI، تراشه Jalapeño در سه خانواده از مدلهای بزرگ، بین ۵۰ تا ۹۰ درصد کار بیشتری را به ازای هر کیلووات انجام داده و پاسخها را ۴۳ تا ۷۲ درصد سریعتر از سیستمهای GB200 و GB300 انویدیا ارائه کرده است.
* Jalapeño با یکپارچهسازی تراشه، حافظه، شبکه و نرمافزار سرویسدهی، کارایی استنتاج را بهبود میبخشد تا جابجایی اطلاعات مدل و زمان انتظار سختافزار برای دادهها به حداقل برسد.
* OpenAI از Codex به همراه GPT-Astra استفاده کرد تا سه مدل را که در برنامه تولید اولیه Jalapeño نبودند، ظرف مدت دو ماه به سطح عملکرد بالا برسانند.
* پیادهسازیهای تولید شده توسط هوش مصنوعی در بخشهای منتخب بلوکهای attention و Mixture-of-Experts (MoE) در مدل GPT-OSS، بین ۱.۵ تا ۱.۸ برابر سریعتر از نسخههای نوشته شده توسط انسان بودند (البته این موضوع شامل کل مدل یا سیستم نرمافزاری Jalapeño نمیشود).
* مؤسسه SemiAnalysis آزمایشهای منتخب Jalapeño را مشاهده کرده و در یک ارزیابی، کیفیت خروجی مشابه را تأیید کرد، اما بنچمارک کامل و مستقلی انجام نداده و نتایج تست طولانیتر AgentX خود را منتشر نکرده است.
* اگر عملکرد اولیه Jalapeño در مرحله تولید انباه حفظ شود، OpenAI میتواند تقاضای استنتاج بیشتری را به ازای هر وات پوشش دهد و بدون جایگزینی سیستمهای انویدیا (که برای سایر وظایف آموزش و استنتاج استفاده میشوند)، بار کاری مناسب را به سختافزار اختصاصی خود هدایت کند.
* OpenAI انتظار دارد استقرار Jalapeño در اواخر سال ۲۰۲۶ با حجم بسیار کم آغاز شود و استقرار گستردهتر آن برای سال ۲۰۲۷ پیشبینی شده است.
آزمایشهای اولیه و مقایسه عملکرد تراشه جدید OpenAI با Blackwell انویدیا
OpenAI عملکرد Jalapeño را در برابر سیستمهای مجهز به تراشههای GB200 و GB300 انویدیا از طریق دو پرسش عملیاتی سنجید: هر سیستم به ازای هر وات توان الکتریکی مصرفی، چقدر کار هوش مصنوعی میتواند انجام دهد؟ و هر درخواست از ابتدا تا انتها چقدر طول میکشد؟
معیار اول که «توان عملیاتی» (Throughput) نامیده میشود، نشان میدهد یک سیستم چه میزان تقاضا را میتواند مدیریت کند. معیار دوم یعنی «تأخیر» (Latency)، مدت زمانی را نشان میدهد که هر کاربر منتظر میماند. معمولا این دو هدف با یکدیگر در تعارض هستند، زیرا پردازش درخواستهای بیشتر میتواند سرعت پاسخدهی به هر درخواست را کاهش دهد. اما نتیجه اولیه Jalapeño خیرهکننده است: در آزمایشهای OpenAI، این تراشه هم تقاضای بیشتری را به ازای هر وات مدیریت کرد و هم پاسخها را سریعتر ارائه داد.
OpenAI این آزمایشها را با استفاده از InferenceX انجام داد؛ یک بنچمارک عمومی که توسط SemiAnalysis ساخته شده است. در طول تستها، OpenAI درخواستهایی شامل تقریبا ۸۰۰۰ توکن ورودی (بخشهای متنی ارسال شده به مدل) را به هر سیستم فرستاد و از هر مدل خواست که تقریبا ۱۰۰۰ توکن خروجی برای هر درخواست تولید کند.
خواندن ورودیها به شدت به محاسبات وابسته است. همچنین، تولید پاسخ بهصورت توکنبهتوکن مستلزم آن است که سختافزار بارها اطلاعات مدل را از حافظه بازیابی کند. از آنجایی که این دو بخش از یک درخواست، فشار متفاوتی به سختافزار وارد میکنند، InferenceX هر دو مورد را اندازهگیری میکند.
InferenceX کل چیدمان اطراف تراشهها، از جمله حافظه، شبکه و نرمافزار سرویسدهی آنها را نیز اندازهگیری کرد. نرمافزار تعیین میکند که مدلها و درخواستهای ورودی چگونه بین تراشهها تقسیم شوند، در حالی که حافظه و شبکه، اطلاعات مورد نیاز برای انجام آن کار را منتقل میکنند. هرگونه تأخیر در این فرآیند میتواند باعث بیکار ماندن تراشهها شود. بنابراین، نتایج نشان میدهند که چیدمان مبتنی بر Jalapeño شرکت OpenAI در مقابل سیستمهای ساخته شده با تراشههای انویدیا چگونه عمل میکند.
توان مصرفی اعلام شده برای Jalapeño و سختافزار انویدیا متفاوت است: ۷۰۰ وات برای Jalapeño، ۱۲۰۰ وات برای GB200 و ۱۴۰۰ وات برای GB300. OpenAI نرخ پردازش توکن هر سیستم را بر این اعداد تقسیم کرد تا میزان کار انجام شده به ازای هر کیلووات را گزارش کند. این روش باعث شد سیستمی که توان مصرفی بالاتری دارد، برای جلوگیری از سوگیری در نتایج، برتری کاذب نشان ندهد.