
۲۲۵۸۰: از GPT-2 تا Kimi3، گامبهگام
روایت فنی تبدیل معماری ۱۲۴ میلیونی GPT-2 به سامانه هیبریدی ۲.۸ تریلیونی Kimi K3.
ادامه مطلببررسی فنی اینکه چگونه توجه تنک، هسته پایدار CUDA، تقطیر چهارمرحلهای و NVFP4 یک خط لوله ۱۳۳ ثانیهای را به تولید ویدیوی نزدیک به بلادرنگ رساندند.

گزارش مهندسی عمومی Baseten مستند میکند که تیم این شرکت چگونه Wan2.2 را از یک اجرای پژوهشی کند به سامانه ویدیویی تعاملی نزدیک کرد. گزارش و دادههای معیار منتشرشده، پروفایل، توجه تنک آموزشپذیر، مهندسی هسته، پسآموزش و استنتاج کمدقت را به هم متصل میکنند.
این مرور فنی، همان کار را با ساختار سیستمی روشنتر بازسازی میکند. ادعای اصلی با پژوهشهای Wan و VSA، مقاله FlashAttention-4، مستند NVFP4 انویدیا و تنسورهای معیار منتشرشده با شکل واقعی تولید تطبیق داده شده است.
وضعیت شواهد: صفحه رسمی Baseten عدد ۲٫۷۵ ثانیه برای هر کلیپ ۴۸۰p و بهبود ۵۳٫۶ برابری را اعلام میکند. این اعداد اندازهگیریهای گزارششده توسط سازنده روی B200 هستند و هنوز یک معیار مستقل و بازتولیدشده صنعتی نیستند. سازوکارها مستندند، اما نقطه بررسی نهایی و کل زماناجرای اختصاصی با دستور بازتولید یکمرحلهای منتشر نشدهاند.
گزارش Baseten برای یک ویدیوی ۸۳۲ در ۴۸۰ با ۸۱ فریم از حدود ۱۳۳ ثانیه شروع میکند و روی یک NVIDIA B200 به ۲٫۷۵ ثانیه برای هر کلیپ میرسد. این عدد ۵۳٫۶ برابر سریعتر از مبنای گزارششده است. بهبود به سه گروه ضربشونده نسبت داده شده است:
| گروه بهینهسازی | سهم گزارششده Baseten | بدهبستان اصلی |
|---|---|---|
| تقطیر گام زمانی به چهار گام | حدود ۲۰ برابر | اتلافی، با ریسک بیشتر برای حرکت، فیزیک و پیوستگی |
| هستههای اختصاصی و همجوشی | حدود ۱٫۵ برابر | مهندسی ویژه شکل ورودی و وابستگی سختافزاری |
| لایههای خطی NVFP4 | حدود ۱٫۵ برابر | خطای کوانتیزه و وابستگی به Blackwell |
صفحه رسمی هزینه را از پنج سنت به کمتر از یکششم سنت برای هر ویدیو کاهشیافته میداند، نه اینکه یک قیمت عمومی برای هر ثانیه خروجی اعلام کند.
این تفاوت مهم است. مسیر گرم هسته، آمادهسازی نمونه، دریافت وزنها و بالا آمدن خدمت را شامل نمیشود. کاربر محصول علاوه بر اجرای مدل، انتظار صف، پالایش ورودی، رمزگذاری متن، رمزگشایی VAE، کنترل خروجی، ذخیرهسازی و تحویل شبکه را نیز تجربه میکند. راهنمای مهندسی تأخیر استنتاج توضیح میدهد چرا زمان هسته، زمان مدل گرم و تأخیر قابل مشاهده کاربر باید نامهای جدا داشته باشند.
Wan2.2 از خانواده ترنسفورمرهای انتشار است. مخزن رسمی Wan2.2 و مقاله فنی Wan خانوادهای را توصیف میکنند که نه پیکسلها، بلکه نهفتههای فشرده ویدیو را نویززدایی میکند. سامانه T2V-A14B از ساختار آمیختهای از متخصصان استفاده میکند تا متخصصهای مختلف در بخشهای متفاوت مسیر نویززدایی کار کنند.
در بار ۴۸۰p گزارش، نهفته فضایی به شبکهای با ۳۰ در ۵۲ توکن وصلهبندی میشود. ۸۱ فریم خروجی نیز در زمان فشرده به ۲۱ موقعیت تبدیل میشوند. بنابراین پیش از پدینگ، طول توالی خودتوجهی برابر است با:
30 x 52 x 21 = 32,760 tokens
خودتوجهی چگال هر توکن پرسش را با هر توکن کلید مقایسه میکند. فقط یک سر توجه باید از نظر مفهومی بیش از یک میلیارد امتیاز بسازد، زیرا مربع ۳۲٬۷۶۰ حدود ۱٫۰۷ میلیارد است. بار ثبتشده ۴۰ سر با بُعد ۱۲۸ دارد. FlashAttention لازم نیست کل ماتریس امتیاز را در حافظه مادی کند، اما همچنان باید همه ضربهای پرسش-کلید و احتمال-مقدار چگال را انجام دهد.
پروفایل گزارش، بیش از ۶۰ درصد زمان را در خودتوجهی نشان میداد. یک فراخوانی توجه چگال حدود ۱۷ میلیثانیه طول میکشید. با ۴۰ بلوک ترنسفورمر، تعداد زیاد گامهای نویززدایی و هدایت بدون دستهبند، همین زمان کوچک هزاران بار پرداخت میشود. هدف بهینهسازی «کل مدل» بهصورت مبهم نبود؛ یک مسیر داغ تکرارشونده و اندازهگیریشده بود.
الگوریتم مرکزی از پژوهش Video Sparse Attention و پیادهسازی FastVideo در آزمایشگاه Hao AI میآید. VSA از این مشاهده استفاده میکند که نگاشتهای توجه در انتشار ویدیو اغلب ساختاری و تنک هستند. یک توکن معمولاً به چند ناحیه مرتبط فضایی یا زمانی نیاز دارد، نه دسترسی برابر به کل کلیپ.
گزارش شبکه سهبعدی توکن را به مکعبهای ۴ در ۴ در ۴ تقسیم میکند که هرکدام ۶۴ توکن دارند. پدینگ، حجم مفهومی ۲۱ در ۳۰ در ۵۲ را به ۲۴ در ۳۲ در ۵۲ گسترش میدهد. به همین دلیل طول توالی QKV تولیدی ۳۹٬۹۳۶ است. تعداد مکعبها چنین محاسبه میشود:
ceil(21/4) x ceil(30/4) x ceil(52/4) = 6 x 8 x 13 = 624

VSA سه بخش متصل دارد:
در تنکی ۸۷٫۵ درصد، هسته هفتهشتم مکعبهای نامزد را رد میکند و فقط ۷۸ مورد از ۶۲۴ را برمیگزیند. تنکی در اینجا سهم بلوکهای ردشده است. به این معنا نیست که ۸۷٫۵ درصد خروجی صفر میشود یا هر بخش مدل دقیقاً به همین نسبت ارزانتر خواهد شد.
اندازه بلوک یک قرارداد همزمان کیفیت و کارایی است. بلوک بزرگتر جزئیات رتبهبندی را کم میکند. بلوک کوچکتر سربار انتخاب را بالا میبرد و مقدار کار ذخیرهشده با حذف هر بلوک را کاهش میدهد. گزارش، مکعب ۴ در ۴ در ۴ را نقطه عملیاتی آموزشدیده میداند و از افت کیفیت در گروهبندی درشتتر سخن میگوید.
این روش یک ماسک بدون آموزش نیست که پس از خروجی گرفتن به مدل وصل شود. شاخه درشت، دروازههایی میسازد که نقطه بررسی اصلی Wan2.2 آنها را نیاموخته است. گزارش از مقداردهی اولیه صفر برای دروازهها و آموزش دانشآموز تنک در برابر معلم چگال و ثابت سخن میگوید. زیان میانگین مربعات در فضای نهفته با زیان تعبیه CLIP پس از رمزگشایی VAE ترکیب میشود و سپس وزنهای توجه دانشآموز نیز از حالت ثابت خارج میشوند.
آزمایشگاه Hao AI این روش گستردهتر را تقطیر تنک مینامد. شرح FastWan توضیح میدهد چرا تنکی آموزشپذیر هنگام فشردن انتشار به چند گام محدود مهم است. ماسکهای ابتکاری اغلب به افزونگی میان گامهای متعدد نویززدایی تکیه میکنند. با یک تا چهار گام، بیشتر این افزونگی ناپدید میشود. دانشآموز تنک باید بیاموزد در مسیر تقطیرشده کدام بلوکها مهم میمانند.
پس نقطه بررسی بخشی از زماناجراست. نمیتوان فقط هسته CUDA را برداشت، آن را به هر مدل چگال Wan متصل کرد و انتظار همان کیفیت یا همان توزیع بلوکهای انتخابی را داشت.
گزارش پیش از بهینهسازی CUDA یک کران پایین تخمین میزند. هر مکعب پرسش ۷۸ مکعب کلید و مقدار را انتخاب میکند. جفتکردن دو مکعب ۶۴ توکنی به هسته اجازه میدهد بهجای شکل کمبازدهتر ۶۴ در ۶۴، دستور انباشت ضرب ماتریسی ۶۴ در ۱۲۸ در ۱۶ صادر کند. در ۶۲۴ مکعب پرسش و ۴۰ سر، یک اجرا ۲۴٬۹۶۰ کاشی خروجی دارد.
نیاز محاسباتی پس از کنارگذاشتن توکنهای پدشده حدود ۳٫۳۵ ترافلاپ برای هر اجرای توجه برآورد شده است. ترافیک جاری K و V نیز نزدیک ۶۴ گیگابایت است. با فرض توان تنسوری B200 و پهنای باند ۱۹ ترابایت بر ثانیه L2، محاسبه حدود ۲٫۸۶ میلیثانیه و تحویل داده حدود ۳٫۳۵ میلیثانیه زمان میخواهد. حتی همپوشانی کامل هم نمیتواند از کران کندتر عبور کند.
این برآورد با وجود سادهسازی ارزشمند است. نشان میدهد هسته Triton با زمان ۷٫۵ میلیثانیه هنوز جای بهبود دارد، اما هدف یک میلیثانیه با همان فرضهای بار و پهنای باند ناسازگار است. تحلیل سقف امکانپذیری را میسنجد، نه اینکه نتیجه را تضمین کند.
آموزندهترین بخش گزارش آن است که چند تغییر پیچیده پیش از شکلگیری خط لوله نهایی، اجرا را کندتر کردند.
| بازنگری | تغییر اصلی | تأخیر گزارششده |
|---|---|---|
| مرجع Triton | خط مبنای تنک بلوکی تولید | ۷٬۴۴۴ تا ۷٬۵۰۳ میکروثانیه |
| CUDA ۱ | انتقال مستقیم SM100 با MMA، TMA و حافظه تنسوری | ۹٬۱۶۹ میکروثانیه |
| CUDA ۲ | خط لوله تولیدکننده-مصرفکننده و آمادهسازی عمیقتر | ۱۱٬۵۵۳ میکروثانیه |
| CUDA ۳ | بیشینه مرجع ثابت برای حذف بازتنظیم تکراری | ۱۰٬۷۸۸ میکروثانیه |
| CUDA ۴ | گروه warp مستقل برای ضرب احتمال-مقدار | ۸٬۶۴۱ میکروثانیه |
| CUDA ۵ | گروههای کارگر بیشتر برای softmax | ۷٬۷۷۹ میکروثانیه |
| CUDA ۶ | تولید مستقل K و V | ۶٬۵۶۴ میکروثانیه |
| CUDA ۷ | انتقال فهرست top-K به حافظه مشترک | ۶٬۳۷۴ میکروثانیه |
| CUDA ۸ | ادغام مقیاس و جمع با FMA | ۵٬۸۴۱ میکروثانیه |
| CUDA ۹ | پیشواکشی اندیسهای حافظه مشترک | ۵٬۲۹۴ میکروثانیه |
| CUDA ۱۰ | CTA پایدار برای کاهش پر و خالیشدن خط لوله | ۴٬۷۱۹ میکروثانیه |
اولین انتقال CUDA کندتر بود، زیرا استفاده از دستورهای درست با مشغول نگهداشتن سختافزار یکسان نیست. الگوریتم نخست، واکشی کاشی، ضرب ماتریسی، softmax، بازتنظیم و انباشت خروجی را سری اجرا میکرد. بازنویسی تولیدکننده-مصرفکننده همزمانی ساخت، اما آنقدر از حافظه مشترک و تنسوری استفاده کرد که سکونت به یک CTA روی هر چندپردازنده جریانی افتاد. کاهش سکونت، حبابهایی را آشکار کرد که پیشتر دو CTA مقیم از دید پنهان میکردند.
مقاله FlashAttention-4 فشار معماری مشابهی را شرح میدهد. در Blackwell توان هسته تنسوری سریعتر از پهنای باند حافظه مشترک و توان تابع نمایی رشد کرده است. وقتی ضرب ماتریسی بسیار سریع میشود، softmax، جابهجایی حافظه، همگامسازی و زمانبندی خط لوله به گلوگاه درجه اول تبدیل میشوند.
هسته اختصاصی VSA گروههای warp جداگانه را به کارهای همپوشان میدهد: تولیدکنندههای TMA کاشیهای Q، K و V را در حافظه مشترک آماده میکنند؛ عملیات تنسوری ناهمگام، کاشی امتیاز را در حافظه تنسوری میسازد؛ کارگرهای softmax آن را مصرف میکنند؛ گروه دیگری ضرب احتمال-مقدار را صادر میکند. بافر سهگانه اجازه میدهد K و V بعدی در حالی برسند که کاشیهای قبلی تبدیل و انباشته میشوند.

جداکردن تولید K از V مهم بود، زیرا این دو در لحظههای متفاوت مصرف میشوند. مانع مشترک، فضای حافظه را پس از پایان K نگه میداشت، فقط چون V هنوز زنده بود. طول عمر مستقل باعث شد فضای آمادهسازی زودتر بازیافت شود.
softmax برخط معمولاً بیشینه در حال اجرای هر ردیف را نگه میدارد. اگر کاشی بعدی بیشینه بزرگتری داشته باشد، مخرج انباشته و خروجی باید دوباره مقیاس شوند. این روش از نظر ریاضی دقیق و از نظر عددی پایدار است، اما خواندن حافظه تنسوری، بازتنظیم و نوشتن دوباره هزینه دارد.
گزارش بهجای آن ثابت کاهشی را از نخستین کاشی انتخابی میگیرد. کمکردن یک ثابت مشترک از همه امتیازها احتمال softmax را تغییر نمیدهد، پس جبر دقیق میماند. خطر عددی است: اگر امتیاز بعدی بسیار بزرگتر باشد، تابع نمایی در دقت انتخابی سرریز میکند. نویسندگان میگویند بارهای انتشار آنها در بازه امن ماندند.
این فرض باید با تنسورهای واقعی و دشوار سنجیده شود، نه ورودی تصادفی دوستانه. Baseten بعداً مجموعه معیار VSA برای Wan2.2 را با تنسورهای واقعی ۸۳۲ در ۴۸۰ و ۸۱ فریم و یک نمونه سرریز منتشر کرد. کارت مجموعه گزارش میدهد softmax ساده تکگذر بدون کمکردن بیشینه ردیف، روی آن نمونه در یکی از ۴۰ سر، ۸۳۳٬۳۶۰ مقدار نامتناهی میسازد. این مشاهده لزوماً طرح گزارش را رد نمیکند، اما نشان میدهد پیادهسازی قابل استقرار به نمونههای عددی خصمانه، قرارداد تلورانس و مسیر امن جایگزین نیاز دارد.
اجرای اولیه برای هر کاشی پرسش یک CTA اختصاص میدهد. هر CTA حلقه آمادهسازی را پر میکند، به حالت پایدار میرسد، آن را خالی میکند و میمیرد. با ۲۴٬۹۶۰ کاشی روی B200، پردازنده موجهای زیادی از CTA را اجرا میکند. هر موج دوباره ابتدا و انتهای کماستفاده را میپردازد.
نسخه پایدار تقریباً به تعداد چندپردازندههای جریانی CTA راه میاندازد و هر CTA را در یک حلقه کار زنده نگه میدارد. با پایان یک کاشی، CTA کاشی بعدی را میگیرد و لازم نیست کل خط لوله را از نو بسازد. گزارش پیش از این تغییر حدود ۱۵ درصد اتلاف ترکیبی برای پر و خالیشدن تخمین میزند. بهرهبرداری هسته تنسوری از ۶۲ به ۷۱ درصد میرسد و تأخیر از ۵٫۲۹۴ به ۴٫۷۱۹ میلیثانیه کم میشود.
هسته پایدار رایگان نیست. زمانبندی، عدالت، لغو و همزیستی با بار دیگر GPU را پیچیده میکند. این روش وقتی قوی است که شکلها ثابت، کار فراوان و مالکیت دستگاه بهاندازه کافی طولانی باشد.
پس از سریعشدن توجه، عملیات کوچک در پروفایل دیده میشوند. PyTorch مشتاق ممکن است RMSNorm، مدولاسیون Adaptive LayerNorm و جمع باقیمانده دروازهای را به چند هسته تبدیل کند. هر میانی در حافظه پرپهنایباند نوشته و دوباره خوانده میشود و هر عملیات هزینه راهاندازی دارد.
زماناجرا این زنجیرهها را در هستههای Triton ادغام میکند تا هر تنسور یکبار خوانده، از چند مرحله عنصری یا کاهشی عبور داده و یکبار نوشته شود. گزارش از ۶۴۰ نمونه نرمالسازی Q/K در یک اجرای چهارگامی نام میبرد. بنابراین همجوشی هم ترافیک حافظه و هم صدها راهاندازی را حذف میکند.
این درس قانون آمدال در عمل است. وقتی توجه چگال غالب است، یک norm ادغامشده کوچک به نظر میرسد. با حذف گلوگاه توجه، همان norm پیشرفت سرتاسری را محدود میکند. پس از هر برد بزرگ باید دوباره کل trace را پروفایل کرد.
بهینهسازی هسته بهتنهایی بیش از دو دقیقه را به کمتر از سه ثانیه تبدیل نمیکند. بزرگترین برد از کاهش مسیر نویززدایی تقریباً ۴۰ تا ۸۰ گام به چهار گام میآید. Baseten گزارش میکند این تغییر پیش از بهینهسازیهای بعدی، زمان را از بیش از ۱۲۰ ثانیه به حدود شش ثانیه میرساند.
دستور آموزش از DMD2 استفاده میکند. این روش دانشآموز را برای تطبیق توزیع خروجی معلم آموزش میدهد و قرار نیست تکتک گذارهای نویززدایی را کپی کند. یک مدل امتیاز جعلی آموزشپذیر به برآورد توزیع جاری دانشآموز کمک میکند و تمایزگر خصمانه جزئیات محلی را تقویت میکند. برای توالی بلند ویدیو، پشته آموزش از موازیسازی توالی بهره میبرد تا حالت توجه میان دستگاهها توزیع شود.
این بهبود صریحاً اتلافی است. Baseten از ریسک بیشتر آرتیفکت، رفتار فیزیکی ضعیف و ناپیوستگی زمانی در صحنه فعال میگوید. این بیان از عبارت کوتاه «کیفیت بدون تغییر» در گزارش مهندسی دقیقتر است. ارزیابی جدی باید گروههای پرامپت، دسته حرکت، معیار زمانی، مقایسه انسانی جفتی و نرخ شکست را گزارش کند. کلیپهای زیبای انتخابشده معیار کیفیت نیستند.
برای پیامدهای سرعت تولید، منشأ محتوا، بازبینی و تحویل، راهنمای گردشکار تولید ویدیوی هوش مصنوعی را ببینید.
وقتی توجه تنک و نویززدایی چهارگامی شد، لایههای خطی سهم بیشتری از محاسبه باقیمانده DiT میگیرند. زماناجرا نگاشتهای توجه، نگاشتهای شبکه پیشخور و دروازه درشت VSA را به NVFP4 میبرد. خود ضربهای ماتریسی QK و احتمال-مقدار در BF16 باقی میمانند.
شرح فنی NVFP4 انویدیا یک مقدار ۴ بیتی E2M1، یک مقیاس FP8 از نوع E4M3 برای هر ریزبلوک ۱۶ مقداری و یک مقیاس سراسری FP32 برای کل تنسور تعریف میکند. مقیاسبندی دوسطحی نسبت به یک مقیاس واحد، دامنه محلی را بهتر سازگار و حافظه وزن را بهشدت کمتر میکند.
نکته مهم، دقت انتخابی است. سامانه همه عملیات را به چهار بیت تحمیل نمیکند. GEMMهای خطی بزرگ از توان FP4 بلکول و جابهجایی داده کمتر سود میبرند. کاهشهای حساس توجه در BF16 باقی میمانند. کیفیت همچنان باید روی نقطه بررسی ویدیو سنجیده شود، زیرا نتایج NVFP4 در مدل زبانی نمیتواند وفاداری ویدیو را اثبات کند.
زماناجرای نهایی یک پشته است، نه یک هسته رکوردشکن منفرد:
| لایه | تغییر | سود |
|---|---|---|
| مسیر مدل | ۴۰ تا ۸۰ گام نویززدایی به ۴ گام میرسد | کاهش اصلی در مرتبه بزرگی |
| الگوریتم توجه | توجه چگال به توجه تنک بلوکی آموختهشده تبدیل میشود | کار کمتر QK و احتمال-مقدار |
| هسته توجه | خط لوله ناهمگام ویژه Blackwell | همپوشانی و بهرهبرداری بهتر |
| ساختار اجرا | CTAهای پایدار | پر و خالیشدن تکراری کمتر |
| نمودار عنصری | همجوشی norm و باقیمانده | راهاندازی و رفتوبرگشت HBM کمتر |
| قالب عددی | لایههای خطی منتخب با NVFP4 | توان بیشتر GEMM و جابهجایی کمتر داده |
بردهای ضربشونده فقط وقتی ترکیب معتبر دارند که هر اندازهگیری بار و هدف کیفیت یکسان داشته باشد. اگر تقطیر توزیع توالی را عوض کند، شکل هسته یا تنکی هم تغییر میکند. اگر کوانتیزه انتخاب top-K را عوض کند، هسته تنک کار متفاوتی میبیند. معیار نهایی، آزمون سرتاسری است، نه ضرب چند ریزمعیار جدا.
تیمی که ادعای مشابه را میسنجد باید پیش از تنظیم، قرارداد زیر را ثابت کند:
بار کاری: نقطه بررسی دقیق، مجموعه پرامپت، وضوح، تعداد فریم، FPS، نمونهبردار، هدایت، تعداد گام نویززدایی، VAE، رمزگذار متن، تنکی، شکل بلوک، اندازه دسته و بذرهای تصادفی.
زماناجرا: مدل GPU، کلاک، سقف توان، درایور، CUDA، PyTorch، نسخه کامپایلر، تعداد گرمسازی، گرفتن گراف، نقاط همگامسازی و اینکه رمزگذاری متن و VAE در زمان هستند یا نه.
درستی هسته: خروجی و log-sum-exp با مرجع مورد اعتماد مقایسه شوند. بلوک لبه پدشده، اندیس تکراری top-K، بلوک کاملاً پر، مقدار حدی، نمونه سرریز و چند گام نویززدایی پوشش داده شوند.
کیفیت: پرامپتها بر اساس حرکت دوربین، حرکت شیء، فیزیک تماس، متن، چهره، برش صحنه و هویت بلندمدت دستهبندی شوند. پیوستگی زمانی و ترجیح انسانی با فاصله اطمینان و نرخ شکست شدید گزارش شود.
عملیات: p50 و p95 مسیر گرم، شروع سرد، انتظار صف، توان عملیاتی زیر بار ورودی، رفتار لغو، بهرهبرداری GPU، انرژی و هزینه هر کلیپ پذیرفتنی کامل گزارش شوند.
تنسورهای منتشرشده Baseten برای لایه هسته نقطه شروع خوبی هستند، زیرا نمیگذارند ورودی مصنوعی الگوی نامنظم top-K را پنهان کند. با این حال جایگزین ارزیابی نقطه بررسی و خود ویدیو نیستند.
نخست، پیش از انتخاب بهینهسازی پروفایل کنید. پروژه برنده از این واقعیت شروع شد که خودتوجهی بیشتر trace را مصرف میکرد، نه از علاقه قبلی به CUDA.
دوم، تعادل سختافزار مهمتر از بیشینه FLOPs است. در Blackwell سرعت بسیار زیاد هسته تنسوری، تابع نمایی، حافظه مشترک، همگامسازی و سکونت را آشکار میکند. هسته خوب در اصل زمانبندی هماهنگ همه این منابع است.
سوم، پسرفت شواهد میسازد. نسخههای کندتر تولیدکننده-مصرفکننده مشکل سکونت و طول عمر منابع را نشان دادند؛ چیزی که یک نمودار نهایی صیقلی پنهان میکند.
چهارم، الگوریتم، نقطه بررسی، هسته و قالب عددی یک سامانهاند. دروازههای تنک آموختهشده ورودی هسته را تعیین میکنند. تقطیر مسیر را عوض میکند. کوانتیزه مقدارها را تغییر میدهد. بهینهسازی یک لایه با فرض ثابتبودن بقیه میتواند خروجی سریع اما نامعتبر بسازد.
در نهایت، تولید نزدیک به بلادرنگ یک آستانه محصول است، نه صرفاً معیار. کلیپ ۲٫۷۵ ثانیهای حلقه انسانی پرامپت، مشاهده، اصلاح و تلاش دوباره را ممکن میکند. تولید همچنان به ظرفیت مقیاسپذیر، کنترل شروع سرد، پالایش، مشاهدهپذیری و منشأ محتوا نیاز دارد. استنتاج سریع فقط وقتی حلقه قابل استفاده میسازد که سامانه پیرامون نیز آن را پایدار نگه دارد.
این مقاله در ۹ مرداد ۱۴۰۵، برابر با ۳۱ ژوئیه ۲۰۲۶، بازبینی شد. منابع اولیه و دستاول:
دو تصویر فنی و جلد این صفحه برای ژرف ایآی بهعنوان تصویرسازی توضیحی ساخته شدهاند. این تصاویر مفهومیاند و نباید آنها را اسکرینشات پروفایلر یا نمودار دقیق تراشه دانست.

روایت فنی تبدیل معماری ۱۲۴ میلیونی GPT-2 به سامانه هیبریدی ۲.۸ تریلیونی Kimi K3.
ادامه مطلب
از تشخیص افسردگی از طریق لرزشهای ریز صدا تا ساخت سیستمهایی که واقعاً حالات عاطفی انسان را درک میکنند: چگونه محاسبات عاطفی به ماشینها هوش هیجانی میدهد.
ادامه مطلب
از ساخت تراشههایی که معماری عصبی مغز انسان را تقلید میکنند تا پردازندههایی که کسری از انرژی GPUها را مصرف میکنند: چگونه محاسبات نورومورفیک سختافزار هوش مصنوعی را بازتعریف میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.