
Gemma 4 12B؛ چندوجهی بومی در ۱۶ گیگابایت
چکپوینت ۱۳ خرداد گوگل، تصویر و صوت بدون رمزگذار، استدلال عاملی و پیشنویس چندتوکنی را به یک مدل باز مناسب لپتاپ میآورد.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

گوگل در ۱۰ ژوئن ۲۰۲۶، برابر با ۲۰ خرداد ۱۴۰۵ DiffusionGemma را با مجوز Apache 2.0 منتشر کرد. این مدل آزمایشی بهجای تعهد توکنبهتوکن، بلوک متن را موازی اصلاح میکند. اعلام رسمی تا چهار برابر سرعت، بیش از هزار توکن بر ثانیه روی یک H100 و بیش از ۷۰۰ توکن روی RTX 5090 را گزارش میکند.
مدل ۲۶ میلیارد پارامتر کل و ۳٫۸ میلیارد فعال دارد و نسخه کوانتیزه در حدود ۱۸GB VRAM جا میشود. گوگل صریح میگوید کیفیت کلی پایینتر از Gemma 4 خودبازگشتی است و برای بیشینه کیفیت همان مدل عادی را توصیه میکند. این هشدار DiffusionGemma را بستر تحقیق صادقانه میسازد، نه جایگزین پنهان.
مدل خودبازگشتی توکن نخست و سپس توکن بعدی را بر اساس قبلی میسازد. DiffusionGemma با بلوک نویزی یا mask شروع و چندین جایگاه را همزمان اصلاح میکند. انتشار از ۲۵۶ توکن موازی در هر forward pass و توجه دوسویه میان جایگاهها میگوید.
اصلاح موازی عملیات ماتریسی بزرگتر را جایگزین decode حافظهمحور میکند. مدل میتواند جایگاه قبلی را با دیدن ساختار بعدی تصحیح کند؛ برای infill، ویرایش، وصله کد، توالی زیستی و گراف مفید است.
مبادله، تعداد گام denoise است. گام کمتر سرعت را بالا و ممکن است انسجام را پایین آورد. آزمایشی بودن مدل همین مرز را نشان میدهد.

اعلام مقدارهای سیستم و مقایسه کیفیت را میدهد:
| سنجه | نتیجه | مرز |
|---|---|---|
| پارامتر کل / فعال | ۲۶B / ۳٫۸B | ظرفیت تنک، نه کل حافظه سروینگ |
| تولید H100 | بیش از ۱٬۰۰۰ توکن/ثانیه | تنظیم GPU اختصاصی بهینه |
| تولید RTX 5090 | بیش از ۷۰۰ توکن/ثانیه | وابسته به هسته و سختافزار |
| سرعت نسبی | تا ۴ برابر | مطالعه کیفیت-تأخیر گوگل |
| حافظه کوانتیزه | حدود ۱۸GB | زمینه و قالب دقت اوج را عوض میکنند |
| بلوک موازی | ۲۵۶ توکن | جایگاهها با هم اصلاح میشوند |
| کیفیت | پایینتر از Gemma 4 استاندارد | توصیه خودبازگشتی برای کیفیت بیشینه |
تعریف توکن بر ثانیه در diffusion حساس است، چون یک بلوک چند بار اصلاح میشود. خروجی پذیرفتهشده و زمان پاسخ کامل از شمار داخلی مهمتر است.
decode خودبازگشتی برای هر توکن وزن بزرگ را دوباره از حافظه میخواند. diffusion چند جایگاه را در یک pass و با ماتریس پرکار پردازش میکند. NVFP4 روی سختافزار پشتیبان توان را بیشتر میکند.
بیشترین سود روی GPU اختصاصی و هسته بهینه است. کارت دیگر یا runtime عمومی نسبت دیگری دارد. در خروجی کوتاه، پردازش prompt ممکن است غالب باشد. دسته و طول نیز اقتصاد را تغییر میدهند.
تأخیر انتهابهانتها را در کیفیت ثابت بسنجید: warm-up، encoding، گام اصلاح، اعتبارسنجی و fallback را بیاورید. راهنمای تأخیر استنتاج لایههای اندازهگیری را ارائه میکند.
چون هر جایگاه کل بلوک را میبیند، مدل میتواند میانه را بدون تولید دوباره ابتدا پر کند. گوگل ویرایش درجا، infill کد، توالی آمینواسید و ساختار ریاضی را مثال میزند.
هر وظیفه rubric خاص دارد. کد باید compile و test شود. ویرایش نباید متن دستنخورده را عوض کند. توالی زیستی نیازمند قید حوزه است و توصیه بالینی نیست. بلوک سریع ولی ساختارشکن مفید نیست.
fine-tune سودوکو تناسب معماری را نشان میدهد، نه برتری عمومی استدلال. diffusion ممکن است در سازگاری سراسری عالی و در روایت آزاد بلند ضعیف باشد.
گام بیشتر کیفیت احتمالی و تأخیر را بالا میبرد. گزارش منصفانه باید کیفیت را در چند بودجه گام رسم کند، نه بیشینه سرعت و بیشینه کیفیت دو تنظیم را کنار هم بگذارد.
برای وظیفه هدف، چند step را با Gemma 4 12B یا 26B روی زمان و سختافزار یکسان مقایسه کنید. صحت، ترجیح انسان، تکرار، بریدگی و حفظ ویرایش را بسنجید. واریانس stochastic را ثبت کنید.
راهنمای ارزیابی مدل مرزی حتی برای معماری آزمایشی لازم است: پیکربندی، سختافزار، دقت، داده و پذیرش باید نسخهدار باشند.
Apache 2.0 امکان بررسی، fine-tune، کوانتیزه و استقرار را میدهد. مدل پایه مشترکی برای scheduler، تقطیر گام، hybrid و رابط غیرخودبازگشتی است.
پشتیبانی موتور از Transformer عادی جوانتر است. repository، custom code، kernel و مجوز را بررسی و کارت و runtime را ثابت کنید. فایل ۱۸GB نزدیک است، ولی محصول به پایش و fallback نیاز دارد.
کارت رسمی DiffusionGemma بخشی از مشخصات اجرایی است. وزن تنها کافی نیست؛ scheduler، تعداد گام و قالب ورودی رفتار را عوض میکنند. هش فایل، revision و تنظیم denoise باید کنار نتیجه سرعت ثبت شوند تا اجرای بعدی قابل تکرار باشد.
راهنمای عملیات مدل باز سلامت artifact و دروازه انتشار را پوشش میدهد. مدل آزمایشی باید shadow test سختتری داشته باشد چون رابط بالادست سریع تغییر میکند.
DiffusionGemma برای تکمیل درجا، ویرایش تعاملی، infill محدود، تکرار محلی سریع و پژوهش تولید جایگزین مناسب است. میتواند draft سریع باشد که سیستم دیگر تأیید کند. برای گفتوگوی عمومی یا متن بلند بیشینه کیفیت، خود گوگل Gemma 4 استاندارد را توصیه میکند.
مسیریابی ترکیبی جذاب است: diffusion برای کار محدود حساس به تأخیر و escalation برای مورد نامطمئن. router باید نوع کار یا validator قطعی داشته باشد.
انتشار مهم است چون فرض توکن بعدی را با عدد عملی GPU مصرفی به چالش میکشد. ادعای معتبر آن سیستم است؛ کیفیت caveat همارزش دارد. تیم باید منحنی کیفیت-تأخیر را بازتولید و کار را با تأیید عینی محدود کند.
در پذیرش، ورودی خراب، متن بلند، کد، چندزبان و قالب دقیق را اضافه کنید. تکرار عبارت، حذف span، تغییر بیرون ناحیه و پایان ناتمام را جدا بشمارید. میانگین ترجیح انسان علت شکست را نمیگوید، ولی این طبقهها بودجه گام امن را روشن میکنند.
امنیت نیز باید در هر بودجه گام ثابت بماند. مدلی که با گام کمتر guardrail یا قید قالب را فراموش میکند، صرفاً سریعتر نیست؛ سامانه متفاوت و پرخطرتر است. fallback باید خروجی نیمهساخته را دور بیندازد یا صریح علامتگذاری کند، نه اینکه دو پاسخ ناسازگار را بیصدا به هم بچسباند.
برای تجربه تعاملی، زمان تا نخستین پیشنمایش و زمان تا نسخه نهایی را جدا بسنجید. diffusion میتواند پیشنمایش سریع بدهد، اما کاربر باید بداند خروجی هنوز در حال اصلاح است و نباید آن را پیش از پایان به عمل حساس متصل کند.

چکپوینت ۱۳ خرداد گوگل، تصویر و صوت بدون رمزگذار، استدلال عاملی و پیشنویس چندتوکنی را به یک مدل باز مناسب لپتاپ میآورد.
ادامه مطلب
بررسی فنی اینکه چگونه توجه تنک، هسته پایدار CUDA، تقطیر چهارمرحلهای و NVFP4 یک خط لوله ۱۳۳ ثانیهای را به تولید ویدیوی نزدیک به بلادرنگ رساندند.
ادامه مطلب
مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.