DiffusionGemma؛ تولید متن باز فراتر از توکن بعدی

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۲۰ خرداد ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
DiffusionGemma؛ تولید متن باز فراتر از توکن بعدی

گوگل در ۱۰ ژوئن ۲۰۲۶، برابر با ۲۰ خرداد ۱۴۰۵ DiffusionGemma را با مجوز Apache 2.0 منتشر کرد. این مدل آزمایشی به‌جای تعهد توکن‌به‌توکن، بلوک متن را موازی اصلاح می‌کند. اعلام رسمی تا چهار برابر سرعت، بیش از هزار توکن بر ثانیه روی یک H100 و بیش از ۷۰۰ توکن روی RTX 5090 را گزارش می‌کند.

مدل ۲۶ میلیارد پارامتر کل و ۳٫۸ میلیارد فعال دارد و نسخه کوانتیزه در حدود ۱۸GB VRAM جا می‌شود. گوگل صریح می‌گوید کیفیت کلی پایین‌تر از Gemma 4 خودبازگشتی است و برای بیشینه کیفیت همان مدل عادی را توصیه می‌کند. این هشدار DiffusionGemma را بستر تحقیق صادقانه می‌سازد، نه جایگزین پنهان.

تفاوت diffusion متن

مدل خودبازگشتی توکن نخست و سپس توکن بعدی را بر اساس قبلی می‌سازد. DiffusionGemma با بلوک نویزی یا mask شروع و چندین جایگاه را هم‌زمان اصلاح می‌کند. انتشار از ۲۵۶ توکن موازی در هر forward pass و توجه دوسویه میان جایگاه‌ها می‌گوید.

اصلاح موازی عملیات ماتریسی بزرگ‌تر را جایگزین decode حافظه‌محور می‌کند. مدل می‌تواند جایگاه قبلی را با دیدن ساختار بعدی تصحیح کند؛ برای infill، ویرایش، وصله کد، توالی زیستی و گراف مفید است.

مبادله، تعداد گام denoise است. گام کمتر سرعت را بالا و ممکن است انسجام را پایین آورد. آزمایشی بودن مدل همین مرز را نشان می‌دهد.

کاشی‌های پراکنده موازی به یک بلوک ساخت‌یافته و منسجم تبدیل می‌شوند.
کاشی‌های پراکنده موازی به یک بلوک ساخت‌یافته و منسجم تبدیل می‌شوند.

تصویر عملکرد و سخت‌افزار

اعلام مقدارهای سیستم و مقایسه کیفیت را می‌دهد:

سنجهنتیجهمرز
پارامتر کل / فعال۲۶B / ۳٫۸Bظرفیت تنک، نه کل حافظه سروینگ
تولید H100بیش از ۱٬۰۰۰ توکن/ثانیهتنظیم GPU اختصاصی بهینه
تولید RTX 5090بیش از ۷۰۰ توکن/ثانیهوابسته به هسته و سخت‌افزار
سرعت نسبیتا ۴ برابرمطالعه کیفیت-تأخیر گوگل
حافظه کوانتیزهحدود ۱۸GBزمینه و قالب دقت اوج را عوض می‌کنند
بلوک موازی۲۵۶ توکنجایگاه‌ها با هم اصلاح می‌شوند
کیفیتپایین‌تر از Gemma 4 استانداردتوصیه خودبازگشتی برای کیفیت بیشینه

تعریف توکن بر ثانیه در diffusion حساس است، چون یک بلوک چند بار اصلاح می‌شود. خروجی پذیرفته‌شده و زمان پاسخ کامل از شمار داخلی مهم‌تر است.

تغییر گلوگاه سرعت

decode خودبازگشتی برای هر توکن وزن بزرگ را دوباره از حافظه می‌خواند. diffusion چند جایگاه را در یک pass و با ماتریس پرکار پردازش می‌کند. NVFP4 روی سخت‌افزار پشتیبان توان را بیشتر می‌کند.

بیشترین سود روی GPU اختصاصی و هسته بهینه است. کارت دیگر یا runtime عمومی نسبت دیگری دارد. در خروجی کوتاه، پردازش prompt ممکن است غالب باشد. دسته و طول نیز اقتصاد را تغییر می‌دهند.

تأخیر انتهابه‌انتها را در کیفیت ثابت بسنجید: warm-up، encoding، گام اصلاح، اعتبارسنجی و fallback را بیاورید. راهنمای تأخیر استنتاج لایه‌های اندازه‌گیری را ارائه می‌کند.

اصلاح دوسویه و وظیفه تازه

چون هر جایگاه کل بلوک را می‌بیند، مدل می‌تواند میانه را بدون تولید دوباره ابتدا پر کند. گوگل ویرایش درجا، infill کد، توالی آمینواسید و ساختار ریاضی را مثال می‌زند.

هر وظیفه rubric خاص دارد. کد باید compile و test شود. ویرایش نباید متن دست‌نخورده را عوض کند. توالی زیستی نیازمند قید حوزه است و توصیه بالینی نیست. بلوک سریع ولی ساختارشکن مفید نیست.

fine-tune سودوکو تناسب معماری را نشان می‌دهد، نه برتری عمومی استدلال. diffusion ممکن است در سازگاری سراسری عالی و در روایت آزاد بلند ضعیف باشد.

منحنی کیفیت-سرعت

گام بیشتر کیفیت احتمالی و تأخیر را بالا می‌برد. گزارش منصفانه باید کیفیت را در چند بودجه گام رسم کند، نه بیشینه سرعت و بیشینه کیفیت دو تنظیم را کنار هم بگذارد.

برای وظیفه هدف، چند step را با Gemma 4 12B یا 26B روی زمان و سخت‌افزار یکسان مقایسه کنید. صحت، ترجیح انسان، تکرار، بریدگی و حفظ ویرایش را بسنجید. واریانس stochastic را ثبت کنید.

راهنمای ارزیابی مدل مرزی حتی برای معماری آزمایشی لازم است: پیکربندی، سخت‌افزار، دقت، داده و پذیرش باید نسخه‌دار باشند.

وزن باز و پژوهش سیستم

Apache 2.0 امکان بررسی، fine-tune، کوانتیزه و استقرار را می‌دهد. مدل پایه مشترکی برای scheduler، تقطیر گام، hybrid و رابط غیرخودبازگشتی است.

پشتیبانی موتور از Transformer عادی جوان‌تر است. repository، custom code، kernel و مجوز را بررسی و کارت و runtime را ثابت کنید. فایل ۱۸GB نزدیک است، ولی محصول به پایش و fallback نیاز دارد.

کارت رسمی DiffusionGemma بخشی از مشخصات اجرایی است. وزن تنها کافی نیست؛ scheduler، تعداد گام و قالب ورودی رفتار را عوض می‌کنند. هش فایل، revision و تنظیم denoise باید کنار نتیجه سرعت ثبت شوند تا اجرای بعدی قابل تکرار باشد.

راهنمای عملیات مدل باز سلامت artifact و دروازه انتشار را پوشش می‌دهد. مدل آزمایشی باید shadow test سخت‌تری داشته باشد چون رابط بالا‌دست سریع تغییر می‌کند.

جایگاه و حکم

DiffusionGemma برای تکمیل درجا، ویرایش تعاملی، infill محدود، تکرار محلی سریع و پژوهش تولید جایگزین مناسب است. می‌تواند draft سریع باشد که سیستم دیگر تأیید کند. برای گفت‌وگوی عمومی یا متن بلند بیشینه کیفیت، خود گوگل Gemma 4 استاندارد را توصیه می‌کند.

مسیریابی ترکیبی جذاب است: diffusion برای کار محدود حساس به تأخیر و escalation برای مورد نامطمئن. router باید نوع کار یا validator قطعی داشته باشد.

انتشار مهم است چون فرض توکن بعدی را با عدد عملی GPU مصرفی به چالش می‌کشد. ادعای معتبر آن سیستم است؛ کیفیت caveat هم‌ارزش دارد. تیم باید منحنی کیفیت-تأخیر را بازتولید و کار را با تأیید عینی محدود کند.

در پذیرش، ورودی خراب، متن بلند، کد، چندزبان و قالب دقیق را اضافه کنید. تکرار عبارت، حذف span، تغییر بیرون ناحیه و پایان ناتمام را جدا بشمارید. میانگین ترجیح انسان علت شکست را نمی‌گوید، ولی این طبقه‌ها بودجه گام امن را روشن می‌کنند.

امنیت نیز باید در هر بودجه گام ثابت بماند. مدلی که با گام کمتر guardrail یا قید قالب را فراموش می‌کند، صرفاً سریع‌تر نیست؛ سامانه متفاوت و پرخطرتر است. fallback باید خروجی نیمه‌ساخته را دور بیندازد یا صریح علامت‌گذاری کند، نه اینکه دو پاسخ ناسازگار را بی‌صدا به هم بچسباند.

برای تجربه تعاملی، زمان تا نخستین پیش‌نمایش و زمان تا نسخه نهایی را جدا بسنجید. diffusion می‌تواند پیش‌نمایش سریع بدهد، اما کاربر باید بداند خروجی هنوز در حال اصلاح است و نباید آن را پیش از پایان به عمل حساس متصل کند.

یادداشت منابع — بازبینی ۲۰۲۶

#DiffusionGemma#گوگل دیپ‌مایند#مدل diffusion#وزن باز#استنتاج

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.