
رابط صوتی بهتر برای فارسی: زبان فقط رونویسی نیست
محصول صوتی فارسی باید گفتار رسمی و محاوره، لهجه، جابهجایی زبان، نام، عدد و اصلاح متناسب با فرهنگ را مدیریت کند.
ادامه مطلبتیم ژرف ایآی

محصول صرفاً چون مدلش فارسی پاسخ میدهد، فارسی نشده است. سامانه تولیدی باید شیوه واقعی تایپ را بشناسد، متن سند را دقیق حفظ کند، میان گونههای نوشتاری بازیابی کند، واژگان حوزه را بفهمد، محتوای آمیخته راستبهچپ و چپبهراست را امن نمایش دهد و بداند چه وقت روانی از شاهد جلو زده است.
فارسی نسخه کمکیفیت انگلیسی یا عربی نیست. ساختواژه، پیبست، اضافه، مصوت کوتاه نوشتهنشده، گونه نویسه، نیمفاصله، زبان محاوره، نام خاص، تقویم، رقم و چیدمان دوسویه همه بر دقت اثر دارند. فارسی رسمی ایران نیز با دری، تاجیکی، همه گویشها یا شیوه نوشتار مهاجران قابل جایگزینی نیست.
این راهنما پژوهش و استاندارد عمومی موجود تا ۳۰ ژوئیه ۲۰۲۶ را بازتاب میدهد. benchmark فقط مقایسه محدود در dataset و split خود میدهد؛ آمادگی محصول، حوزه، جمعیت یا تصمیم پراثر را ثابت نمیکند.
«پشتیبانی فارسی» الزام آزمونپذیر نیست. این موارد را صریح کنید:
دری و تاجیکی را تصمیم locale جدا ببینید. تاریخ مشترک زبانی، تفاوت خط، واژه، صرف، نهاد، تاریخ، ارز و انتظار کاربر را پاک نمیکند. هر گونه پشتیبانیشده را با گویشور همان زمینه ارزیابی کنید.
از یک نتیجه شروع کنید: «بند درست سیاست مرجوعی فارسی را پیدا و پاسخ مستند پیشنویس کن» سنجیدنی است؛ «copilot فارسی بساز» نیست. گردشکار را به مدیریت دانش و جستوجوی سازمانی وصل کنید و فقط لایه chat را ارزیابی نکنید.
بعضی نویسهها شبیهاند اما code point یکسان ندارند: ی فارسی ی با U+06CC در برابر ي عربی U+064A، ک فارسی ک با U+06A9 در برابر ك عربی U+0643، و نیمفاصله ZWNJ با U+200C. کاربر رقم فارسی، عربی و لاتین را مخلوط میکند و وند را چسبیده، جدا یا با نیمفاصله مینویسد.
راهحل، بازنویسی مخرب همه رشتهها نیست. چهار لایه نگه دارید:
نام حقوقی، مرجع حساب، نقل شاهد، hash، امضا، شناسه و سند منبع شاید حفظ دقیق بایت بخواهد. normalization باید retrieval را بهتر کند بدون تغییر خاموش شاهد نمایشدادهشده به بازبین.
normalizer را نسخهدار کنید. نویسههایی که باید متفاوت بمانند، emoji، combining mark، اعراب، نیمفاصله، nonbreaking space، URL، ایمیل، شناسه بانکی، تاریخ، عدد منفی و code را آزمون کنید. transformation سازنده match را نگه دارید تا اپراتور بداند چرا دو رکورد متصل شدهاند.
فارسی معنا را با پیشوند، پسوند، پیبست، ترکیب و فاصله حمل میکند. یک واژه شاید پیوسته، جدا یا با نیمفاصله نوشته شود. اضافه غالباً علامت ندارد و حذف مصوت کوتاه ابهام میسازد. محاوره ضمیر، فعل، مرز واژه و املا را عوض میکند؛ شبکه اجتماعی و پشتیبانی غلط تایپی، کشیدگی، emoji، فینگلیش و code-switching اضافه میکند.
خط لوله مقاوم این اجزا را ترکیب میکند:
فرض نکنید embedding همه مسئله املایی را جذب میکند. retrieval exact، lexical و semantic را جدا بسنجید. در فیلد حساس، شناسه محافظتشده دقیق باید از متن روایی شبیه مهمتر باشد.
پژوهش فارسی baselineهای مفید دارد:
این مجموعهها در task، دوره، genre، annotation، population و metric متفاوتاند. امتیاز یکی، استخراج مالی، چت محاوره، OCR، code-switching یا اقدام امن عامل را تضمین نمیکند. در مدل عمومی بزرگ، contamination مجموعه عمومی نیز نگرانی است.
نتیجه عمومی را برای انتخاب نامزد و شناخت failure mode استفاده کنید. ارزیابی محصول را از نمونه واقعی مجاز بسازید و در صورت امکان موارد پس از cutoff آموزش را اضافه کنید. مجموعه development و test قفلشده را جدا، با corpus بازیابی deduplicate، دستور annotator را مستند و بهجای امتیاز قطعی عدمقطعیت را گزارش کنید.
کیفیت فارسی اغلب پیش از generation در retrieval میشکند. متن منبع محافظتشده و فیلد normalizeشده را index کنید. هنگام query، اصل را نگه دارید، alias محدود بسازید، کانال exact و semantic را جستوجو، ranking کالیبره را ادغام و مجوز را پیش از retrieval اعمال کنید. span منبع را با نسخه و تاریخ برگردانید.
آزمون retrieval باید شامل این موارد باشد:
پاسخ باید passage منبع را cite و زبان منبع را از ترجمه مولد جدا کند. اگر سند معتبر انگلیسی است، متن فارسی را ترجمه علامت بزنید. اگر منابع متعارضاند یا ادعا را پشتیبانی نمیکنند، امتناع و تعارض را نشان دهید.
برای صدا همین انضباط لازم است. راهنمای فناوری گفتار فارسی توضیح میدهد چرا transcription باید بر اساس حوزه، گوینده، نویز، عدد و کار پاییندستی سنجیده شود، نه فقط میانگین word error rate.
چیدمان فارسی ویژگی کل سامانه است. الگوریتم دوسویه Unicode یا UAX #9 ترتیب متن آمیخته را تعریف میکند، اما layout، alignment، truncation یا interaction درست محصول را تعیین نمیکند.
در container مناسب dir="rtl" معنایی بگذارید و مقدار درجشده کاربر یا ماشین را با dir="auto" یا bidi isolation جدا کنید؛ رشته را دستی وارونه نکنید. CSS logical مثل margin-inline-start و padding-inline-end امنتر از دو نسخه left/right است. رقم، code، URL، ایمیل، path و شناسه را وارونه نکنید.
الزامات چیدمان عربی و فارسی W3C فهرست مفیدی از نیاز خط است، اما تا این تاریخ Working Group Draft Note و کار در جریان است، نه Recommendation تاییدشده W3C. آن را راهنمای مهندسی بدانید و رفتار را در browser، font، OS و فناوری کمکی پشتیبانیشده واقعاً آزمون کنید.
این موارد را بررسی کنید:
طبق سیاست امنیت، کنترل دوسویه غیرمنتظره را sanitize کنید اما شاهد مشروع منبع را در نمای محافظتشده نگه دارید. شناسه با ترتیب بصری غلط میتواند خطای مالی و امنیتی بسازد.
دستیاری را فرض کنید که درباره فاکتور به فارسی پاسخ میدهد، در حالی که سامانه حسابداری، نام محصول و بعضی قراردادها انگلیسیاند. کاربر مینویسد: «فاکتور ١٢۳۴ چرا دوباره محاسبه شده؟» و رقم عربی و فارسی را مخلوط میکند.
خط لوله پیام اصل را نگه میدارد، query نرمال میسازد، شناسه محافظتشده فاکتور را میشناسد و مشتری مجاز را پیش از بازیابی resolve میکند. رویداد مالی را با ID exact و سیاست را با alias فارسی و اصطلاح دوزبانه جستوجو میکند. اگر سیاست فارسی authoritative است همان را cite میکند؛ وگرنه ترجمه فارسی منبع انگلیسی را روشن علامت میزند.
رابط توضیح فارسی را RTL نشان میدهد و شماره فاکتور، ارز، SKU و URL را isolate میکند. code محصول را ترجمه یا ledger را خاموش تغییر نمیدهد. اگر محاسبه و سیاست تعارض دارند، بداهه نمیگوید؛ case با شاهد، مبلغ متاثر، locale، نسخه مدل و index و عبارت اصل کاربر میسازد.
بازبین شکل منبع و canonical، span بازیابی، ترجمه، اطمینان هر مرحله و اقدام پیشنهادی را میبیند. entity، term، citation یا resolution را جدا اصلاح میکند. این اصلاح reason-coded ارزیابی را بهتر میکند بدون اینکه هر ویرایش ground truth فرض شود.
یک امتیاز «کیفیت فارسی» علت شکست را پنهان میکند:
بر اساس رسمی/محاوره، منطقه یا گونه در دامنه، دستگاه، کانال، نوع سند، خط آمیخته، طول query، محتوای جدید/legacy و گروه حساس slice کنید. اندازه نمونه و confidence interval را گزارش کنید. محتوای حقوقی، مالی، بالینی، ایمنی و خدمت عمومی بازبینی متخصص میخواهد.
metric خودکار ترجمه برای مقایسه نسخه مفید است اما بهتنهایی gate نیست. جمله روانی که نفی، تاریخ، مبلغ، طرف یا تکلیف را عوض کند شکست است، هر قدر امتیاز aggregate بالا باشد.
سرویس اصطلاح نسخهدار بسازید: concept ID، شکل ترجیحی فارسی، معادل انگلیسی، گونه پذیرفته، ترجمه ممنوع، حوزه، مالک، منبع، تاریخ اثر و مثال. آن را در UI، search، generation، سند و کار انسان یکسان اعمال کنید.
برای خروجی پیامددار، نسخه مدل، prompt، normalizer، tokenizer، index، glossary، سند و UI را ثبت کنید. پس از تغییر مادی دوباره بسنجید. وقتی کمپین، مقرره، محصول یا خبر واژگان کاربر را تغییر میدهد drift را ببینید.
داده شخصی لاگ را کمینه کنید. متن فارسی شاید کد ملی، تلفن، مالی، سلامت یا زمینه خانوادگی داشته باشد. فیلد را در صورت مناسب redact یا tokenize، دسترسی بازبین را محدود و retention را تعریف کنید. نمونه ارزیابی باید مجاز و de-identified باشد. فقط چون سرویس خارجی فارسی میفهمد داده حساس را برایش نفرستید.
راه اصلاح field-level بدهید: شخص، مبلغ، تاریخ، اصطلاح، ترجمه، citation، جهت یا outcome غلط. thumbs-down کلی برای تشخیص سامانه کافی نیست.
عرضه را ببندید اگر شناسه محافظتشده در normalization یا translation تغییر میکند؛ منبع authoritative از متن مولد جدا نیست؛ access control پس از retrieval اعمال میشود؛ عدد، تاریخ، نام یا negation حساس از آستانه میگذرد؛ پاسخ بدون شاهد امتناع نمیشود؛ UI مقدار دوسویه را خراب میکند؛ گونه هدف ارزیابی ندارد؛ یا بازبین فارسی واجد صلاحیت مالک کار نیست.
وقتی citation support افت میکند، index تازه نیست، حوزه واژگان جدید میآید، خطای پراثر از آستانه میگذرد، مدل یا normalizer بدون ارزیابی عوض میشود یا نقص bidi/security شناسه را بد نمایش میدهد، سامانه را به نتیجه جستوجو، template یا انسان degrade کنید.
هر استثنا مالک، دامنه محدود، کنترل جبرانی، تاریخ بازبینی و شاهد میخواهد. «طبیعی به نظر میرسید» معیار پذیرش نیست.
میتواند جزء قوی باشد. کیفیت محصول هنوز به normalization، retrieval، واژگان، ارزیابی حوزه، مهندسی RTL، بازبینی انسان و fallback امن وابسته است.
بهصورت مخرب خیر. شکل canonical و search میتواند گونه منتخب را normalize کند، اما منبع، هویت، سند حقوقی، امضا و نمایش شاید حفظ دقیق بخواهد.
ابزار پژوهشی مفید و محدود است. task، sample، genre، تاریخ، annotation، bias و exposure احتمالی را مستند کنید و گردشکار واقعی را روی مجموعه محصول جدا بسنجید.
خیر. معماری اطلاعات، اصطلاح، تقویم و عدد، تعامل RTL، زمینه فرهنگی، عملیات پشتیبانی، رفتار search و سیاست محصول را هم شامل میشود.
retrieval محدود و مستند با شناسه محافظتشده، بازبین واجد صلاحیت، بازخورد field-level و fallback به سند منبع. پیش از ابزار و تصمیم پیامددار، retrieval شاهد و سلامت UI را ثابت کنید.
محصول فارسی قابل اعتماد فقط محلی به گوش نمیرسد؛ منبع را حفظ، شاهد درست را میان نوشتار واقعی بازیابی، پاسخ را امن نمایش، عدمقطعیت را آشکار و همان اختیار و جبران زبان نخست محصول را به کاربر فارسی میدهد.
منابع بررسیشده و جاری تا ۳۰ ژوئیه ۲۰۲۶:

محصول صوتی فارسی باید گفتار رسمی و محاوره، لهجه، جابهجایی زبان، نام، عدد و اصلاح متناسب با فرهنگ را مدیریت کند.
ادامه مطلب
نسل بعدی هوش مصنوعی سازمانی نباید فقط پاسخ بسازد؛ باید شواهد، عدم قطعیت، اختیار و مسیر اقدام پشت آن را نشان دهد.
ادامه مطلب
داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعیبودن به معنی ناشناس یا بیخطر بودن نیست.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.