صدای محلی: هوش مصنوعی در پردازش زبان فارسی و بومی‌سازی

ت

تیم ژرف ای‌آی

۲۴ خرداد ۱۴۰۵به‌روزرسانی ۸ مرداد ۱۴۰۵۱۲ دقیقه مطالعه
صدای محلی: هوش مصنوعی در پردازش زبان فارسی و بومی‌سازی

محصول صرفاً چون مدلش فارسی پاسخ می‌دهد، فارسی نشده است. سامانه تولیدی باید شیوه واقعی تایپ را بشناسد، متن سند را دقیق حفظ کند، میان گونه‌های نوشتاری بازیابی کند، واژگان حوزه را بفهمد، محتوای آمیخته راست‌به‌چپ و چپ‌به‌راست را امن نمایش دهد و بداند چه وقت روانی از شاهد جلو زده است.

فارسی نسخه کم‌کیفیت انگلیسی یا عربی نیست. ساخت‌واژه، پی‌بست، اضافه، مصوت کوتاه نوشته‌نشده، گونه نویسه، نیم‌فاصله، زبان محاوره، نام خاص، تقویم، رقم و چیدمان دوسویه همه بر دقت اثر دارند. فارسی رسمی ایران نیز با دری، تاجیکی، همه گویش‌ها یا شیوه نوشتار مهاجران قابل جایگزینی نیست.

این راهنما پژوهش و استاندارد عمومی موجود تا ۳۰ ژوئیه ۲۰۲۶ را بازتاب می‌دهد. benchmark فقط مقایسه محدود در dataset و split خود می‌دهد؛ آمادگی محصول، حوزه، جمعیت یا تصمیم پراثر را ثابت نمی‌کند.

پیش از مدل، locale و گردش‌کار را تعریف کنید

«پشتیبانی فارسی» الزام آزمون‌پذیر نیست. این موارد را صریح کنید:

  • locale و گونه هدف؛ مثلاً فارسی رسمی ایران همراه مجموعه تعریف‌شده ورودی محاوره؛
  • خط و کانال ورودی؛ صفحه‌کلید فارسی یا عربی، فینگلیش، صدا، OCR یا متن آمیخته؛
  • حوزه و پیامد؛ جست‌وجوی فروشگاه، پشتیبانی، استخراج حقوقی، تطبیق مالی، سلامت یا اطلاع‌رسانی عمومی؛
  • کار؛ normalization، classification، retrieval، extraction، summarization، translation، generation، speech یا اقدام عامل؛
  • گروه کاربر، نیاز دسترس‌پذیری، سطح سواد و محدودیت دستگاه؛
  • زبان منبع معتبر و اینکه ترجمه اطلاع‌رسان است یا از نظر حقوقی حاکم؛
  • حد قابل قبول امتناع، اصلاح، ارجاع و زمان پاسخ.

دری و تاجیکی را تصمیم locale جدا ببینید. تاریخ مشترک زبانی، تفاوت خط، واژه، صرف، نهاد، تاریخ، ارز و انتظار کاربر را پاک نمی‌کند. هر گونه پشتیبانی‌شده را با گویشور همان زمینه ارزیابی کنید.

از یک نتیجه شروع کنید: «بند درست سیاست مرجوعی فارسی را پیدا و پاسخ مستند پیش‌نویس کن» سنجیدنی است؛ «copilot فارسی بساز» نیست. گردش‌کار را به مدیریت دانش و جست‌وجوی سازمانی وصل کنید و فقط لایه chat را ارزیابی نکنید.

شکل منبع، canonical، جست‌وجو و نمایش را جدا حفظ کنید

بعضی نویسه‌ها شبیه‌اند اما code point یکسان ندارند: ی فارسی ی با U+06CC در برابر ي عربی U+064A، ک فارسی ک با U+06A9 در برابر ك عربی U+0643، و نیم‌فاصله ZWNJ با U+200C. کاربر رقم فارسی، عربی و لاتین را مخلوط می‌کند و وند را چسبیده، جدا یا با نیم‌فاصله می‌نویسد.

راه‌حل، بازنویسی مخرب همه رشته‌ها نیست. چهار لایه نگه دارید:

  1. شکل منبع: متن دقیق دریافتی، با provenance و checksum در صورت نیاز.
  2. شکل canonical: normalization مستند Unicode و برنامه برای مقایسه deterministic.
  3. alias جست‌وجو: گونه بازگشت‌پذیر نویسه، فاصله، رقم، فینگلیش و محاوره.
  4. شکل نمایش: مقدار روبه‌کاربر با قالب مناسب locale و زمینه.

نام حقوقی، مرجع حساب، نقل شاهد، hash، امضا، شناسه و سند منبع شاید حفظ دقیق بایت بخواهد. normalization باید retrieval را بهتر کند بدون تغییر خاموش شاهد نمایش‌داده‌شده به بازبین.

normalizer را نسخه‌دار کنید. نویسه‌هایی که باید متفاوت بمانند، emoji، combining mark، اعراب، نیم‌فاصله، nonbreaking space، URL، ایمیل، شناسه بانکی، تاریخ، عدد منفی و code را آزمون کنید. transformation سازنده match را نگه دارید تا اپراتور بداند چرا دو رکورد متصل شده‌اند.

ساخت‌واژه، segmentation و زبان واقعی کاربر را پوشش دهید

فارسی معنا را با پیشوند، پسوند، پی‌بست، ترکیب و فاصله حمل می‌کند. یک واژه شاید پیوسته، جدا یا با نیم‌فاصله نوشته شود. اضافه غالباً علامت ندارد و حذف مصوت کوتاه ابهام می‌سازد. محاوره ضمیر، فعل، مرز واژه و املا را عوض می‌کند؛ شبکه اجتماعی و پشتیبانی غلط تایپی، کشیدگی، emoji، فینگلیش و code-switching اضافه می‌کند.

خط لوله مقاوم این اجزا را ترکیب می‌کند:

  • normalization نویسه‌محور با فیلد محافظت‌شده؛
  • آزمون tokenizer روی وند، پی‌بست، عدد، مخفف و خط آمیخته؛
  • سیگنال واژگانی یا صرفی در کاری که سود می‌برد؛
  • فرهنگ حوزه با اصطلاح ترجیحی، گونه مجاز، ترجمه ممنوع و تاریخ اثر؛
  • alias و fuzzy retrieval کالیبره‌شده روی query واقعی؛
  • فهرست entity ساخته‌شده از منبع مجاز، نه لیست جهانی؛
  • بازنویسی query که اصل را حفظ و تغییر را آشکار کند؛
  • اصلاح انسان با فیلد و نوع خطا.

فرض نکنید embedding همه مسئله املایی را جذب می‌کند. retrieval exact، lexical و semantic را جدا بسنجید. در فیلد حساس، شناسه محافظت‌شده دقیق باید از متن روایی شبیه مهم‌تر باشد.

benchmark عمومی را ابزار ببینید، نه گواه عرضه

پژوهش فارسی baselineهای مفید دارد:

  • ParsiNLU بیش از ۱۴۵۰۰ نمونه فارسی در شش کار درک زبان معرفی و مدل چندزبانه و تک‌زبانه را مقایسه کرد.
  • ParsBERT مدل ازپیش‌آموزش‌دیده ویژه فارسی را در کارهای پایین‌دستی سنجید.
  • FarsTail شامل ۱۰۳۶۷ نمونه استنتاج زبان طبیعی است و subset آسان و دشوار و سوگیری داده را شرح می‌دهد.
  • PersoNER corpus دستی entity نام‌دار فارسی فراهم کرد.
  • FarSense ارزیابی توان واژگانی-معنایی فارسی را گسترش داد.

این مجموعه‌ها در task، دوره، genre، annotation، population و metric متفاوت‌اند. امتیاز یکی، استخراج مالی، چت محاوره، OCR، code-switching یا اقدام امن عامل را تضمین نمی‌کند. در مدل عمومی بزرگ، contamination مجموعه عمومی نیز نگرانی است.

نتیجه عمومی را برای انتخاب نامزد و شناخت failure mode استفاده کنید. ارزیابی محصول را از نمونه واقعی مجاز بسازید و در صورت امکان موارد پس از cutoff آموزش را اضافه کنید. مجموعه development و test قفل‌شده را جدا، با corpus بازیابی deduplicate، دستور annotator را مستند و به‌جای امتیاز قطعی عدم‌قطعیت را گزارش کنید.

بازیابی را بر اساس شاهد فارسی بسازید

کیفیت فارسی اغلب پیش از generation در retrieval می‌شکند. متن منبع محافظت‌شده و فیلد normalizeشده را index کنید. هنگام query، اصل را نگه دارید، alias محدود بسازید، کانال exact و semantic را جست‌وجو، ranking کالیبره را ادغام و مجوز را پیش از retrieval اعمال کنید. span منبع را با نسخه و تاریخ برگردانید.

آزمون retrieval باید شامل این موارد باشد:

  • گونه صفحه‌کلید فارسی و عربی ی و ک؛
  • شکل نیم‌فاصله، چسبیده و جدا در ترکیب و وند؛
  • رقم فارسی، عربی و لاتین در فیلد مجاز؛
  • عبارت رسمی و محاوره رایج؛
  • نام برند و محصول به فارسی و فینگلیش؛
  • اصطلاح فنی آمیخته فارسی-انگلیسی؛
  • تاریخ هجری شمسی و میلادی؛
  • غلط تایپی، نویز OCR و query کوتاه مبهم؛
  • سیاست superseded و سند متعارض؛
  • فیلد exact مثل شماره فاکتور یا حساب.

پاسخ باید passage منبع را cite و زبان منبع را از ترجمه مولد جدا کند. اگر سند معتبر انگلیسی است، متن فارسی را ترجمه علامت بزنید. اگر منابع متعارض‌اند یا ادعا را پشتیبانی نمی‌کنند، امتناع و تعارض را نشان دهید.

برای صدا همین انضباط لازم است. راهنمای فناوری گفتار فارسی توضیح می‌دهد چرا transcription باید بر اساس حوزه، گوینده، نویز، عدد و کار پایین‌دستی سنجیده شود، نه فقط میانگین word error rate.

رابط RTL و دوسویه را مهندسی کنید

چیدمان فارسی ویژگی کل سامانه است. الگوریتم دوسویه Unicode یا UAX #9 ترتیب متن آمیخته را تعریف می‌کند، اما layout، alignment، truncation یا interaction درست محصول را تعیین نمی‌کند.

در container مناسب dir="rtl" معنایی بگذارید و مقدار درج‌شده کاربر یا ماشین را با dir="auto" یا bidi isolation جدا کنید؛ رشته را دستی وارونه نکنید. CSS logical مثل margin-inline-start و padding-inline-end امن‌تر از دو نسخه left/right است. رقم، code، URL، ایمیل، path و شناسه را وارونه نکنید.

الزامات چیدمان عربی و فارسی W3C فهرست مفیدی از نیاز خط است، اما تا این تاریخ Working Group Draft Note و کار در جریان است، نه Recommendation تاییدشده W3C. آن را راهنمای مهندسی بدانید و رفتار را در browser، font، OS و فناوری کمکی پشتیبانی‌شده واقعاً آزمون کنید.

این موارد را بررسی کنید:

  • نشانه‌گذاری پیرامون فارسی و انگلیسی آمیخته؛
  • لینک inline، badge، icon، ورودی، table، chart و breadcrumb؛
  • تلفن، ارز، درصد، تاریخ، نسخه و عدد منفی؛
  • selection، copy/paste، حرکت caret، highlight جست‌وجو، ellipsis و wrapping؛
  • ترتیب screen reader، خطای فرم، focus و keyboard navigation؛
  • card responsive با طول واقعی عنوان فارسی؛
  • محتوای مولد دارای bidi control نامطمئن.

طبق سیاست امنیت، کنترل دوسویه غیرمنتظره را sanitize کنید اما شاهد مشروع منبع را در نمای محافظت‌شده نگه دارید. شناسه با ترتیب بصری غلط می‌تواند خطای مالی و امنیتی بسازد.

مثال: دستیار پشتیبانی مالی دوزبانه

دستیاری را فرض کنید که درباره فاکتور به فارسی پاسخ می‌دهد، در حالی که سامانه حسابداری، نام محصول و بعضی قراردادها انگلیسی‌اند. کاربر می‌نویسد: «فاکتور ١٢۳۴ چرا دوباره محاسبه شده؟» و رقم عربی و فارسی را مخلوط می‌کند.

خط لوله پیام اصل را نگه می‌دارد، query نرمال می‌سازد، شناسه محافظت‌شده فاکتور را می‌شناسد و مشتری مجاز را پیش از بازیابی resolve می‌کند. رویداد مالی را با ID exact و سیاست را با alias فارسی و اصطلاح دوزبانه جست‌وجو می‌کند. اگر سیاست فارسی authoritative است همان را cite می‌کند؛ وگرنه ترجمه فارسی منبع انگلیسی را روشن علامت می‌زند.

رابط توضیح فارسی را RTL نشان می‌دهد و شماره فاکتور، ارز، SKU و URL را isolate می‌کند. code محصول را ترجمه یا ledger را خاموش تغییر نمی‌دهد. اگر محاسبه و سیاست تعارض دارند، بداهه نمی‌گوید؛ case با شاهد، مبلغ متاثر، locale، نسخه مدل و index و عبارت اصل کاربر می‌سازد.

بازبین شکل منبع و canonical، span بازیابی، ترجمه، اطمینان هر مرحله و اقدام پیشنهادی را می‌بیند. entity، term، citation یا resolution را جدا اصلاح می‌کند. این اصلاح reason-coded ارزیابی را بهتر می‌کند بدون اینکه هر ویرایش ground truth فرض شود.

به تفکیک مرحله، slice و پیامد ارزیابی کنید

یک امتیاز «کیفیت فارسی» علت شکست را پنهان می‌کند:

  • ورودی: تشخیص خط و locale، حفظ فیلد، خطای OCR یا speech، precision و recall normalization.
  • بازیابی: recall@k، mean reciprocal rank، پشتیبانی citation، تازگی، شکست مجوز و موفقیت ID exact.
  • درک: intent، entity، relation، inference، تاریخ و عدد به تفکیک حوزه.
  • تولید: groundedness، نرخ ادعای بدون شاهد، رعایت terminology، instruction و کیفیت abstention.
  • ترجمه: adequacy، حفظ معنا، entity و عدد، terminology، register و omission.
  • رابط: نقص bidi، clipping، ترتیب بصری، موفقیت کار با keyboard و assistive technology.
  • نتیجه: حل در تماس اول، اصلاح، escalation، شکایت، اقدام آسیب‌زا و درک کاربر.

بر اساس رسمی/محاوره، منطقه یا گونه در دامنه، دستگاه، کانال، نوع سند، خط آمیخته، طول query، محتوای جدید/legacy و گروه حساس slice کنید. اندازه نمونه و confidence interval را گزارش کنید. محتوای حقوقی، مالی، بالینی، ایمنی و خدمت عمومی بازبینی متخصص می‌خواهد.

metric خودکار ترجمه برای مقایسه نسخه مفید است اما به‌تنهایی gate نیست. جمله روانی که نفی، تاریخ، مبلغ، طرف یا تکلیف را عوض کند شکست است، هر قدر امتیاز aggregate بالا باشد.

واژگان، تغییر، حریم خصوصی و بازخورد را اداره کنید

سرویس اصطلاح نسخه‌دار بسازید: concept ID، شکل ترجیحی فارسی، معادل انگلیسی، گونه پذیرفته، ترجمه ممنوع، حوزه، مالک، منبع، تاریخ اثر و مثال. آن را در UI، search، generation، سند و کار انسان یکسان اعمال کنید.

برای خروجی پیامددار، نسخه مدل، prompt، normalizer، tokenizer، index، glossary، سند و UI را ثبت کنید. پس از تغییر مادی دوباره بسنجید. وقتی کمپین، مقرره، محصول یا خبر واژگان کاربر را تغییر می‌دهد drift را ببینید.

داده شخصی لاگ را کمینه کنید. متن فارسی شاید کد ملی، تلفن، مالی، سلامت یا زمینه خانوادگی داشته باشد. فیلد را در صورت مناسب redact یا tokenize، دسترسی بازبین را محدود و retention را تعریف کنید. نمونه ارزیابی باید مجاز و de-identified باشد. فقط چون سرویس خارجی فارسی می‌فهمد داده حساس را برایش نفرستید.

راه اصلاح field-level بدهید: شخص، مبلغ، تاریخ، اصطلاح، ترجمه، citation، جهت یا outcome غلط. thumbs-down کلی برای تشخیص سامانه کافی نیست.

دروازه عرضه و rollback صریح بگذارید

عرضه را ببندید اگر شناسه محافظت‌شده در normalization یا translation تغییر می‌کند؛ منبع authoritative از متن مولد جدا نیست؛ access control پس از retrieval اعمال می‌شود؛ عدد، تاریخ، نام یا negation حساس از آستانه می‌گذرد؛ پاسخ بدون شاهد امتناع نمی‌شود؛ UI مقدار دوسویه را خراب می‌کند؛ گونه هدف ارزیابی ندارد؛ یا بازبین فارسی واجد صلاحیت مالک کار نیست.

وقتی citation support افت می‌کند، index تازه نیست، حوزه واژگان جدید می‌آید، خطای پراثر از آستانه می‌گذرد، مدل یا normalizer بدون ارزیابی عوض می‌شود یا نقص bidi/security شناسه را بد نمایش می‌دهد، سامانه را به نتیجه جست‌وجو، template یا انسان degrade کنید.

هر استثنا مالک، دامنه محدود، کنترل جبرانی، تاریخ بازبینی و شاهد می‌خواهد. «طبیعی به نظر می‌رسید» معیار پذیرش نیست.

پرسش‌های رایج

آیا مدل پایه چندزبانه برای فارسی کافی است؟

می‌تواند جزء قوی باشد. کیفیت محصول هنوز به normalization، retrieval، واژگان، ارزیابی حوزه، مهندسی RTL، بازبینی انسان و fallback امن وابسته است.

آیا همه نویسه‌های عربی را به فارسی تبدیل کنیم؟

به‌صورت مخرب خیر. شکل canonical و search می‌تواند گونه منتخب را normalize کند، اما منبع، هویت، سند حقوقی، امضا و نمایش شاید حفظ دقیق بخواهد.

آیا benchmark عمومی فارسی قابل اتکاست؟

ابزار پژوهشی مفید و محدود است. task، sample، genre، تاریخ، annotation، bias و exposure احتمالی را مستند کنید و گردش‌کار واقعی را روی مجموعه محصول جدا بسنجید.

آیا بومی‌سازی فارسی همان ترجمه متن انگلیسی است؟

خیر. معماری اطلاعات، اصطلاح، تقویم و عدد، تعامل RTL، زمینه فرهنگی، عملیات پشتیبانی، رفتار search و سیاست محصول را هم شامل می‌شود.

امن‌ترین مورد نخست AI فارسی چیست؟

retrieval محدود و مستند با شناسه محافظت‌شده، بازبین واجد صلاحیت، بازخورد field-level و fallback به سند منبع. پیش از ابزار و تصمیم پیامددار، retrieval شاهد و سلامت UI را ثابت کنید.

محصول فارسی قابل اعتماد فقط محلی به گوش نمی‌رسد؛ منبع را حفظ، شاهد درست را میان نوشتار واقعی بازیابی، پاسخ را امن نمایش، عدم‌قطعیت را آشکار و همان اختیار و جبران زبان نخست محصول را به کاربر فارسی می‌دهد.

یادداشت منابع

منابع بررسی‌شده و جاری تا ۳۰ ژوئیه ۲۰۲۶:

#پردازش زبان فارسی#بومی‌سازی#هوش مصنوعی چندزبانه#فناوری زبان

مطالب مرتبط

داده مصنوعی با شناسنامه
بینش‌های صنعت

داده مصنوعی با شناسنامه

داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعی‌بودن به معنی ناشناس یا بی‌خطر بودن نیست.

ادامه مطلب

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.