انضباط بازیابی: جستجوی هوش مصنوعی با دانش قابل اعتماد

ت

تیم ژرف ای‌آی

۳۰ اردیبهشت ۱۴۰۵به‌روزرسانی ۸ مرداد ۱۴۰۵۱۲ دقیقه مطالعه
انضباط بازیابی: جستجوی هوش مصنوعی با دانش قابل اعتماد

تولید تقویت‌شده با بازیابی یا RAG می‌تواند پاسخ را مستند جلوه دهد و سه خرابی متفاوت را پنهان کند. جست‌وجو شاید سند تعیین‌کننده را نیافته باشد. شاید سند داخل پرامپت بوده اما مدل آن را نادیده گرفته یا با آن تناقض داشته است. یا شاید پاسخ، منبعی قدیمی، غیرمجاز یا نادرست را وفادارانه تکرار کرده باشد. نامیدن هر سه به‌عنوان «کیفیت RAG» تشخیص را تقریباً ناممکن می‌کند.

سامانه تولیدی به زنجیره شواهد از مالکیت دانش تا بازیابی، ساخت زمینه، تولید، ارجاع و نتیجه کاربر نیاز دارد. هر حلقه معیار و مالک متفاوت دارد. مدل زبانی مهم است، اما کاتالوگ بی‌تاریخ اعتبار، فیلتر دسترسی پس از بازیابی یا مجموعه ارزیابی بی‌سؤال واقعی را اصلاح نمی‌کند.

قرارداد دانش را تعریف کنید

از تصمیم یا کاری آغاز کنید که سامانه پشتیبانی می‌کند. نوع منبع معتبر، مالک، مخاطب، دوره به‌روزرسانی، حوزه قضایی و شرط امتناع را فهرست کنید. تصمیم بگیرید پیش‌نویس، ایمیل، تیکت، نظر، سیاست آرشیوی و یادداشت کاربر مدرک است یا فقط سرنخ کشف.

برای تعارض سلسله‌مراتب منبع بسازید. سیاست جاری امضاشده می‌تواند از گفت‌وگوی تازه معتبرتر باشد؛ روش منطقه‌ای شاید پیش‌فرض جهانی را در همان منطقه کنار بزند؛ راهنمای محصول ممکن است استثنای مالی را مجاز نکند. این قواعد را در فراداده و انتخاب زمینه پیاده کنید و انتظار نداشته باشید مدل از نثر، اقتدار سازمانی را حدس بزند.

هر مورد نمایه‌شده باید شناسه پایدار، نسخه، مالک، تاریخ آغاز و پایان اعتبار در جای لازم، دامنه دسترسی، سامانه منبع، زبان و زمان ورود داشته باشد. کیفیت دانش عملیات محصول است، نه پروژه یک‌باره تعبیه. راهنمای مدیریت دانش و جست‌وجوی سازمانی لایه سازمانی را بیشتر بررسی می‌کند.

امنیت را پیش از بازیابی اعمال کنید

هویت، مستأجر، نقش، جغرافیا، پرونده و مجوز سطح سند را پیش از ورود نامزد به بازیاب اعمال کنید. فیلتر پاسخ تولیدشده دیر است؛ متن محدود شاید از قبل در زمینه، لاگ، کش یا خروجی مدل باشد. کنترل منبع را هنگام ورود حفظ و با تغییر مجوز نمایه را باطل کنید.

اگر مرز اعتماد می‌طلبد، نمایه جدا یا اجرای سخت فیلتر به کار ببرید. سند قناری بسازید که برای یک نقش دیده و برای نقش دیگر ممنوع است. جست‌وجوی برداری، کلیدواژه، رتبه‌بندی دوباره، کش، حافظه گفتگو و پیش‌نمایش ارجاع را آزمایش کنید. پاسخ نهایی درست، بازیابی غیرمجاز را توجیه نمی‌کند.

شناسه و تصمیم سیاستی لازم برای ممیزی را بدون کپی بند محرمانه در تله‌متری عمومی ثبت کنید. رد بازیابی حساس است؛ فهرست عنوان سند و عبارت جست‌وجو شاید به‌اندازه خلاصه اطلاعات بدهد.

ورود داده را قابل مشاهده و بازگشت کنید

هر قالب را با ساختار آن تجزیه کنید: عنوان، جدول، پانویس، فهرست، شماره صفحه و رابطه روش با استثنا. کیفیت OCR، رمزگذاری، سربرگ تکراری، ترتیب خواندن خراب و پیوست گم‌شده می‌تواند نمایه را بی‌صدا معیوب کند. موفقیت استخراج را بر اساس نوع منبع و زبان بسنجید.

نسخه تکراری را یکپارچه و سند جایگزین‌شده را پیوند دهید. نگذارید پنج کپی سیاست قدیمی با یک سیاست جاری رقابت کند. با چک‌سام و شناسه منبع، ورود را idempotent کنید. هنگام حذف یا لغو دسترسی، پاک‌سازی را به قطعه، بردار، کش و خلاصه مشتق‌شده گسترش دهید.

تأخیر خط لوله، سند شکست‌خورده، قطعه بی‌والد، استخراج خالی، کامل‌بودن فراداده، نسخه نمایه و زمان حذف را پایش کنید. این کنترل با مشاهده‌پذیری کیفیت داده هم‌راستاست. سبز بودن API یعنی خدمت در دسترس است، نه اینکه دانش تازه است.

قطعه‌بندی را با معنا و ارجاع هماهنگ کنید

پنجره ثابت توکن خط مبناست، نه طراحی جهانی. قطعه مفید واحد لازم برای پاسخ و ارجاع را نگه می‌دارد: بند سیاست با استثنا، ردیف جدول با سربرگ، گام عیب‌یابی با پیش‌نیاز یا بخش قرارداد با تعریف مرتبط. هم‌پوشانی زیاد تکرار می‌سازد و قطعه بی‌عنوان اقتدار و معنا را از دست می‌دهد.

بازیابی والد-فرزند را در نظر بگیرید: بخش کوچک برای recall جست‌وجو می‌شود و قسمت والد منسجم‌تر به مولد می‌رسد. شناسه سند، بخش، صفحه و جابه‌جایی نویسه را حفظ کنید تا ارجاع دقیق باز شود. برای جدول، نمایش مناسب جست‌وجو بسازید اما اصل را برای راستی‌آزمایی نگه دارید.

قطعه‌بندی را روی سؤال بسنجید، نه زیبایی. ببینید مدرک مرتبط در نتیجه بالا هست، نسخه متعارض قابل تشخیص است و زمینه بدون بریدن متن تعیین‌کننده در بودجه مدل جا می‌گیرد.

فهم پرس‌وجو را زیرسامانه جدا بدانید

کاربر ناقص، محاوره‌ای، غلط‌املایی، چندزبانه و وابسته به زمینه می‌پرسد. لایه پرس‌وجو می‌تواند ارجاع را حل، مخفف را گسترش، زبان را تشخیص، فیلتر را استخراج یا چند جست‌وجو تولید کند. هر دگرگونی recall را بهتر می‌کند و ممکن است نیت را عوض کند.

پرسش اصلی، بازنویسی، فیلتر تشخیص‌داده و کد دلیل را برای عیب‌یابی نگه دارید. بازنویسی خطرناک را روی نفی، تاریخ، نسخه محصول، شخصیت حقوقی و واحد بیازمایید. وقتی ابهام پاسخ را جدی تغییر می‌دهد سؤال روشن‌کننده بپرسید، نه اینکه با حدس مطمئن بازیابی کنید.

بازیابی ترکیبی اغلب تطابق واژگانی برای شناسه دقیق را با جست‌وجوی متراکم برای بازگویی معنایی جمع می‌کند. fusion و رتبه‌بندی دوباره را فقط پس از سنجش ارزش افزوده وارد کنید. مؤلفه بیشتر می‌تواند تأخیر و دشواری توضیح خرابی را بالا ببرد.

بازیابی را پیش از نثر بسنجید

کیفیت بازیابی می‌پرسد آیا سامانه شواهد را یافته است. مجموعه سؤال با یک یا چند بند مرتبط، مرجع لازم و حواس‌پرت‌کن شناخته‌شده بسازید. معیار می‌تواند recall@k، precision@k، میانگین رتبه متقابل، nDCG و پوشش مدرک باشد. سنجه را بر اساس کار انتخاب کنید: در پژوهش انطباق recall بالا مهم است و در پاسخ سریع شاید دقت نتیجه نخست.

برش را بر اساس زبان، نوع سند، عمر منبع، طول پرسش، نقش دسترسی و موجودیت نادر گزارش کنید. مورد «پاسخ در مجموعه وجود ندارد» را برای امتناع وارد کنید. اگر بند لازم در نامزد نیست، نمی‌توان مولد را بابت نقل‌نکردن آن مقصر دانست.

ارتباط سنتی بازیابی با سودمندی پایین‌دست تولید یکسان نیست. مقاله eRAG در ۲۰۲۴ در محیط آزمایشی خود هم‌بستگی کمی میان داوری ارتباط رایج و اثر RAG پایین‌دست گزارش کرد و ارزیابی سند از مسیر استفاده مولد را پیشنهاد داد. این نتیجه پژوهشی در تنظیمات مشخص است، نه دلیل حذف معیار ارتباط. تشخیص بازیابی و سنجه سرتاسری را با هم به کار ببرید.

وفاداری، صحت و ارتباط را جدا کنید

هر اصطلاح پرسش متفاوتی دارد:

  • ارتباط زمینه: آیا بندهای داده‌شده به سؤال مربوط بودند؟
  • وفاداری پاسخ: آیا ادعاهای پاسخ از زمینه داده‌شده پشتیبانی می‌شوند؟
  • صحت واقعیت: آیا ادعا با منبع معتبر یا مرجع راستی‌آزمایی‌شده درست است؟
  • ارتباط و کامل‌بودن پاسخ: آیا کار واقعی کاربر حل و عنصر لازم آورده شد؟
  • صحت ارجاع: آیا مکان ارجاع‌شده ادعای نزدیک را پشتیبانی و نسخه درست را باز می‌کند؟

مدل می‌تواند به سیاست منقضی وفادار و در نتیجه واقعاً غلط باشد. می‌تواند از حافظه خود درست بگوید اما مدرک بازیابی‌شده نداشته باشد. می‌تواند سند مرتبط را ارجاع دهد که عدد مشخص را پشتیبانی نمی‌کند. درمان این حالت‌ها متفاوت است.

RAGAS نمونه‌ای از پژوهش اولیه برای عملیاتی‌کردن چند بُعد ارزیابی RAG است و ARES نیز نمونه دیگری است. این پژوهش‌ها ایده ارزیابی خودکار مفید می‌دهند؛ نتیجه گزارش‌شده آن‌ها پایایی داور در دامنه، زبان یا سطح ریسک تازه را تضمین نمی‌کند.

داور خودکار را با انسان اعتبارسنجی کنید

مدل داور بیش از تیم انسانی مورد می‌بیند، اما سوگیری مشترک دارد، به پرامپت حساس است و شاید پاسخ روان بی‌پشتوانه را بپذیرد. نمونه انسانی کور با روبریک روشن و متخصص دامنه بسازید. توافق، قبولی اشتباه، رد اشتباه و رفتار هر بخش را اندازه بگیرید.

هرجا می‌شود کنترل قطعی به کار ببرید: هدف ارجاع وجود دارد، عدد نقل‌شده با بند یکسان است، دامنه دسترسی درست است، طرح خروجی معتبر و بخش لازم حاضر است. داور مدل را برای پرسش معنایی نگه دارید و مدرک معتبر را در اختیارش بگذارید.

مدل داور، پرامپت، روبریک و نمونه‌گیری را نسخه‌دار کنید. هنگام تغییر، ارزیابی قدیم و جدید را روی بخش هم‌پوشان اجرا کنید تا روند کالیبره شود. از سری امتیازی که ابزار سنجش آن پنهانی تغییر کرده نتیجه بهبود نگیرید.

زمینه را بسته شواهد حاکمیت‌شده بسازید

پس از بازیابی، رتبه‌بندی و ساخت زمینه باید تکرار را حذف، نسخه معتبر و جاری را ترجیح، همسایه ضروری را حفظ و تعارض را آشکار کند. شناسه و تاریخ اعتبار را به هر بند بچسبانید. بودجه زمینه را آگاهانه تخصیص دهید و صرفاً با k نتیجه بالا پر نکنید.

وقتی منابع متعارض‌اند، آن‌ها را به پاسخ نرم و یکنواخت تبدیل نکنید. تعارض را توضیح دهید، اگر فراداده اجازه می‌دهد قاعده قابل اجرا را مشخص کنید یا انتقال دهید. با مدرک ناکافی امتناع کنید و نزدیک‌ترین ماده قابل راستی‌آزمایی را نشان دهید. امتناع با گام بعد بهتر از اختراع زیباست.

پرامپت باید مدرک پذیرفتنی، روش ارجاع، زمان امتناع و اقدام نیازمند تأیید را بگوید. اما جای فیلتر درست و حاکمیت منبع را نمی‌گیرد.

ارجاع را کنترل کاربر بدانید

ارجاع وقتی ارزش دارد که خواننده ادعا را بررسی کند. به نسخه پایدار منبع و در صورت امکان بخش یا صفحه دقیق پیوند دهید. عنوان، مالک و تاریخ اعتبار را جایی که اقتدار مهم است نشان دهید. ارجاع به صفحه اصلی، سند عظیم بی‌مکان یا شناسه داخلی غیرقابل دسترسی ضعیف است.

پوشش ارجاع را در سطح ادعا بسنجید، نه صرف وجود کروشه. نمونه بردارید و بپرسید کدام ادعا مدرک می‌خواهد، آیا بند ارجاع آن را نتیجه می‌دهد و آیا کاربر با همان مجوز آن را باز می‌کند؟ ارجاع منقضی، شکسته، نامرتبط و غیرقابل دسترسی را جدا گزارش کنید.

رابط ارجاع بازخورد نیز می‌گیرد. گزینه «منبع این ادعا را پشتیبانی نمی‌کند»، «سیاست قدیمی است» و «منبع بهتر وجود دارد» بدهید. هر سیگنال را به مالک دانش یا تیم بازیابی بفرستید، نه صف عمومی پسندیدن.

ارزیابی آفلاین را به نتیجه تولید وصل کنید

سه لایه ارزیابی داشته باشید. مجموعه برچسب‌خورده ثابت رگرسیون را می‌سنجد. چالش گردشی سیاست، حمله، زبان و خرابی تازه را پوشش می‌دهد. تله‌متری تولید نتیجه واقعی مانند بازنویسی، بازکردن ارجاع، اصلاح، انتقال، رهاکردن و رخداد تأییدشده را ثبت می‌کند.

وظایف مشترک عمومی مانند TREC RAG Track در ۲۰۲۵ می‌تواند مقایسه و روش پژوهش را بهتر کند. این همچنان بنچمارک با پیکره، موضوع و پروتکل تعریف‌شده است؛ موفقیت در آن ثابت نمی‌کند پیکره خصوصی تولید تازه، امن از نظر مجوز یا برای کاربر مفید است.

تغییر ترکیب پرسش، نرخ بی‌نتیجه، تازگی منبع، امتیاز بازیاب، طول زمینه، امتناع پاسخ، استفاده ارجاع و اصلاح انسان را پایش کنید. ناهنجاری را به نسخه نمایه، مدل، پرامپت و سیاست وصل کنید. اصول پایش عامل هوش مصنوعی وقتی RAG ابزار را فعال می‌کند مهم‌تر می‌شود.

دروازه انتشار را بر اساس پیامد بسازید

دستیار جست‌وجوی کم‌ریسک کارکنان و کمک تصمیم بالینی نباید آستانه یکسان داشته باشند. برای هر کار حداقل recall مدرک، بیشینه ادعای بی‌پشتوانه، صفر بازیابی غیرمجاز، دقت پشتیبانی ارجاع، پوشش تازگی، تأخیر و امتناع مناسب تعریف کنید. معیار حیاتی را برش دهید؛ میانگین بالا می‌تواند شکست پرسش فارسی یا یک واحد کسب‌وکار را پنهان کند.

اقدام پراثر بازبینی انسان یا تأیید قطعی می‌خواهد. RAG مدرک فراهم می‌کند، اما اطمینان بازیابی مجوز اقدام نیست. نسخه منبعی را که تصمیم را پشتیبانی کرده ثبت کنید تا پس از تغییر سیاست ممیزی شود.

انتشار مرحله‌ای، نمایه سالم قبلی، بازگشت مدل و پرامپت و کلید حالت فقط جست‌وجو داشته باشید. اگر تولید بی‌ثبات شد، شواهد رتبه‌بندی‌شده و امن از نظر مجوز هنوز می‌تواند مفید باشد.

معماری عملی دستیار سیاست

دستیاری را در نظر بگیرید که به سؤال هزینه کارکنان پاسخ می‌دهد. خط ورود فقط منبع سیاست با مالک و تاریخ اعتبار را می‌پذیرد، بخش و جدول را تجزیه و کاربرد منطقه‌ای را علامت می‌زند. کنترل دسترسی به نمایه کپی می‌شود. سیاست جایگزین‌شده برای ممیزی می‌ماند اما جز در سؤال تاریخی وارد پاسخ جاری نمی‌شود.

هنگام پرسش، سامانه منطقه و نوع استخدام را از پروفایل مجاز می‌گیرد، تاریخ سفر مبهم را روشن و بازیابی ترکیبی اجرا می‌کند. رتبه‌بند بند جاری و قابل اجرا را بالا می‌آورد. بسته زمینه قانون اصلی، استثنا و ردیف جدول مرتبط را با شناسه نسخه دارد. مولد باید هر سقف مبلغ را ارجاع دهد و در نبود کاربرد منطقه‌ای امتناع کند.

مجموعه آزمون recall مدرک، انتخاب نسخه، ارتباط زمینه، وفاداری پاسخ، صحت واقعیت، کامل‌بودن و پشتیبانی ارجاع را جدا می‌سنجد. پایش تولید تکمیل موفق، اصلاح، انتقال، بازخورد منبع، تأخیر و قناری دسترسی غیرمجاز را می‌افزاید. این معماری پاسخ بد را قابل تشخیص می‌کند.

خرابی رایج و مالک درست

نمونه‌های رایج:

  • منبع گم‌شده یا قدیمی — مالک دانش و تیم ورود؛
  • سند مرتبط بازیابی نشده — تیم جست‌وجو و پرس‌وجو؛
  • نسخه غلط بالاتر از سیاست جاری — تیم فراداده و رتبه؛
  • مدرک یافته شده اما از زمینه حذف شده — مالک سازنده زمینه؛
  • زمینه حاضر اما پاسخ متناقض — مالک تولید و پرامپت؛
  • پاسخ وفادار بر منبع نادرست — مالک دانش؛
  • ارجاع نزدیک ادعاست اما آن را پشتیبانی نمی‌کند — مالک ارزیابی ارجاع؛
  • قطعه محدود برای کاربر غلط آمده — رخداد امنیتی، نه اشکال ارتباط.

این نقشه مالکیت مانع تبدیل هر مشکل به «مدل بزرگ‌تر امتحان کنیم» می‌شود.

انضباط عملیاتی

با پنجاه تا صد سؤال واقعی از یک گردش‌کار محدود شروع کنید. پاسخ و بند معتبر تعیین و مورد بی‌پاسخ و تعارض را اضافه کنید و نقش دسترسی را بیازمایید. پیش از افزودن تولید، معیار بازیابی را بسازید. سپس ساخت زمینه، وفاداری، صحت، کامل‌بودن و ارجاع را جدا ارزیابی کنید.

با مالک دانش، سطح خدمت تازگی، مسیر بازخورد و بازگشت عرضه کنید. خرابی را هر هفته بر اساس مرحله مرور کنید. مورد تأییدشده تولید را با حاکمیت مناسب به رگرسیون اضافه کنید. نتیجه سامانه بی‌خطا نیست؛ سامانه‌ای است که خطای آن دیده، نسبت داده و اصلاح می‌شود.

RAG زمانی اعتماد می‌سازد که به کاربر در بازرسی مدرک کمک کند، نه وقتی متن تولیدی را مطمئن جلوه می‌دهد. کیفیت بازیابی و وفاداری پاسخ به هم مرتبط‌اند اما یکی نیستند؛ و هیچ‌کدام دانش غیرقابل اعتماد را نجات نمی‌دهد.

یادداشت منابع

وضعیت منابع در ۳۰ ژوئیه ۲۰۲۶ بررسی شد. مجموعه مقالات TREC 2025 شامل مسیر RAG است و باید پژوهش بنچمارک زیر پروتکل منتشرشده تلقی شود، نه تأیید تولید. مقالات اولیه RAGAS و ARES رویکردهای ارزیابی خودکار برای ابعاد جداگانه RAG را شرح می‌دهند. مقاله eRAG رابطه ارزیابی بازیابی و تولید پایین‌دست را مطالعه می‌کند. نتایج پژوهش به داده و روش همان مطالعه وابسته است؛ ارزیاب خودکار باید برای دامنه و زبان مورد نظر اعتبارسنجی شود.

#RAG#جستجوی سازمانی#کیفیت دانش#سامانه‌های هوش مصنوعی

مطالب مرتبط

داده مصنوعی با شناسنامه
بینش‌های صنعت

داده مصنوعی با شناسنامه

داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعی‌بودن به معنی ناشناس یا بی‌خطر بودن نیست.

ادامه مطلب

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.