بسیاری از پروژهها و دموهای آزمایشگاهی RAG (تولید مبتنی بر بازیابی) در نگاه اول و روی چند نمونه محدود جذاب به نظر میرسند، اما هنگام پیادهسازی در محیطهای واقعی سازمانی شکست میخورند. علت اصلی این اتفاق، عدم ارزیابی کمّی و سیستماتیک بخش بازیابی اطلاعات (Retrieval) است. اگر معماری بازیابی یک سامانه RAG تنها ۶۰ درصد از مستندات مرتبط را پیدا کند، قدرتمندترین مدلهای زبانی بزرگ (LLM) نیز روی ۴۰ درصد باقیمانده دچار توهم (Hallucination) یا ارائه اطلاعات نادرست خواهند شد. کیفیت بازیابی، حد بالای کارآمدی کل سامانه را مشخص میکند.
مخزن enterprise-rag-knowledge-base راهکاری سناریومحور برای حل این چالش در پایگاههای دانش سازمانی ارائه میدهد. این پروژه شامل ۲۷ سند سیاستگذاری داخلی در حوزههای منابع انسانی، فناوری اطلاعات، امنیت، مالی و مهندسی است و تمرکز اصلی خود را بهجای تولید متنهای عمومی، بر ارزیابی سنجههای بازیابی و معماری ترکیبی قرار داده است.
هسته اصلی این سیستم بر پایه بازیابی ترکیبی (Hybrid Retrieval) طراحی شده است. در این معماری، الگوریتم واژگانی BM25 که در یافتن اصطلاحات دقیق و نامهای خاص عملکرد فوقالعادهای دارد، با مدل معنایی LSA (تحلیل معنایی نهفته مبتنی بر TF-IDF) ترکیب میشود. مدل LSA امکان درک جملات دگرنویسیشده و پرسشهایی که از مترادفها استفاده میکنند را فراهم میسازد. سپس نتایج این دو روش با استفاده از تکنیک ادغام رتبهای معکوس (Reciprocal Rank Fusion یا RRF) همگامسازی و بازرتبهبندی میشوند.
نقطه تمایز برجسته این پروژه، سنجش عملکرد بازیابی با سنجههای استاندارد Recall@k و MRR@k روی یک مجموعه داده ارزیابی شامل ۴۰ پرسش برچسبگذاریشده است. نتایج آزمایشها نشان میدهد که روش ترکیبی RRF توانسته است به Recall@3 و Recall@5 کامل (۱.۰۰۰) و شاخص MRR@5 معادل ۰.۹۴۶ دست یابد. این ارقام نشان میدهند که ترکیب RRF نه تنها میانگین نقاط ضعف را بازتاب نمیدهد، بلکه نقاط قوت هر دو روش کلیدواژهای و معنایی را بهطور همزمان جذب میکند.
در لایه سنتز و پاسخدهی، این سیستم از رویکرد «پاسخدهی استخراجی مستند» استفاده میکند. در بستر قوانین و دستورالعملهای سازمانی، قابلیت ردیابی منبع (Traceability) و درج ارجاع صریح به بخش منبع ([doc_id]) اهمیت بسیار بالاتری نسبت به روانی ظاهری متن دارد. پروژه بهگونهای طراحی شده که بخش سنتز پاسخ کاملاً ماژولار بوده و در صورت نیاز به استفاده از مدلهای زبانی مولد، تنها با تغییر یک تابع میتوان LLM دلخواه را به آن متصل کرد.
این پروژه یک الگوی استاندارد و آماده برای مهندسان داده و توسعهدهندگان هوش مصنوعی است تا پیش از ورود سامانههای RAG به محیط عملیاتی، زیرساخت بازیابی خود را به صورت سنجهمحور، شفاف و قابل اتکا پیادهسازی و ارزیابی کنند.