Сұрау жұптары арқылы орысша-қазақша іздеуді реранжирлеу
Орысша-қазақша іздеуді реранжирлеуді қиын жұптар, тіл матрицасы, релеванттық белгісі, теріс мысалдар және қате срездері арқылы тексеріңіз.

Орысша және қазақша құжаттар бойынша іздеу жүйе тілді мүлде түсінбеген кезде ғана бұзылмайды. Ақау одан ертерек пайда болады: қажетті құжат кандидаттар тізімінде бар, бірақ реранжирлеу моделі жоғарыға сөздері сәйкес келетін, процедурасы басқа немесе орысша түсіндірмесі ыңғайлы мәтінді қояды. Бүкіл корпус бойынша есептелген орташа метрика бұл сәтсіздікті көбіне жасырып қалады.
Мұндай іздеуді параллель аудармалар жинағымен ғана тексеру жеткіліксіз. Сізге бағалаушы басқа сұраққа жауап беретін жинақ керек: сұрау мен құжат әртүрлі тілде жазылса да, терминология, қысқартулар және сөйлемнің бір бөлігі бір тілден екіншісіне ауысса да, бұл құжат сұраудың ниетіне сәйкес келе ме? Продакшен үшін бұл модельдің мұқият аударылған екі жаңалықты сәйкестендіре алуынан маңыздырақ.
Жинақ аударма ұқсастығын емес, ретті өлшеуі керек
Орысша-қазақша іздеуді реранжирлеу бір немесе бірнеше шынымен пайдалы құжат және қауіпті ұқсас бірнеше бәсекелес бар шағын нәтижелер тізімінде бағаланады. «Орысша сұрау және оның қазақша аудармасы» жұбы семантикалық жақындықты өлшейді. «Орысша сұрау және пайдаланушының мәселесін шешетін қазақша құжат» жұбы іздеуді өлшейді. Бұл екі бөлек сынақ.
Мысалы, пайдаланушы: «жалақы сақталмайтын демалысты қалай рәсімдеуге болады?» деп жазады. Қазақша құжатта қажетті рәсім, шарттар, өтініш және ерекшеліктер болуы мүмкін. Оның жанында сенімді көрінетін, бірақ қате құжаттар тұруы керек: жыл сайынғы ақылы демалыс, еңбекке жарамсыздық парағы және іссапар туралы материалдар. Кездейсоқ мәтіндерді қатар қойсаңыз, қазіргі реранжирлеу модельдерінің көбі жақсы нәтиже көрсетеді, өйткені тапсырма тым жеңіл болады.
Мына үш қасиетті бөлек қарастырыңыз:
- Аудармалық эквиваленттілік. Екі үзінді әртүрлі тілде шамамен бір мағынаны білдіреді.
- Іздеу релеванттылығы. Формулировкалары қатты өзгеше болса да, құжат сұраудың ниетін орындауға көмектеседі.
- Реттегішідегі басымдық. Бірнеше пайдалы мәтіннің ішінен жүйе сұраққа дәлірек жауап беретін және пайдаланушыны қате әрекетке итермелемейтін мәтінді бірінші қояды.
Командалар бұл қасиеттерді жиі араластырып жібереді. Содан кейін екітілді параллель сөйлемдерде жоғары score алып, RAG неге ереженің ескі нұсқасы бойынша жауап бергеніне таң қалады. Модель «өтініш» пен «заявление» сөздерін жақсы сәйкестендіруі мүмкін, бірақ демалыс туралы өтініш пен жеке деректерді өзгерту туралы өтінішті ажырата алмауы ықтимал.
MuSeCLIR жұмысында авторлар атаулы нысандар басым жинақтардың әлсіздігін бөлек көрсетеді: оларды жиі транслитерациялау жеткілікті, сондықтан мұндай тексеру мағынадағы екіұштылықты шешуді талап етпейді. Орысша-қазақша жинақ үшін бұл әсіресе маңызды: ұйым атаулары, бұйрық нөмірлері және ағылшынша қысқартулар модельге тым оңай ұпай береді.
Алдымен доменіңізде «релевантты» деген не екенін бекітіңіз
Аннотаторлар аударманың әдемілігін немесе құжаттың жалпы тақырыбын емес, пайдаланушының бастапқы тапсырманы орындай алуын бағалауы керек. Бұл ережені жұптарды жинамас бұрын жазып қойыңыз. Әйтпесе бір судья құжатты «демалыс туралы» болғаны үшін релевантты деп белгілейді, ал екіншісі онда демалыстың басқа түрі сипатталғандықтан қабылдамайды.
Әр сұрау үшін ниет карточкасын жасаңыз. Оған бес өріс жеткілікті:
- Пайдаланушы не істегісі немесе нені білгісі келеді.
- Жауапта қандай факт, шарт немесе әрекет болуы керек.
- Қандай құжаттар толық шешім ретінде жарайды.
- Қандай ұқсас құжаттарды толық шешім деп санауға болмайды.
- Нақты трафикте сұраудың қандай тілдік формасы күтіледі.
«Қайтарымды қалай рәсімдеймін?» сұрауына арналған карточкада «қайтару туралы құжат» деп жазбаңыз. Бұл тым жалпылама. Нақтырақ жазыңыз: пайдаланушы тауарды қайтарғысы келеді, оған мерзім, жүгіну арнасы және қайтару шарттары қажет. Қайтару ережесі толық релевантты. Кепілді жөндеу туралы бет ішінара релевантты. Егер онда басқа процесс сипатталса, қызмет үшін төлемді қайтару туралы мәтін релевантты емес.
Мұндай келісім бір сөз кездескен кез келген құжатты эталонға алу әдетін жояды. Корпоративтік базаларда бұл қате «өтініш», «келісім», «төлем», «жоба», «есеп» сөздерінің айналасында жиі кездеседі. Бір сөз қажетті нысанды білдіруі мүмкін, бірақ құжатта басқа маршрут, мәртебе немесе бөлім сипатталуы ықтимал.
Құқықтық, медициналық және қаржылық материалдарға карточкаға өзектілік белгісін қосыңыз. Ескі құжат жақсы жазылған, қатесіз аударылған және тақырыпқа дәл сәйкес болуы мүмкін, бірақ оны қолданыстағы нұсқадан жоғары қоюға болмайды. Нұсқаны ескермейтін ранжирлеу тілдік мәселе емес, екітілді тексерісте байқалмай қалуы мүмкін операциялық ақау.
Тіл матрицасы орта жасырып тұрған теңгерімсіздікті көрсетеді
Ең аз матрица төрт бағыттан тұрады: орысша сұрау орысша құжатқа, орысша сұрау қазақша құжатқа, қазақша сұрау қазақша құжатқа және қазақша сұрау орысша құжатқа. Төрт бағыт та бір жинақта және салыстырмалы күрделілікпен болуы керек.
Егер тек екі кросс-лингвистикалық бағытты қалдырсаңыз, жаңа модельдің біртілді іздеуде нашарлағанын білмейсіз. Тек орысша сұрауларды қалдырсаңыз, қазақша пайдаланушы үшін нақты сапаны емес, орысша сөйлейтін команданың ыңғайын өлшейсіз.
Осы матрицаға екі бөлек срез қосыңыз:
- Аралас сұрау: «eGov анықтамасын скачать», «жеке кабинетте пароль ауыстыру», «договорға қол қою тәртібі».
- Аралас құжат: негізгі бөлігі орысша, өрістері қазақша, екітілді кесте немесе бөлім атаулары екі тілде берілген ереже.
Аралас мәтінді «бесінші тілге» айналдыруға болмайды. Мұнда сөйлем ішіндегі шекаралар маңызды. Пайдаланушы әрекетті қазақша жазып, форма атауын интерфейсте солай көрсетілгендіктен орысша қалдыруы мүмкін. Құжатта заңдық шарт бір тілде, орындаушыға арналған түсіндірме екінші тілде болуы ықтимал. Бүкіл жолдың тілін анықтап, кейін бір өңдеушіні таңдайтын модель мұндай жағдайларды жиі жіберіп алады.
Жұптарды механикалық айнаға айналдырмаңыз. Егер орысша сұрауға тек қазақша сөзбе-сөз аударма сәйкес келсе, жүйе үлгіні тез жаттап алады. Оның орнына табиғи формасы әртүрлі, бірақ ниеті бірдей сұрауларды жинаңыз. Бір әрекет үшін «анықтаманы қайдан алуға болады», «анықтама қайдан алынады», «анықтаманы жүктеу керек» және «жеке кабинеттен анықтама таба алмай отырмын» деген нұсқалар болуы мүмкін. Олар бір-бірінің аудармасы болмауы мүмкін, бірақ бірдей релевантты материалдар жиынына апаруы керек.
Арабша-ағылшынша RAG бойынша зерттеу сұрау мен растайтын құжат тілінің ауысуы жауап генерациясында ғана емес, дәл ранжирлеу кезеңінде айтарлықтай құлдырау беретінін көрсетті. Авторлар бір ғана ыңғайлы кросс-лингвистикалық диагональды емес, сұрау мен құжат тілдерінің барлық үйлесімін тексерген. Домен мен тіл жұбы басқа болса да, орысша-қазақша бағалауда осы дизайнды қайталау керек.
Құжаттарды тілге емес, пайдаланушы тапсырмасына қарай жинаңыз
Бастапқы корпусты жұмыс тапсырмаларының айналасына жинаңыз: қайтарымдар, қолжетімділіктер, кадр рәсімдері, тарифтер, өтінішке қойылатын талаптар, төлем мәртебелері, ішкі нұсқаулықтар және қолдау қызметінің жауаптары. Содан кейін орысша және қазақша материалдарды таңдаңыз. Тілдерден бастасаңыз, бір сұрау үшін сирек бәсекелесетін екі ұқыпты құжат сөресі пайда болады.
Жақсы бағалау бірлігі сұраудан, кандидаттар пулынан және әр кандидаттың белгісінен тұрады. Бір ғана оң жұпты сақтамаңыз. Бір оң құжат реттегішінің ретін тексермейді, өйткені модельдің таңдау жасайтын мүмкіндігі болмайды.
Практикалық JSONL форматы мынадай болуы мүмкін:
{
"query_id": "hr_014_kk_ru",
"query": "демалысқа өтінішті қайда жіберемін",
"query_language": "kk",
"intent": "leave_request_submission",
"candidates": [
{
"doc_id": "hr_leave_request_ru_v3",
"document_language": "ru",
"text": "Заявление на отпуск сотрудник направляет через кадровый портал...",
"grade": 3,
"reason": "Описывает нужный канал подачи заявления"
},
{
"doc_id": "hr_leave_policy_kk_old",
"document_language": "kk",
"text": "Еңбек демалысының жалпы тәртібі...",
"grade": 1,
"reason": "Тема совпадает, но нет способа подачи и редакция устарела"
},
{
"doc_id": "hr_sick_leave_ru",
"document_language": "ru",
"text": "Лист нетрудоспособности передается руководителю...",
"grade": 0,
"reason": "Другой тип отсутствия"
}
]
}
reason өрісі сән үшін емес. Ол бағалауды сандар кестесінен қателерді талдауға арналған материалға айналдырады. Бір айдан кейін модель «жалпы саясат туралы құжатты» «нақты әрекеті бар құжатпен» шатастыратын барлық жағдайды таба аласыз, жүздеген жолды қайта оқудың қажеті болмайды.
Құжаттарды адам қалай оқыса, солай сегменттеңіз. Он беттік толық ережеде қажетті норма да, жанама бес процедура да болуы мүмкін. Өнімде пассаждар ранжирленсе, пассаждарды белгілеңіз. Пайдаланушы толық құжат ашса, құжат деңгейінде екінші бағалауды қосыңыз. Позитив ретінде бүкіл файл белгіленген эталонмен пассаждық реранжирлеуді әділ салыстыруға болмайды.
Қиын теріс мысалдар сынақтың құндылығын анықтайды
Ең пайдалы теріс құжаттар дұрыс мәтінге соншалық ұқсайды, адам алғашында күмәнданады. Оларды бөтен тақырыптан жасанды іздеудің қажеті жоқ. Олар дұрыс материалдардың қасында тұрады: көрші процедура, өтініштің басқа мәртебесі, қызметтің басқа алушысы, ескі нұсқа немесе ережеден ерекшелік.
Әр сұрауға бәсекелестердің бірнеше түрін қосуға тырысыңыз, бірақ бүкіл жинақта бір үлгіні қайталамаңыз:
- Нысаны бірдей, әрекеті басқа құжат: рәсімдеудің орнына күшін жою.
- Әрекеті бірдей, субъектісі басқа құжат: клиенттің орнына қызметкер үшін.
- Термині дұрыс, шарты қате құжат: басқа мерзім, лимит немесе жүгіну арнасы.
- Аудармаға ұқсайтын, бірақ іргелес процедураны сипаттайтын басқа тілдегі құжат.
- Дұрыс ескі нормаға негізделген, кейін жаңа мәтін алмастырған құжат.
«Тақырыпқа мүлде қатысы жоқ» негатив тек жалпы тексеріс үшін қажет. Ол бәрінің бірден бұзылмағанын көрсетеді. Реранжирлеу сапасы туралы дерлік ақпарат бермейді.
Екітілді құжаттағы жалған ұқсас жұп ең қауіпті. Мысалы, орысша «ақшаны қайтару» құжаты тоқтатылған қызметке қатысты, ал қазақша «тауарды қайтару» үзіндісі тауарды қайтару туралы болуы мүмкін. Аудармашы оларды жақындатады, ал үстірт семантикасы бар реранжирлеу моделі екеуін қатар қояды. Жинақта мұндай жұп болуы керек, өйткені ол модельдің нысан мен әрекетті бірге түсінетінін көрсетеді.
Оң құжаттың бір сөзін ауыстырып жасаған машиналық аударманы жалғыз теріс мысал ретінде пайдаланбаңыз. Ол сезімталдықты бөлек тексеруге пайдалы, бірақ тез арада синтетикалық үлгіге айналады. Реранжирлеу моделі домен тілін түсінгені үшін емес, генерация артефактісінің арқасында ұта бастайды.
0-3 бағасы «тапты немесе таппадыдан» жақсырақ
Төрт бағадан тұратын шкала іздеуге жеткілікті айырмашылық береді және белгілеуді диссертацияға айналдырмайды. Мен оны әдетте былай құрамын:
3- құжат басқа негізгі дереккөзсіз тапсырманы орындауға мүмкіндік береді.2- құжат пайдалы, бірақ маңызды шартты немесе әрекетті толық қамтымайды.1- тақырыбы сұраумен байланысты, бірақ оқырман бұл мәтін арқылы тапсырманы шеше алмайды.0- құжат ниетке қатысы жоқ немесе қате әрекетке әкеледі.
2 бағасы жүйені орынды қосымша материал үшін жазаламауға, бірақ оны тікелей жауаппен теңестірмеуге көмектеседі. 1 тақырыптық сәйкестікті нақты пайдадан ажыратады. Бұл баға болмаса, екі аннотатор әртүрлі мағынада дұрыс болған жағдайда «релевантты ма, жоқ па» деген дауға тірелесіз.
Екі тәуелсіз судья алдымен шағын ортақ пакетті белгілеуі, кейін айырмашылықтарды ниет карточкалары бойынша талдауы керек. Бірдей талғамға жетуге тырыспаңыз. Бірдей ережеге жетіңіз. Бір адам саясаттың жалпы сипаттамасына 3, екіншісі 1 берсе, мәселе әдетте олардың тілдік білігінде емес, толық жауаптың анықтамасында болады.
Егер өнімде пайдаланушы түпнұсқаны көрсе, құжат тілін аннотатордан жасырмаңыз. Пайдаланушыға пайда нәтижені оқи алу мүмкіндігін де қамтиды. Бірақ тілге деген жеке басымдық релеванттылықты автоматты түрде төмендетпеуі керек: басқа тілдегі құжат мінсіз дереккөз болуы мүмкін, әсіресе интерфейс аударма немесе қысқаша түсіндірме көрсете алса.
Parton, Habash және McKeown-ның трансляциялық іздеу туралы жұмысы бұл бөлудің неге қажет екенін жақсы көрсетеді. Авторлар бастапқы және аударылған нәтижелердің релеванттылығын салыстырып, машиналық аударма қателерінен орташа дәлдіктің төмендегенін көрсетті. Яғни іздеу сәтті болғаннан кейін де нәтиже аудармасы пайдаланушы бағасын бұрмалауы мүмкін.
Алдымен кандидаттың жоғалуын реранжирлеу қатесінен ажыратыңыз
Реранжирлеу моделі кіріс тізімінде жоқ құжатты түзете алмайды. Сондықтан әр сұрау үшін екі нәтижені сақтаңыз: бірінші кезең кандидаттарының арасында 3 бағасы бар құжат бар ма және реранжирлеуден кейін қай орынға шықты.
Тексеру қарапайым. Бір сұраулар жинағы үшін реранжирлеуге дейінгі top-100 немесе нақты қолданылатын басқа шекке дейінгі идентификаторларды сақтаңыз. Содан кейін 3 бағасы бар құжаттар бойынша Recall@K есептеңіз. Одан кейін қайта реттелген пул үшін nDCG@10 және MRR есептеңіз. Егер «қазақша сұрау - орысша құжат» бағытында Recall@100 төмен болса, мәселе эмбеддингтерде, лексикалық іздеуде, сұрау аудармасында немесе нәтижелерді біріктіруде. Recall@100 жоғары, бірақ nDCG@10 төмен болса, кінәлі реранжирлеу моделі немесе оның кіріс формасы.
Мұндай диагностикаға арналған қарапайым скрипт арнайы фреймворкті қажет етпейді. Ол нақты нәтиже ретімен берілген бағалар тізімін қабылдайды:
import math
def dcg(grades, k=10):
return sum(
(2 ** grade - 1) / math.log2(rank + 2)
for rank, grade in enumerate(grades[:k])
)
def ndcg(grades, k=10):
ideal = sorted(grades, reverse=True)
denom = dcg(ideal, k)
return 0.0 if denom == 0 else dcg(grades, k) / denom
def reciprocal_rank(grades):
for rank, grade in enumerate(grades, start=1):
if grade == 3:
return 1 / rank
return 0.0
observed = [1, 0, 3, 2, 0, 0]
print(f"nDCG@10={ndcg(observed):.3f}")
print(f"MRR@all={reciprocal_rank(observed):.3f}")
Мұндай мысалда нәтиже мынадай болады:
nDCG@10=0.590
MRR@all=0.333
MRR-ды жалғыз метрика деп санамаңыз. Ол сұрауда бір анық үздік жауап болғанда пайдалы. Бірақ 3 бағасы бар екі құжат бірін-бірі толықтырса немесе нәтижелерде бірнеше жақсы құжат маңызды болса, MRR пайдаланушы тәжірибесін сипаттай алмайды. Мұндайда nDCG@10 дұрысырақ, өйткені ол орындар мен релеванттылық деңгейлерін ажыратады.
Срездерді талдамай тұрып көрсеткіштерді бір «жалпы баллға» біріктірмеңіз. Есепте тіл бағыттарының матрицасы, аралас мәтіндер, домендер, қысқа және ұзын сұраулар, сондай-ақ ескі құжаттар бөлек көрсетілуі керек. Орташа nDCG өсуі мүмкін, өйткені модель жеңіл орысша сұрауларда жақсарған, бірақ сирек кездесетін әрі маңызды қазақша процедураларда нашарлаған.
Сұрауды аудару базалық деңгей ретінде пайдалы, бірақ жалғыз жол ретінде қауіпті
«Сұрауды екінші тілге аударып, кәдімгі іздеуді іске қосайық» стратегиясы бұрынғы біртілді индексті тез пайдаланатындықтан танымал. Оны экспериментте baseline ретінде міндетті түрде қалдырыңыз. Бірақ өзіңіздің қиын жұптарыңызда салыстырмай тұрып оны эталон деп атамаңыз.
Saleh пен Pecina-ның медициналық кросс-лингвистикалық іздеу туралы зерттеуінде олардың жағдайында сұрауды аудару құжаттарды аударудан жалпы алғанда жақсы нәтиже берген. Бұл екі стратегияны әділ тексеру керек екенін көрсетеді, бірақ біреуін әмбебап таңдау керек дегенді білдірмейді. Медициналық корпус, оның терминологиясы және аударма сапасы Қазақстандағы корпоративтік құжаттарға ұқсамайды.
Әр сұрау үшін кемінде үш іске қосу жасаңыз:
- Бастапқы сұрау бойынша тікелей іздеу және реранжирлеу.
- Сұраудың екінші тілдегі аудармасы бойынша іздеу.
- Екі іске қосу нәтижесіндегі кандидаттарды біріктіріп, кейін бірыңғай реранжирлеу.
Тек жалпы nDCG-мен шектелмеңіз. Стратегиялар әртүрлі нәтиже берген сұрауларды алып, алғашқы бес нәтижені оқыңыз. Әдетте себеп бірден көрінеді: аударма қысқартуды жоғалтқан, заң терминін ауызекі сөзбен ауыстырған, көпмағыналы сөздің қате мағынасын таңдаған немесе тілдердің араласуын өшірген.
«Қызмет көрсету актісін жіберу» сұрауын ойланбастан «отправить акт» деп аударуға болмайды. Әртүрлі ұйымдарда «акт» орындалған жұмыс актісін, қабылдау актісін, салыстыру актісін немесе ішкі растауды білдіруі мүмкін. Егер өріс атауының ағылшынша нұсқасында және орысша құжаттарда бір нұсқа бекітілсе, ал қазақша сұрауда пайдаланушы кеңірек мағынада айтса, аударма қате процедураны ранжирлеу қаупін арттырады.
Реранжирлеу моделінің кірісінде пайдаланушы көретін контекст дәл болуы керек
Модельді шешім қабылдауын күтетін деректермен бірдей деректермен қоректендіріңіз. Продакшенде ол тақырып, үзінді және нұсқа туралы метадерек алса, оны тазартылған толық құжат мәтінінде бағаламаңыз. Пайдаланушыға тек пассаж қолжетімді болса, чанк шегінен тыс қалған маңызды абзацқа сүйеніп пассажға баға бермеңіз.
Жақсы кіріс әдетте тақырыпты, үзіндінің негізгі мәтінін, тілді, құжат түрін, сондай-ақ таңдауға әсер етсе күнін немесе нұсқасын қамтиды. Бірақ метадеректі жасырын жауап ретінде бермеңіз. Егер оны жұмыс істейтін іздеу де қолданса, is_current=true өрісін беруге болады. Ал кірістің ішіне «дұрыс құжат» деген қолмен қойылған белгі енгізуге болмайды.
Өрістердің реті мен ұзындығын да тексеріңіз. Мәтінді былай біріктірсеңіз:
[ru] Заголовок: Порядок возврата товара
Тип: Регламент
Текст: ...
оны орысша және қазақша мәтін үшін бірдей жасаңыз. Жиі кездесетін қателердің бірі орысша құжаттарда толық тақырып болып, қазақша құжаттар индекске файлдың техникалық атымен түскенде пайда болады. Мұндайда модель тілдерді емес, контентті дайындау сапасын ранжирлейді.
Жинаққа жауап бірінші сөйлемде тұрмайтын құжаттарды қосыңыз. Әйтпесе тақырыптарды салыстыру қабілетін ғана тексересіз. Бұл FAQ іздеу үшін пайдалы, бірақ ережелерді, келісімшарттарды, нұсқаулықтарды және шарттары тығыз білім базасын тексеруді алмастырмайды.
Қателер журналы жоқ сынақ жақсартуға материал бермейді
Модельдерді әр салыстырғаннан кейін тек метрикаларды емес, әр срез бойынша алғашқы қате нәтижелерді де тіркеңіз. Әр қате үшін сұрауды, сұрау тілін, қате позициядағы құжатты, одан жоғары тұруы тиіс құжатты, бағаларды, қате түрін және қысқа шешімді жазу жеткілікті.
Қате түрлерін тұрақты ұстаған ыңғайлы: ескерілмеген шарт, қате нысан, қате әрекет, екіұшты термин, ескі нұсқа, аралас үзіндінің жоғалуы, әлсіз кандидаттық іздеу және нашар сегментация. Бірнеше итерациядан кейін уақытты қайда жұмсау керегін көресіз. Егер қателердің жартысы қажетті кандидаттың жоқтығымен байланысты болса, реранжирлеу моделінің промптын апта бойы өзгерту мағынасыз.
Жүйені бір ғана сынақ жинағында оқытпаңыз және баптамаңыз. Команда баптау кезінде қарамайтын жабық сұраулар пакетін қалдырыңыз. Ашық жинақ диагностикаға қажет, ал жабық жинақ тек белгілі формулировкаларды жаттап алмағаныңызды көрсетеді. Бұл әсіресе LLM сұрауларды, синтетикалық негативтерді немесе қате талдауын жасауға қатысқанда маңызды.
Егер инфрақұрылымда бірыңғай OpenAI-үйлесімді шлюз қолданылса, мұндай сынақты бөлек офлайн тапсырма ретінде іске қосу ыңғайлы: модель нұсқасын, кіріс шаблонын, кандидаттар тізімін және соңғы нәтижені аудит журналына сақтаңыз. AI Router арқылы модельдерді салыстырғанда клиент кодын өзгертпей, әртүрлі модельдерге бірыңғай API қолжетімділігін пайдалануға болады.
Сынақ жинағы сіздің «екі тілді қолдағаныңызды» дәлелдемейді. Ол қарапайым нәрсені көрсетеді: орысша, қазақша және аралас формулировка кезінде жүйе адам қажетті әрекетті орындай алатын құжатты жоғары көтере ме? Есепте бұл айырмашылық көрсетілмейінше, жоғары орташа score іздеуге сенуге негіз емес, жай ғана ыңғайлы сан болып қалады.
Жиі қойылатын сұрақтар
Реранжирлеу сынағы машиналық аударманы тексеруден несімен ерекшеленеді?
Жоқ. Аударма мәтіннің басқа тілде мағынасын жеткізгенін тексереді. Реранжирлеу нақты іздеу нәтижелерінде жүйенің релевантты құжатты мағынасы ұқсас, бірақ қате құжаттардан жоғары қоя алатынын тексереді. Бір аударма адамға жеткілікті болуы мүмкін, бірақ реранжирлеу моделі үшін жеткіліксіз болуы ықтимал.
Орысша-қазақша жинаққа біртілді жұптарды қосу керек пе?
Иә, барлық бағыт қажет: орысша сұрау орысша және қазақша құжатқа, қазақша сұрау қазақша және орысша құжатқа бағытталуы керек. Тек тілдері әртүрлі жұптарды тексерсеңіз, модельдің біртілді іздеуді нашарлатқанын байқамай қаласыз.
Орысша және қазақша аралас сұрауларды қалай сынауға болады?
Егер пайдаланушыларыңыз немесе құжаттарыңыз осылай жазса, міндетті түрде қосыңыз. Корпусты алдын ала мінсіз бір тілге келтіруге тырыспаңыз: аралас формулировкада релеванттыққа әсер ететін нақтылау, өнім атауы, заң термині немесе қысқарту болуы мүмкін.
Кандидаттарды іздеу кінәлі ме, әлде реранжирлеу моделінің өзі ме, оны қалай түсінуге болады?
Бірден айтуға болмайды. Алдымен релевантты құжаттың кандидаттар пулына, мысалы top-100-ге, түскенін өлшеңіз. Егер ол пулға кірмесе, реранжирлеу оны жоғары көтере алмайды. Бұл жағдайда іздеудің бірінші кезеңін немесе сұрауды кеңейту стратегиясын түзету керек.
Қолмен белгілеу үшін релеванттықтың қанша деңгейі жеткілікті?
Негізгі бағалау үшін үш деңгейлі шкаланы қолданыңыз: релевантты емес, ішінара пайдалы, тапсырмаға толық жауап береді. Қосымша себеп белгісін енгізіңіз: дұрыс норма, дұрыс рәсім, құжаттың дұрыс нұсқасы, тек сөздер бойынша сәйкестік немесе мағыналық сәйкестігі жоқ басқа тіл.
Кездейсоқ құжаттарға қарағанда қандай теріс мысалдар пайдалырақ?
Тақырыбы ұқсас, бірақ әрекеті, мерзімі, мәртебесі, субъектісі немесе ерекшелігі қате құжаттар ең пайдалы. Кездейсоқ мәтін реранжирлеуді дерлік тексермейді, өйткені оны әлсіз модель де оңай төмен қояды.
Реранжирлеу моделін бағалау үшін қандай метрикалар қажет?
Рет сапасының негізгі метрикасы ретінде nDCG@10-ды, кандидаттар пулын тексеру үшін Recall@K-ны, ал сұрауда әдетте бір ғана анық үздік құжат болса MRR-ды қараңыз. Нәтижелерді тіл бағыты мен мағына түрі бойынша міндетті түрде бөліңіз, әйтпесе орташа көрсеткіш қазақша сұраулардағы сәтсіздікті жасырады.
Сұраулар мен құжаттар жұбын LLM арқылы белгілеуге бола ма?
Тұрақты қолмен белгілеу жасалғаннан кейін ғана. LLM кандидаттарды, сұрау нұсқаларын және даулы теріс мысалдарды жылдам ұсына алады, бірақ сол модельдің сапасын дәлелдейтін эталондық бағаларды жалғыз өзі тағайындамауы керек.
Іздеудің алдында сұрауды екінші тілге аударған дұрыс па?
Бұл пайдалы болуы мүмкін, бірақ оның құны бар. Сұрауды аудару терминдерді өзгертіп, тіл араласуын жойып, қате іздеуге дейін енгізуі мүмкін. Тікелей көптілді реранжирлеуді, сұрауды аударуды және біріктірілген тәсілді бір жинақта салыстырыңыз. Әдемі демоға қарап таңдау жасамаңыз.
Алғашқы пайдалы сынақ үшін жинақ көлемі қандай болуы керек?
Міндетті түрде үлкен болуы шарт емес. Бірінші нұсқа үшін алып кесте жинағаннан гөрі тіл бағыттары мен доменіңізге тән қателерді қамту маңызды. Қиын әрі сарапшылар тексерген шағын жинақ мыңдаған бірсарынды параллель сөйлемнен пайдалырақ болады.