Definujte úlohu, povolené správanie a kritické chyby, potom zostavte reprezentatívnu a oddelenú testovaciu sadu s očakávaným dôkazom. Kombinujte deterministické kontroly s odbornou rubrikou, výsledky rozdeľte podľa scenárov a každú zmenu porovnajte s poslednou schválenou verziou pred nasadením.
Ukážka niekoľkých pekných odpovedí nepovie, ako sa AI systém správa pri neúplnom vstupe, konflikte zdrojov alebo požiadavke mimo rozsahu. Evaluácia vytvára opakovateľný spôsob, ako porovnať verziu modelu, pokynov, vyhľadávania a pravidiel na prípadoch, ktoré reprezentujú skutočnú prácu aj významné riziká.
Jedna univerzálna metrika nestačí. Klasifikácia, extrakcia, RAG odpoveď a agent s nástrojmi majú iné kritériá. Niektoré vlastnosti overí kód, iné odborný človek podľa rubriky. Výsledok má ukázať konkrétne typy chýb a rozhodovaciu hranicu pre nasadenie, nie iba priemer, ktorý skryje zriedkavé nebezpečné zlyhanie.
Preložte účel systému do hodnotiteľných kritérií
Začnite pracovným výsledkom. Pri extrakcii môže byť dôležitá správnosť konkrétnych polí a dôkaz, pri RAG vernosť zdrojom a schopnosť odmietnuť otázku bez podkladu. Pri agentovi hodnotíte aj voľbu nástroja, argumenty a dodržanie oprávnení. Kritérium má byť pozorovateľné a zrozumiteľné ľuďom, ktorí rozhodujú o použití.
Spíšte zakázané správanie a jeho závažnosť. Únik cudzieho dokumentu alebo vykonanie nepovolenej akcie nemôže vyvážiť množstvo dobrých odpovedí. Určte, ktoré chyby blokujú vydanie a ktoré možno prijať s kontrolou či obmedzením rozsahu. Hranice schvaľuje vlastník procesu spolu s bezpečnostnou a vecnou rolou podľa dopadu.
Zostavte reprezentatívnu a chránenú sadu
Prípady pokrývajú bežné vstupy, rôzne jazyky a formáty, sezónne varianty, chýbajúce údaje, konflikty, otázky mimo rozsahu a známe incidenty. Rozdelenie nemá iba kopírovať objem; zriedkavé kritické situácie dostanú samostatnú skupinu. Pri reálnych dátach minimalizujte citlivý obsah, obmedzte prístup a zdokumentujte oprávnený účel.
Očakávaný výsledok môže byť presná hodnota, zoznam prípustných odpovedí, požadovaný zdroj alebo kvalitatívna rubrika. Nejasné prípady označte a nechajte posúdiť odborníkmi. Sadu použitú na priebežné ladenie oddeľte od záverečnej kontroly, aby tím neoptimalizoval iba známe otázky. Verzie a zmeny prípadov evidujte rovnako ako kód.
- bežné, hraničné a zámerne nepriaznivé prípady
- očakávaný výstup alebo odborná rubrika
- samostatná skupina kritických bezpečnostných zlyhaní
- pôvod, oprávnenie a verzia testovacích dát
- zdokumentované rozhodnutie o vydaní alebo návrate
Kombinujte kódové, modelové a ľudské hodnotenie
Kód spoľahlivo overí schému, povolenú kategóriu, existenciu citácie, aritmetiku alebo zakázané volanie nástroja. Sémantickú úplnosť a vhodnosť často posúdi človek podľa konkrétnej rubriky. Model ako hodnotiteľ môže pomôcť pri väčšom objeme, ale potrebuje vlastné overenie, stabilný pokyn a pravidelnú kontrolu odchýlok voči odborníkom.
Pri ľudskom hodnotení definujte stupnicu, príklady a postup pri nezhode. Hodnotiteľ nemá vedieť, ktorá verzia je nová, ak by to ovplyvnilo úsudok. Sledujte súlad medzi ľuďmi a diskutujte sporné prípady; často odhalia chýbajúcu definíciu. Plynulosť textu oddeľte od faktickej opory, bezpečnosti a užitočnosti pre úlohu.
Porovnávajte verzie kontrolovane a po skupinách
Pri experimente zmeňte jednu pomenovanú súčasť alebo presne evidujte kombináciu modelu, promptu, parametrov, indexu a nástrojov. Rovnaké vstupy spustite za porovnateľných podmienok. Rozdiel v priemere rozložte podľa kategórie, jazyka a rizika. Nová verzia môže zlepšiť bežný prípad a zároveň zhoršiť odmietanie nepodložených odpovedí.
Prezrite konkrétne regresie a rozhodnite, či ide o náhodnú variáciu, chybu testu alebo skutočnú zmenu. Pri nedeterministickom správaní môže byť potrebné opakovanie vybraných prípadov a hodnotenie rozdelenia výsledkov. Nevytvárajte presný záver z malej vzorky. Rozhodnutie o nasadení uvedie zistenia, obmedzenia a pripravený spôsob návratu.
Zapojte evaluácie do vydania a spätnej väzby
Rýchle deterministické kontroly spúšťajte pri každej zmene, širšiu sadu pred vydaním a citlivé scenáre pri zmene modelu, zdrojov alebo oprávnení. Kritická regresia blokuje nasadenie. Výsledky uchovajte s konfiguráciou a artefaktmi potrebnými na reprodukciu v medziach dátových pravidiel. Testovacie kľúče a prostredia oddeľte od produkčných.
Potvrdené prevádzkové chyby pridávajte do sady po odbornom spracovaní a odstránení nepotrebných údajov. Monitoring a evaluácie sa dopĺňajú: prvý zachytí dnešnú prevádzku, druhé umožnia porovnať zmenu pred vydaním. Sada sa pravidelne reviduje, aby odrážala aktuálny proces bez straty dôležitých historických regresií.
Časté otázky
Koľko testovacích prípadov AI systém potrebuje?
Neexistuje univerzálny počet. Sada musí pokryť hlavné rozdelenie vstupov, hraničné situácie a kritické riziká. Rozširujte ju podľa nových potvrdených chýb a neistoty výsledkov.
Môže AI model hodnotiť odpovede iného modelu?
Môže pomôcť, ak jeho rubriku a zhodu s odborníkmi overíte. Nemá byť jediným rozhodcom pri citlivej vlastnosti alebo tam, kde opakuje rovnaké skreslenie.
Čo je regresia pri AI systéme?
Je to zhoršenie už požadovaného správania po zmene modelu, promptu, dát alebo kódu. Môže sa prejaviť iba v konkrétnej skupine, preto nestačí sledovať celkový priemer.



