Webinar VZMR
Právní Prostor

Codexis AI: Rozsáhlý test na 170 reálných případech z oblasti pracovního práva

Když se dnes v právním prostředí mluví o umělé inteligenci, debata často sklouzává do dvou krajností: na jedné straně stojí bezbřehý marketing technologických nadšenců, na straně druhé skepse opřená o historky o vymyšlených judikátech. Pro advokáty, podnikové právníky, ale i personalisty a mzdové účetní má však smysl jediné měřítko: jak si jazykový model poradí se reálným případem z českého prostředí, posuzovaným měřítky tuzemské judikatury.

Codexis AI: Rozsáhlý test na 170 reálných případech z oblasti pracovního práva

Důraz na schopnost řešit reálné životní situace

Reálný život v podniku a advokátní kanceláři je diametrálně odlišný od laboratorních podmínek — klient nepřichází s hotovou právní větou z informačního systému; přichází s neúplným popisem situace, emocionálním zabarvením a často zcela mylnou představou o tom, co mu právo umožňuje.

Cílem popsaného testu bylo prověřit analytické a argumentační schopnosti systému na reprezentativním vzorku reálné soudní praxe. Volba českého pracovního práva nebyla náhodná. Jde o odvětví, které spojuje silnou ochranářskou funkci vůči zaměstnanci jako slabší straně s vysokým podílem kogentních norem a množstvím relativně neurčitých právních pojmů (jako jsou „dobré mravy“, „vážné provozní důvody“ či „intenzita porušení pracovní kázně zvlášť hrubým způsobem“). Skutečný obsah těchto institutů dotváří až ustálená judikatura. Právě zde se ukazuje, zda model skutečně právně uvažuje, nebo zda pouze generuje pravděpodobná, leč věcně prázdná tvrzení.

Co ukázal test: Klíčová zjištění v kostce

Než se ponoříme do metodiky a konkrétních právních institutů, shrňme si hlavní výsledky celého měření:

  • Rozsáhlý vzorek z reálné soudní praxe: Test prověřil 170 testovacích případů odvozených z 85 náhodně vybraných sporů řešených Nejvyšším soudem (zejména senátem 21 Cdo) a Ústavním soudem (II. ÚS, Pl. ÚS). Každý spor byl modelován z obou procesních stran — z pohledu argumentace vítězné i poražené.
  • Objektivní hodnocení: Odpovědi systému byly poměřovány vůči nosným důvodům rozhodnutí rozpadlým do dílčích pravidel. Penalizována byla i formulační nepřesnost, záměna kogentního pravidla za možnost či vynechání konkrétního odstavce ustanovení.
  • Fenomén poražené strany: Poražená argumentace dosahovala v základním nastavení nižších výsledků než vítězná (průměrné skóre 0,55 oproti 0,79). V základním nastavení měl systém (skrze použitý jazykový model) tendenci přitakávat neudržitelné pozici klienta. Přesto i v těchto situacích obstál celkově na vysoké úrovni.
  • Zlepšení po aplikaci dedikovaného profilu: Po zapracování zjištění z chybových analýz a nasazení specializované dovednosti (skill), která model navádí ke strukturovanému posouzení břemene tvrzení a důkazního břemene, dosáhla úspěšnost při kontrolním měření v průměru kolem 90 % napříč celým souborem.
  • Testování v režimu „one-shot“: Systém řešil zadání bez možnosti doplňujících otázek. Zadání byla formulována laickým jazykem personalistů, často s vynecháním detailů podstatných pro právníka. V reálném interaktivním (asistovaném) režimu by celková úspěšnost byla vyšší.
  • Spolehlivé zákonné citace a bezpečná judikatura: Odkazy na ustanovení zákoníku práce byly věcně přesné. V oblasti judikatury systém prokázal vysokou přesnost: ne vždy sice vyhledal kompletní výčet všech souvisejících rozhodnutí, nikdy však nenavrhl judikát pro danou věc irelevantní.
  • Radikální úspora času i nákladů: Celý soubor 170 kauz byl vyřešen za přibližně 7 500 Kč, s průměrnou dobou zpracování 8 minut na případ. Lidský právník, při zachování maximální pečlivosti, pakliže by zvládl vypracovat zhruba 5 takových stanovisek denně, by jejich řešením strávil cca 5 týdnů, přičemž mzdové náklady na takový rozsah práce by částku 7 500 Kč zřejmě násobně převýšily.

Metodika testu

Základem testovacího korpusu se stalo 85 soudních sporů: 43 rozhodnutí publikovaných ve Sbírce soudních rozhodnutí a stanovisek nebo zásadních rozhodnutí Nejvyššího soudu a Ústavního soudu, 27 případů tvořil náhodně vybraný vzorek rozhodnutí Nejvyššího soudu pokrývající klíčové instituty zákoníku práce a 15 kauz tvořily nálezy Ústavního soudu. Vzorek pokryl rozvázání pracovního poměru, zkušební doby, odměňování, náhradu škody, pracovní úrazy i konkurenční doložky.

Jak vznikaly testovací případy

Zadání nebyla formulována jako uhlazené právní věty. Otázky vycházely z pohledu typického podnikového uživatele — personálního manažera, mzdové účetní či vedoucího provozu. Dotazy byly psány běžným jazykem, obsahovaly laické obraty a často opomíjely některé klíčové skutkové okolnosti (např. přesný způsob doručení či plné znění ujednání ve smlouvě), které musí právník z klienta obvykle dodatečně zjišťovat. Test tak měřil odolnost vůči realistickému zadání, nikoli vůči ideálně připravenému právnímu dotazu.

Každý z 85 sporů byl do testu nasazen ve dvou variantách:

  1. Vítězná pozice: Dotaz kladl účastník, který měl podle meritorního rozhodnutí pravdu.
  2. Poražená pozice: Dotaz kladl účastník, jehož nárok či obrana u soudu neuspěly. V této roli byla tesotvána odolnost systému vůči pokušení klienta falešně uklidnit, neudržitelnost tvrzení jasně pojmenovat, vysvětlit dogmatické důvody neúspěchu a nabídnout realistická východiska.

Celkem test zahrnoval 170 samostatných běhů, hodnocených v režimu one-shot — systém musel podat stanovisko okamžitě, bez doplňujícího dotazování.

Hodnocení

Každá odpověď byla rozložena na dílčí prvky a testována vůči seznamu pravidel sestavenému z odůvodnění příslušného soudního rozhodnutí (typicky 10 až 20 pravidel na případ: skutková tvrzení, zákonná ustanovení a odkazy na judikaturu). Pokud model zaměnil výpovědní důvod podle § 52 písm. d) za písm. e) zákoníku práce, ztratil body. Pokud namísto jednoznačného závěru soudu použil relativizující formulaci, následovala bodová srážka.

Základní testovací běh přinesl bilanci 99 úspěšných odpovědí (pass), 41 částečně úspěšných (partial) a 30 neúspěšných (fail). Za těmito čísly se skrývá zřetelný rozdíl mezi oběma rolemi:

  • Vítězná argumentace: 62krát uspěl (73 %), 20krát částečně (23 %), 3krát neuspěl (4 %); průměrné skóre 0,79.
  • Poražená argumentace: 37krát uspěl (44 %), 21krát částečně (25 %), 27krát neuspěl (31 %); průměrné skóre 0,55.
  • Celkový průměr: přibližně 0,67.

Bodový propad u testů argumentace poražené strany odhalil slabinu standardního nastavení velkých jazykových modelů, které tvoří základ systému (ale i kteréhokoli jiného legal AI systomu): tendenci k přitakávání klientovi (sycophancy). Zatímco obhájit vítěznou pozici je pro model relativně přirozené, v pozici poraženého model často podlehl sugesci laického dotazu a snažil se neudržitelné stanovisko obhájit. Pro praxi jde o zásadní zjištění: varovat klienta před předem prohraným sporem vyžaduje vyšší metodickou disciplínu než potvrzení výhry. I tak však poražená strana dosáhla průměru 0,55 — chyby spočívaly převážně v absenci striktního odmítnutí, nikoli ve vymýšlení pravidel.

Skok na 90 %: Co dokáže dedikovaný profil uvažování

Chybovost v základním testu nebyla dána neznalostí práva, ale absencí metodického vedení. Profilování ukázalo, že systém nejčastěji ztrácel body vynecháním konkrétních odstavců nebo nedostatečným vyjádřením procesního rámce — zejména rozložení břemene tvrzení a důkazního břemene.

Tyto poznatky byly následně promítnuty do specializované systémové dovednosti (skill). Šlo o zavedení striktních pravidel právního uvažování: povinnost přednostně prověřit procesní podmínky a prekluzivní lhůty, zákaz přitakávat tvrzením odporujícím kogentnímu právu, povinnost výslovně pojmenovat důkazní břemeno a požadavek na citaci zákonných ustanovení na úrovni odstavců a písmen.

Při kontrolním přeměření téhož souboru 170 případů a se shodně přísným hodnotitelem stoupla průměrná přesnost na cca 90 % napříč celým spektrem, včetně poražených pozic. Zlepšení potvrdilo, že pro spolehlivost právní AI není rozhodující hrubý výkon modelu, ale spíše precizně nastavená metodika vyhodnocování. V asistovaném režimu s doplňujícím dialogem by přesnost byla ještě vyšší.

Opora v zákoně, judikatura a věcné tendence

Citace zákoníku práce vykazovaly stoprocentní věcnou relevanci na úrovni paragrafů; bodové ztráty šly na vrub chybějícímu odstavci nebo opomenutí souvisejícího procesního ustanovení (např.§ 135 odst. 2 o. s. ř. o povaze lékařského posudku jako nezávazného odborného dobrozdání).

U judikatury se projevil jev vysoké přesnosti při neúplném výčtu: model citoval rozhodnutí Nejvyššího či Ústavního soudu, která byla k věci přiléhavá a věcně správná. Nikdy se nestalo, že by systém doporučil judikát irelevantní či si spisovou značku vymyslel. Pokud však existovalo více souvisejících rozhodnutí, uvedl zpravidla jedno či dvě. Pro praxi jde o bezpečnější variantu: neúplný výčet lze doplnit, zatímco vymyšlená citace přímo ohrožuje správnost posouzení a věrohodnost závěru.

Rozbor podle institutů ukázal zřetelné tendence:

  • Silné oblasti: Okamžité zrušení pracovního poměru pro nevyplacení mzdy (§ 56 ZP s patnáctidenní lhůtou po uplynutí období splatnosti), odpovědnost zaměstnance za škodu z nedbalosti (§ 250 a § 257 ZP s limitem čtyřapůlnásobku průměrného měsíčního výdělku, s výjimkami stanovenými zákonem), organizační změny a nadbytečnost (§ 52 písm. c) ZP) a přiměřenost smluvních pokut u konkurenčních doložek (§ 310 ZP). Zde systém dosahoval takřka stoprocentní úspěšnosti.
  • Slabší oblasti vyžadující kontrolu: Prekluzivní lhůty k žalobě na neplatnost rozvázání pracovního poměru (§ 72 ZP), zkušební doba a podmínky pro vedoucí zaměstnance (§ 35 ZP), posuzování liberace zaměstnavatele při pracovních úrazech a vyčíslení náhrady nemajetkové újmy. Zde se častěji objevovala opomenutí procesních detailů.

Ekonomika testu a srovnání s lidskou prací

Zpracování kompletního souboru 170 testovacích kauz představovalo přímé finanční náklady na strojový čas přibližně 7 500 Kč při průměrné době 8 minut na jeden případ.

Postavme tato čísla proti reálnému výkonu kvalifikovaného právníka. Pečlivé zpracování jednoho případu — zahrnující prostudování skutkového stavu, dohledání ustanovení, rešerši judikatury a sepsání uceleného stanoviska — zabere minimálně 1,5 až 2 hodiny čistého času.

Zkušený právník zvládne v plné soustředěnosti vyřešit zhruba 5 takových kauz za pracovní den, pokud by nedělal nic jiného. Zpracování 170 případů by pro jednoho člověka představovalo 34 celých pracovních dnů, tedy cca 5 týdnů. Udržet po tuto dobu stabilní 90% kvalitu napříč desítkami různých institutů a při důsledném zkoumání obou procesních stran je pro lidského řešitele na hranici možností. Mzdové náklady za 34 dnů kvalifikované práce by přitom částku 7 500 Kč zřejmě mnohonásobně převýšily.

Doporučení pro praxi: Spolehlivý navigátor pro každodenní provoz

Výsledky testu dávají jasnou odpověď na otázku, jak mohou moderní systémy bezpečně a efektivně sloužit v podnikové praxi.

Pro personální manažery, HR specialisty a mzdové účetní představuje správně nastavený systém, jako je Codexis AI, neocenitelný nástroj orientace v každodenní agendě — ať již jde o posouzení okamžitého zrušení poměru pro absenci, návrat z rodičovské dovolené či nastavení dohody o narovnání. Poskytuje okamžitou a spolehlivou navigaci, šetří čas a pomáhá formulovat správné otázky pro právní posouzení.

Pro advokáty a podnikové právníky funguje jako rychlý oponent pro triáž složitého případu, získání nezávislého druhého názoru i zátěžový test navržené strategie z pohledu protistrany.

Závěrečné pravidlo pro bezpečnou praxi zůstává jednoznačné: První koncept je strojově levný a rychlý, finální odpovědnost za rozhodnutí a právní podpis však musí vždy zůstat na člověku. Zvláště v citlivých oblastech běhu propadných lhůt, komplikovaných výpovědí a pracovních úrazů zůstává lidský odborný úsudek nenahraditelnou zárukou.

Sdílet článek
Anag novinky 2026
X

Další články

Články

Transparentní odměňování: Systém odměňování a benefitů

Transparentní odměňování: Systém odměňování a benefitů
Články

Svoboda projevu soudců na sociálních sítích: Danileţ proti Rumunsku

Svoboda projevu soudců na sociálních sítích: Danileţ proti Rumunsku
Články

Smlouva, kterou nechtěla ani jedna strana: Když za smluvní strany vyjednávají dva AI agenti

Smlouva, kterou nechtěla ani jedna strana: Když za smluvní strany vyjednávají dva AI agenti
Články

Meze povinnosti loajality společníka a obecná prevenční povinnost v kontextu společnické žaloby

Meze povinnosti loajality společníka a obecná prevenční povinnost v kontextu společnické žaloby
Články

Srážka se zvěří není výjimečná. Na co si dát pozor a jak postupovat po nehodě

Srážka se zvěří není výjimečná. Na co si dát pozor a jak postupovat po nehodě
Webinar VZMR