Kontrola logiky a chyby, které mozek přehlédl
Zjistili jsme, jak spolehlivě dokáže jazykový model odhalit logické omyly a nesmyslná data ve vašem hotovém rodokmenu. Přečtěte si přesné výsledky našeho měření a naučte se, jak stroj zaúkolovat, abyste dostali užitečnou nápovědu pro další kontrolu matrik.
9 minut čtení
Oči nevidí to, co mozek už dávno zná
Představte si tu situaci: váš rodokmen je hotový. Všechny dostupné matriky jste pročetli, záznamy o narození, sňatcích i úmrtích máte pečlivě přepsané. Chcete svou práci uložit, vytisknout nebo sdílet s rodinou. Jenže po letech usilovného bádání a zapisování se snadno stane, že vaše vlastní oči už nevidí zjevné překlepy.
Mozek badatele zkrátka ví, co by na papíře mělo být, a tak číslo 1834 klidně přečte správně i tehdy, když je v počítači omylem napsáno 1843. Prsty na klávesnici snadno uklouznou. Tyto logické nesmysly - jako že se matka narodila až po svém vlastním dítěti - se v rozsáhlých tabulkách plných jmen hledají jen velmi těžko.
Nabízí se využít moderní nástroje, takzvané jazykové modely. Ty dokážou přečíst spoustu textu a zhodnotit jej. Ale lze jim při tak křehké práci věřit? Co opravdu v datech najdou a kde si naopak začnou vymýšlet? Náš web se neopírá o cizí sliby, ale o vlastní měření. Proto jsme sestavili testovací data a zjišťovali jsme, jak si stroj s takovou kontrolou poradí.
Jak jsme postupovali při měření
Abychom získali spolehlivé výsledky, vyrobili jsme zcela vymyšlený rodokmen, který se odehrával v devatenáctém století. Zahrnoval celkem 60 osob, 5 rodin a 4 generace. Do těchto čistých dat jsme naprosto úmyslně vložili 10 chyb. Šest z nich jsou věci, které se stát nemohly: dítě narozené po smrti matky, úmrtí zapsané před narozením, otec mladší než jeho vlastní dítě, sňatek uzavřený po smrti manžela, dítě narozené čtrnáct měsíců po smrti otce a dva porody téže matky čtyři a půl měsíce po sobě. U zbylých čtyř jsme si museli stanovit pevnou hranici, protože ostrá čára tam nevede: porod matky mladší třinácti let, porod matky starší dvaapadesáti let, sňatek před čtrnáctými narozeninami a dožití přes sto pět let. Žádná z těch čtyř věcí není nemožná. Říkáme to hned tady, protože na tom závisí, jak se máte na výsledky dívat.
Abychom zkusili nástroj nachytat, přidali jsme navíc 6 takzvaných návnad. Návnada je údaj, který je sice na první pohled velmi neobvyklý, ale je pravdivý a v matrikách se s ním skutečně můžeme občas setkat. Chtěli jsme totiž vědět, zda model v horlivosti označí pravdu za chybu. Správnost tohoto našeho klíče jsme pro jistotu předem ověřili přesným počítačovým skriptem.
Poté jsme celý vymyšlený rodokmen předali jazykovému modelu (použili jsme model Gemini). Ptali jsme se ho dvěma různými způsoby a každý pokus jsme provedli třikrát po sobě. Zajímalo nás, zda odpoví pokaždé stejně.
První způsob byl zcela obyčejný dotaz. Zkrátka jsme mu data předložili a zeptali se: Mohl bys to zkontrolovat, jestli tam nejsou chyby nebo nesmysly?
Druhý způsob dotazování byl mnohem pečlivější. Dali jsme stroji přesný seznam toho, co má v datech kontrolovat. Tento seznam obsahoval jasné body: věk matky a otce při porodu, narození dítěte po smrti rodiče, úmrtí člověka ještě před jeho vlastním narozením, věk manželů při sňatku, časový rozestup mezi sourozenci a konečně celkový věk při úmrtí. Zároveň jsme do zadání přidali mimořádně důležitý pokyn: u každého nálezu roztřiď, zda jde o jistou chybu, nebo jen o neobvyklou situaci.
Výsledky měření: zjevné nesmysly našel pokaždé
Zde jsou konkrétní výsledky, které náš pokus přinesl. Zkoumali jsme, kolik chyb z deseti vložených model odhalí, a kolik pravdivých návnad ze šesti naopak nespravedlivě označí za nesmysl.
| Způsob zadání dotazu | Nalezené chyby (z 10) | Návnady označené jako chyba (z 6) |
|---|---|---|
| Obyčejný dotaz, tři běhy | 9 · 10 · 10 | 0 · 0 · 0 |
| Se seznamem kontrol, tři běhy | 10 · 10 · 10 | 0 · 0 · 0 |
Jak z naší tabulky vidíte, nástroj si vedl opravdu dobře. Osm z deseti druhů chyb našel model naprosto pokaždé, v každém z pokusů.
Nástroj bez potíží vždy odhalil úmrtí člověka před jeho narozením, otce, který byl podle dat mladší než jeho vlastní dítě, nebo dítě narozené až po smrti své matky. Stejně tak bezchybně našel dítě narozené čtrnáct měsíců po smrti otce, sňatek, který se odehrál po smrti ženicha, a situaci, kdy měla tatáž matka dva porody pouhého čtyři a půl měsíce po sobě. Výborně upozornil i na extrémně nízký věk - nenechal bez povšimnutí matku, která měla rodit v necelých dvanácti letech, ani ženicha, kterému bylo při svatbě také pouhých dvanáct let.
U těch dvou posledních buďte opatrní i vy. Matce bylo v našich datech necelých dvanáct let a ženichovi necelých třináct. Vložili jsme je mezi chyby, protože jsme si stanovili hranici, ale vyloučené takové údaje nejsou. Jak často se v matrikách opravdu vyskytují, jsme nezjišťovali. Ve vašem rodokmenu je proto takový zápis otázka pro matriku, ne rozsudek.
Kde si nástroj už není tak jistý
Zcela jiná situace ale nastala u hraničních případů. Tedy u údajů, které sice nejsou biologicky vyloučené, ale jsou vysoce nepravděpodobné. Tady už jazykový model váhal a jeho odpovědi začaly znatelně kolísat.
Velmi zajímavým případem byla matka rodící v padesáti čtyřech letech. Ačkoliv jsme se modelu ptali zcela stejným dotazem a nad naprosto stejnými daty, v jednom běhu tuto situaci označil za jistou chybu a při dalším spuštění ji hodnotil mnohem mírněji, jen jako věc neobvyklou.
Podobně stroj kolísal u ženy, která se podle našich dat dožila úctyhodných sto šesti let. V jednom z běhů tuto mimořádnou informaci dokonce vůbec nezmínil a přešel ji zcela bez povšimnutí.
Naopak velmi dobré zprávy přineslo měření návnad. Za šest celkových pokusů měl nástroj celkem třicet šest příležitostí označit nějakou pravdivou, ač nezvyklou věc omylem za chybu. Neudělal to však ani v jednom jediném případě. Například ženu rodící ve čtyřiceti šesti letech označil velmi rozumně - prohlásil o ní, že jde o věc neobvyklou, která stojí za ověření. To je přesně ten typ rady, který badatel ke své práci potřebuje. Není to odsouzení správných dat, ale výzva k vyšší pozornosti.
Proč se tolik vyplatí seznam úkolů
Možná se nyní ptáte, proč vlastně stroji psát složitější dotaz se seznamem úkolů, když i ten nejobyčejnější jednoduchý dotaz našel ve většině případů všechny hrubé chyby.
Důvod se ukázal záhy. Přesný seznam totiž pomohl hlavně v tom, co vám model ke svému výsledku ochotně vysvětlí. Když dostal konkrétní soupis toho, co má hledat a co má třídit, dokázal nám vyjmenovat i ty věci, které z logiky věci vůbec chybou nejsou.
Správně tak vyjmenoval například dvojčata. Upozornil na dítě, které bylo pojmenované po dříve zemřelém sourozenci, což je pro rodopisce častá past. Všiml si také rychlého druhého sňatku vdovy nebo otce, kterému bylo při narození dalšího potomka šedesát čtyři let. U obyčejného, stručného dotazu o těchto rodinných zajímavostech model úplně mlčel. Seznam úkolů tedy z modelu dostane víc vysvětlení.
Pozor na bystrý postřeh a nevyžádaná moudra
Během měření jsme narazili na dvě zajímavá překvapení. Tím prvním bylo, že si model všiml neúplnosti v datech, kterou jsme tam úmyslně vůbec nevložili. Chyběl nám záznam o sňatku určitých osob a nástroj na to zcela správně upozornil. Záznam v datech prokazatelně chyběl.
Druhé překvapení ale ukázalo velkou slabinu těchto systémů. Některé z odpovědí totiž zničehonic přidaly velmi sebevědomé právní tvrzení. Model nás začal z vlastní iniciativy poučovat o minimálním věku pro sňatek podle tehdejšího občanského zákoníku z roku 1811. Tento historický fakt jsme my nijak neověřovali a model jsme o něj nežádali. Přesně takové takzvané "fakty navíc" jsou kritickým místem, kde si jazykové modely podle naší zkušenosti vymýšlejí nejčastěji.
Hlavní doporučení pro vaši práci
Na základě naměřených výsledků jsme pro vás sestavili jasná pravidla, jak si kontrolu rodokmenu ulehčit a přitom nenaletět na nesmysly:
- Model je dobrý na "nemožné", ale nejistý na "nepravděpodobné". Na zevrubnou kontrolu zjevných překlepů a posunů v datech se hodí velmi dobře.
- Pozor na krajní hodnoty. Náš klíč měl u krajních věků pevnou hranici, jenže model ji neznal: v zadání žádná čísla nebyla a kde leží mez mezi chybou a neobvyklostí, si volil sám. Když vám tedy nástroj označí pozdní mateřství nebo vysoký věk při úmrtí, neznamená to, že je to ve vašem rodokmenu chyba. Znamená to, že se na ten zápis musíte podívat do matriky.
- U hraničních věcí se nespoléhejte na jednu odpověď. Zkuste se stroje zeptat znovu, nebo položte svou otázku jinými slovy. Když se jeho odpovědi liší, je to pro vás signál přestat se ptát počítače a jít hledat zpět do matriky.
- Dávejte mu jasný seznam, co má kontrolovat. Chtějte po něm výslovně, aby rozlišil jistou chybu od věci pouze neobvyklé. Pak vám ve výsledku poví i o tom, co chybou není, ale stojí za povšimnutí.
- Každý nález je otázka, ne konečný verdikt. Platí pravidlo návratu k prameni. Model má za úkol pouze najít podezřelé místo. Kde leží pravda, to vám řekne jedině matrika. Do vašeho rodokmenu se jakákoliv změna zapisuje vždy až podle původního pramene.
- Nevyžádaná fakta ignorujte. Pokud vám nástroj nabídne zákony, statistiky úmrtnosti nebo dobové zvyklosti, které jste nechtěli, vždy je berte jako neověřené, dokud je sami nenajdete v odborné literatuře.
Co jsme neměřili (a je nutné na to pamatovat)
Abychom byli poctiví, musíme na závěr uvést, jaké měly naše testy hranice a co přesně do nich už nespadalo.
- Všechna měření proběhla na jednom jediném modelu, a to v jeden konkrétní den.
- Neověřovali jsme, jestli jsou krajní věky v našem klíči historicky nemožné. Stanovili jsme si hranice, abychom měli co měřit, a měřili jsme shodu modelu s nimi. Kolik takových případů matriky skutečně obsahují, jsme nezjišťovali.
- Měli jsme k dispozici absolutně čistá data. Skutečný rodokmen je plný přibližných letopočtů ("kolem roku 1830"), chybějících údajů a případně zdvojených osob. Jak by si nástroj poradil s těmito komplikacemi, to jsme neměřili.
- Náš vzorek obsahoval šedesát osob. U rozsáhlého rodokmenu o stovkách osob může model kvůli ohromnému množství textu některé souvislosti zkrátka přehlédnout.
- Tři opakování našeho testu stačí k tomu, abychom ukázali, že model v odpovědích kolísá. V žádném případě to ale nestačí na počítání přesných procent. Proto neříkáme, že model odhalí něco v devadesáti pěti procentech případů. Berte naše výsledky jen jako ukázku toho, jak se nástroje chovají.