Když index mlčí: jak se ptát na varianty příjmení
Jazykový model vám může pomoci najít německé a staré podoby příjmení, která v matrice nemůžete dohledat. Ukážeme, jak se zeptat, aby vám nenabídl cizí rod jako variantu - a proč ani pak nevěřit všemu, co přidá.
8 minut čtení
Začínáme hledat a index mlčí
Představte si velmi obvyklou situaci snad každého badatele, který pátrá po svých předcích. Otevřete si starou matriku, najdete si na jejím konci či začátku abecední index a s nadějí hledáte jméno svého předka. Pečlivě projíždíte prstem řádek po řádku, hledáte rodinu, o které z jiných záznamů naprosto spolehlivě víte, že v dané vsi žila. Ale ať se díváte jakkoliv pozorně, hledané příjmení ve jmenném seznamu zkrátka chybí. Co můžete v takové chvíli dělat?
Příjmení se v dřívějších dobách nepsala podle nějakých jednotných a pevných pravidel, na která jsme zvyklí dnes. Vše záleželo na tom, jak konkrétní farář jméno slyšel a jaký měl svůj osobní zvyk ho zapisovat. Velmi často záleželo i na tom, jestli zrovna používal spíše český, nebo naopak německý pravopis. Pro dnešního čtenáře je velmi těžké si z hlavy vymyslet a představit všechny možné podoby, pod kterými by se hledané jméno mohlo v seznamu skrývat.
Když totiž listujete starou knihou, nemůžete vyhledávat tak snadno jako na moderním počítači. Jste plně odkázáni na abecední pořadí, které někdo před lety sestavil. Pokud farář zapsal původně české příjmení s typicky německým pravopisem, posune se takové jméno v abecedě mnohdy o několik stran jinam.
Dnešní moderní doba nabízí jednoho velkého pomocníka: můžeme se zkusit zeptat jazykového modelu. Může nám ale takový počítačový program opravdu pomoci najít ty správné podoby příjmení? Rozhodli jsme se to pečlivě změřit. Naše texty a rady totiž píšeme výhradně z vlastního měření, nikoliv ze slibů, které dávají tvůrci těchto modelů.
Co jsme zjišťovali a jaký byl náš zdroj
Srovnávacím seznamem pro naše měření byly naše vlastní přepisy matrik z východních Čech. Tyto matriky pocházejí z 18. a 19. století. Vybrali jsme z nich čtyři konkrétní příjmení, která pocházejí z našeho vlastního rodinného bádání: Mareš, Linger, Šejbal a Švehla.
U každého z těchto čtyř příjmení víme, v jakých podobách se v našich přepisech doloženě vyskytuje - ne ve všech, které existují, ale v těch, které jsme sami našli. Stanovili jsme proto sedm konkrétních podob, o kterých jsme chtěli zjistit, zda je model ve své odpovědi dokáže najít. Jde o tyto tvary: Marešová, Lingrová, Lingerová, Lingra, Schejbal, Švehlová a Schwehla.
Při hledání čeká na badatele v matrikách také jedna velmi nepříjemná past. V Holicích žil vedle rodiny Marešů samostatný rod Marek. V našich přepisech se jméno Marek objevuje dvaadvacetkrát a ani jednou nejde o Mareše. Kdo by v matrice hledal Marka v domnění, že je to jen jiný zápis jména Mareš, spojil by dvě cizí rodiny. Chtěli jsme proto vyzkoušet, jak si s touto pastí model poradí.
Dva různé dotazy pro počítač
Zvolili jsme model Gemini. Vše proběhlo v jednom jediném dni na jednom stejném modelu. Kladli jsme mu dva naprosto odlišné dotazy. Každé ze čtyř zmíněných příjmení a každý z obou dotazů jsme vyzkoušeli třikrát po sobě. To znamená, že jsme získali výsledky z celkem čtyřiadvaceti pokusů.
Nejprve jsme zkusili takzvaný obyčejný dotaz, který by asi napadl většinu lidí: „Hledám v matrikách z 18. a 19. století (Čechy) předky s příjmením Mareš. V indexu jsem je nenašel. Pod jakými jinými podobami zápisu mám to příjmení hledat?"
Poté jsme vyzkoušeli dotaz s pravidly. Můžete si ho opsat, jen místo příjmení Mareš doplníte to svoje. Zní přesně takto, jak jsme ho měřili:
Hledám v matrikách z 18. a 19. století (Čechy) předky s příjmením Mareš. V indexu jsem je nenašel. Vypiš, pod jakými podobami zápisu je mám hledat.
Rozděl je do dvou skupin:
A) zápisy TÉHOŽ příjmení (český, německý a latinský pravopis, ženský tvar, pády, jak to psali faráři),
B) podobná příjmení, která ale mohou patřit JINÉMU rodu - na ta pozor, za varianty je nepovažuj.
U každého tvaru napiš jednou větou, proč tam patří. Nic nevymýšlej: když si nejsi jistý, napiš to.
Německý a starý pravopis navrhuje ochotně
První zjištění z našeho testování je velmi dobré. Německý a starý pravopis model navrhuje opravdu ochotně a velice užitečně. Například německý tvar „Schwehla" (jakožto zápis pro české jméno Švehla) navrhl v šesti pokusech ze šesti. U rodu Linger nabídl ženské tvary Lingrová a Lingerová také v šesti pokusech ze šesti. U ostatních rodů ženský tvar tak spolehlivě nezmínil: Marešovou ve dvou pokusech ze šesti, Švehlovou v jednom. Tvar „Lingra" nabídl ve třech pokusech ze šesti.
Pokud ale šlo o naprosto přesný doložený tvar z našich přepisů, ten trefil jen někdy. Přesnou doloženou podobu „Schejbal" (místo českého jména Šejbal) nám nabídl jen ve třech případech ze šesti. Zato nám ale úplně pokaždé nabídl spoustu tvarů, které byly velice blízké. V jedné jeho odpovědi jsme například dostali kolem třiceti podob jména, mezi nimiž byly varianty jako Scheybal, Scheibal, Schaybal a další.
Znamená to tedy důležitou věc: správný vzor (tedy v tomto případě použití písmen „Sch" místo českého písmene „Š") trefil model vždycky. Přesnou podobu trefil v našem měření napůl. Pro práci se starým indexem je i takový obecný seznam užitečným vodítkem: víte, že máte hledat nejen pod písmenem Š, ale i pod S.
Past jménem Marek z Holic
Zajímavé a velmi poučné srovnání nám přinesla naše past v Holicích s rodinami Mareš a Marek. Na obyčejný dotaz nám model ve třech pokusech ze tří zcela jasně poradil hledat jméno Marek jako tutéž osobu. V jedné odpovědi to zdůvodnil tím, že farář často zapsal člověka základním jménem namísto lidového tvaru Mareš. Ve všech třech navíc nabídl i Marečka a Maršíka.
Na náš druhý dotaz, tedy na dotaz s pravidly, model ve třech ze tří pokusů zařadil příjmení Marek správně do skupiny B, tedy mezi jiné rody. Přidal k tomu poznámku, že v 18. a 19. století jde již o samostatný rod. Dvakrát tam zařadil i Marečka - jestli je to u Marečků správně, z našich přepisů nevíme.
Tentýž model u téhož příjmení tedy podal odpověď, která se obrátila podle toho, jak jsme se zeptali. Naše přepisy holických matrik dávají za pravdu té druhé. Kdo by uvěřil první odpovědi, spojil by si dvě cizí rodiny.
Pozor na přidávání nevyžádaných faktů
Během hodnocení odpovědí jsme zjistili také to, že model občas přidává nejrůznější fakta navíc, o která nikdo vůbec nežádal. V jedné odpovědi na obyčejný dotaz se tak například objevilo tvrzení, že souhrnné indexy k matrikám mají chybovost 10-20 procent. Přidal k tomu i informaci, že stálost příjmení v našich zemích uzákonil patent Josefa II. v roce 1787. Jindy zase jedna z odpovědí na dotaz s pravidly vysvětlovala původ jména Maras slovem mara, což má podle ní znamenat přelud - a to přesto, že dotaz výslovně říkal „nic nevymýšlej". Pravidla tedy pomohla oddělit cizí rod, vymýšlení faktů ale nezastavila.
Zde platí přísné pravidlo. Nic z těchto dodatečných tvrzení jsme my při naší práci neověřili. A co nemáme ověřené z našich zdrojů, to do našeho článku jako fakt prostě nesmí, a tak byste k tomu měli přistupovat i vy.
Model také během naší práce navrhl desítky dalších podob příjmení, které v našem srovnávacím seznamu z matrik vůbec nemáme. Tím ovšem nejsou tyto tvary nijak vyvrácené. Náš srovnávací seznam totiž není a nemůže být úplný pro všechny matriky. My v tuto chvíli pouze nevíme, jestli se tyto konkrétní tvary v matrikách opravdu někde objevují.
Co si z toho vzít
Z našeho podrobného měření si můžete pro vaše budoucí pátrání ve starých archivech a seznamech odnést několik základních zásad:
- Model je dobrý pomocník na seznam, kde ještě hledat. Ochotně vám navrhne hlavně staré a německé zápisy (například použití písmen Sch-, nebo ženské koncovky -in a -owa), na které by člověk sám bez zkušeností vůbec nepomyslel. Získáte tak užitečný seznam míst k prohlédnutí.
- Seznam od modelu je seznam míst k prohlédnutí, ne důkaz, že jde o téhož člověka. Jestli je v knize zapsaný „Marek" skutečně váš hledaný předek Mareš, to vám s jistotou řekne jen zápis v matrice sám. Vždy musíte hledat shodu u jmen rodičů, u čísla domu nebo u křestního jména manželky. Samotná podobnost jména nikdy nestačí.
- Chtějte po modelu rozlišit varianty od jiných rodů. Používejte vždy náš připravený dotaz s pravidly, který najdete výše v textu. Jinak vám počítač velmi snadno jiný rod nabídne jako běžnou variantu hledaného příjmení.
- Čísla a zákony, které model přidá sám, berte jako neověřené. Dokud si je nenajdete a nepotvrdíte někde jinde v odborné literatuře, nespoléhejte na ně.
Co jsme neměřili
Na úplný závěr našeho shrnutí ještě uvádíme, jaké byly pevné hranice celého našeho měření:
- Neměřili jsme, kolik z navržených podob je celkově správně. Zaměřili jsme se pouze a výhradně na to, jestli model najde ty podoby, které z našeho bádání bezpečně známe, a jak zvládne překonat naši jednu past.
- Celé měření se týkalo jen čtyř příjmení jedné rodiny a past s jiným rodem jsme měli jen u jednoho z nich.
- Všechny zkušební dotazy zpracovával pouze jeden model, v jeden jediný den a pro každý typ jsme dělali pouze tři pokusy. Výsledek tedy spíše ukazuje kolísání odpovědí v danou chvíli než nějaká přesná celková procenta.
- Neověřovali jsme ani to, jestli model celkově radí dobře v tom, kde a ve kterých archivech nebo knihách máte vůbec pátrat.