Když si hledání ve vlastních poznámkách začne lhát
Nula neznamená, že tvar v přepisech není. A když číslo najednou vyroste, může to být tím, že jste našli sami sebe.
4 minuty čtení
Když člověk léta prochází staré matriční zápisy a poctivě si zaznamenává každou zmínku, postupně mu pod rukama vyroste rozsáhlá sbírka textů. V našem případě se archiv rozrostl na 431 souborů s přepisy. V takovém množství už lidská paměť nestačí. Přijde chvíle, kdy chceme vědět něco konkrétního: jak často se v textech objevuje určitý tvar křestního jména, kde se poprvé vyskytl nebo zda se vůbec dochoval. Otevřeme tedy složku a zadáme hledané slovo. Během vteřiny se objeví výsledek. Počítač nám ukáže číslo a my máme přirozený sklon ho považovat za hotovou odpověď. Jenže právě v tu chvíli si vyhledávání začíná vymýšlet. Naše vlastní zkušenost ukázala, že výsledek hledání ve vlastních poznámkách se dá zkreslit třemi způsoby, a ani jeden z nich není na první pohled vidět. Vyhledávání totiž vždycky něco vrátí a tváří se, že podává přesnou zprávu.
Tři omyly při procházení našich zápisů
První potíž nastala ve chvíli, kdy si běžné vyhledávání neporadilo s českými tvary. Hledali jsme tvar křestního jména Tomeš. Výsledek byl jednoznačný: nula výskytů. Působilo to jako jasný doklad, že se tento tvar v našich zápisech nenachází. Ve skutečnosti tam ale byly dva výskyty. Hledaný tvar v přepisech existoval, jen ho vyhledávání nedokázalo zachytit. Druhý omyl byl přesně opačný. Vyhledávání bez určení přesné hranice slova započítalo i to, co do výsledku vůbec nepatřilo. Hledali jsme tvar Kuba, ale výsledek se nafoukl o výskyty, kde byl tento řetězec součástí delšího tvaru Kubásek. Získali jsme číslo, které bylo mnohem vyšší než skutečný počet hledaného tvaru. Tyto dvě chyby jdou přímo proti sobě. Jedna výskyty maže, druhá je uměle přidává. Z pouhého čísla na obrazovce to nelze poznat, protože obě hodnoty vypadají na první pohled zcela věrohodně. Třetí a nejnebezpečnější chyba přišla ve chvíli, kdy jsme si nevědomky znečistili prohledávaný vzorek vlastními zápisky. U tvaru Káčou nám počet při dalším měření náhle vyskočil z jednoho výskytu na čtyři. V samotných přepisech se přitom nezměnilo vůbec nic. Do stejné složky s přepisy jsme si totiž začali ukládat své pracovní mezivýsledky. Vyhledávání pak nenašlo jen původní záznam, ale i naše vlastní poznámky o tom, co jsme našli minule. Číslo rostlo, což podvědomě působí jako lepší a bohatší výsledek, ale ve skutečnosti šlo o čistý sebeklam. Měřili jsme znovu a mimo původní složku.
Proč hledání klame bez varování
Základní past vyhledávání spočívá v tom, že nám nikdy neřekne, jak k číslu došlo. Počítač neupozorní na to, že nerozeznal český tvar nebo že započítal i poznámky z vedlejšího listu. Předloží výsledek a nechá nás v domnění, že máme v rukou fakta. Nula na obrazovce neznamená „není tam". Velmi často znamená pouze „neuměl jsem to najít". Stejně tak vysoké číslo neznamená „je toho hodně" - mohlo jít o shodu uvnitř jiných tvarů nebo o započítání našich vlastních pracovních textů. Rostoucí číslo je obzvlášť zrádné. Když vidíme, že nálezů přibývá, máme tendenci mít z výsledku dobrý pocit. Přitom může jít jen o to, že jsme si v archivu vytvořili ozvěnu vlastních starších zápisků.
Zásady pro práci s vlastními přepisy
Z vlastních chyb jsme si vyvodili pravidla, kterými se dnes při práci s přepisy řídíme: Výsledky a poznámky držíme důsledně mimo hledanou složku. Cokoliv, co sami napíšeme o svých nálezech - výpisky, souhrny, pracovní mezivýsledky -, musí ležet v úplně jiné složce než samotné přepisy matrik. Jakmile se pracovní poznámky ocitnou mezi přepisy, začneme dříve či později prohledávat sami sebe a uměle si navyšovat počty. Když číslo překvapí, ověřujeme ho jinou cestou. Pokud u tvaru vyjde nula, ale víme, že jsme jej kdysi v pramenech viděli na vlastní oči, není to důvod vymazat vzpomínku. Je to důvod k podezření, že vyhledávání selhalo. Stejně podezřelý je i jakýkoliv náhlý skok v počtu nálezů směrem nahoru. Nulu píšeme do závěrů jinak. Do rodinné kroniky nebo textu o bádání nepatří tvrzení „tento tvar u nás není", pokud se opírá pouze o mechanické hledání v souborech. Poctivější a přesnější je zapsat „tímto způsobem hledání jsem daný tvar nenašel". To druhé je doložitelná pravda o provedeném pokusu, to první je silné tvrzení, které nemáme jak dokázat. Pokud mají na zjištěných počtech stát důležité závěry o rodu, článek nebo celá rodinná kniha, je lepší číselné údaje neuvádět vůbec, než pracovat s čísly ze zúženého nebo neprověřeného měření. Genealogie stojí na doložených skutečnostech, a pokud si nejsme jistí čistotou vyhledávání, je věcný popis bezpečnější než nepřesná statistika.