Přeskočit na obsah
Naše paměť

Model u sebe doma

Jak spustit jazykový model ve vlastním počítači, kdy to má pro badatele smysl a na co si dát pozor při ochraně soukromých dat.

8 minut čtení

Kdy má smysl nechat data doma

Badatel v rodinné historii často pracuje s materiály dostupnými v oblastních archivech. Jde například o digitalizované matriky narozených, oddaných a zemřelých ze starších století, pozemkové knihy nebo sčítací operáty.

U každého snímku a dokumentu je však potřeba pečlivě zvážit obsah a stáří zápisu, pravidla archivu i podmínky využívané služby. Ani u starších archiválií nelze odesílání dat do internetových nástrojů brát jako samozřejmost.

Zcela jiná situace nastává ve chvíli, kdy pracujete s novodobými rodinnými materiály. V pozůstalostech se běžně nacházejí deníky prarodičů, soukromá korespondence, rodinné kroniky nebo fotografie z nedávné doby. Tyto prameny často obsahují osobní údaje o žijících příbuzných, citlivé rodinné události a důvěrné informace.

Pokud chcete s pomocí moderních technologií přepsat rukopisný deník nebo uspořádat zápisy o žijících osobách, vyvstává otázka bezpečnosti a ochrany soukromí. Podrobné zásady pro práci s těmito materiály popisuje článek Co zveřejnit a co si nechat.

Při odesílání textů a obrázků do vzdálených nástrojů je nutné mít na paměti, že se pravidla ukládání a využití dat služba od služby liší a je nutné si je předem ověřit. Někteří provozovatelé mohou zadaná data uchovávat nebo je využívat k dalšímu rozvoji svých systémů, zatímco jiné služby nabízejí odlišný režim zpracování.

V takovém okamžiku přichází ke slovu třetí stupeň, který jsme popsali v rozcestníku Až přerostete obyčejný chat. Tímto stupněm je spuštění jazykového modelu přímo ve vašem počítači.

Místní provoz představuje způsob, jak zpracovávat texty bez jejich odesílání poskytovateli. Skutečné soukromí je však podmíněné. Platí pouze tehdy, když použijete model stažený do svého počítače, nepropojujete jej s cloudovými doplňky a máte zkontrolované nastavení celého programu.

Co je místní model a jak funguje Ollama

Místní provoz umělé inteligence se skládá ze dvou základních částí. První částí je obslužný program, který se stará o technický běh a komunikaci s hardwarem. Druhou částí je samotný model, což je datový soubor obsahující naučené jazykové vzorce a schopnosti.

Oba tyto prvky si stáhnete do svého zařízení a nainstalujete podobně jako jakýkoli jiný software. Model pak nefunguje jako vzdálená webová stránka, ale jako samostatný soubor uložený na vašem disku.

Jedním z nástrojů pro tento účel je program Ollama. Jde o projekt s otevřeným zdrojovým kódem, který funguje na operačních systémech Windows, macOS i Linux. Instalační balíček najdete na oficiálních webových stránkách ollama.com.

Samotná aplikace funguje jako správce a spouštěč. Po její instalaci si vyberete konkrétní model a necháte jej stáhnout do svého zařízení. Místní modely jsou k dispozici zdarma a program má otevřený zdrojový kód. Aplikace se postará o to, aby model využil výpočetní prostředky vašeho počítače a odpověděl na vaše dotazy.

Celé prostředí můžete ovládat přes příkazový řádek nebo pomocí grafických nadstaveb, které se k obslužnému programu připojují. Pro badatele to znamená získání pracovního prostředí velmi podobného běžnému internetovému chatu.

Zásadní rozdíl spočívá v tom, že veškeré výpočty probíhají přímo ve vašem zařízení a zadané texty se nikam neodesílají.

Past v podobě modelů s označením cloud

Při používání programu Ollama existuje jedno zásadní úskalí, které je nutné mít na paměti. V nabídce dostupných modelů se totiž objevují také položky, které mají u svého názvu označení cloud.

Tyto modely neběží ve vašem počítači, ale na cizích serverech. Pokud zvolíte model s tímto označením, program funguje pouze jako prostředník a vaše data odešle přes internet pryč.

Tím byste ztratili hlavní výhodu, kvůli které jste si místní prostředí pořizovali. Zápisy o žijících příbuzných, osobní dopisy nebo rodinné kroniky by v takovém případě opět putovaly na cizí servery.

Data zůstanou bezpečně u vás jen tehdy, když spustíte model stažený do počítače, bez cloudových doplňků a se zkontrolovaným nastavením programu. Před zahájením práce si proto vždy ověřte, jaký model máte aktuálně spuštěný a zda leží na vašem lokálním disku.

Užitečnou kontrolou místního běhu je dočasné odpojení počítače od sítě. Pokud model i po vypnutí sítě normálně odpovídá a zpracovává vaše texty, ověříte si, že samotný výpočet probíhá lokálně.

Odpojení od sítě však nelze brát jako důkaz úplného soukromí. Po opětovném připojení nebo přes jinou součást programu se data odeslat mohou. Je proto nutné pečlivě sledovat chování a nastavení celého pracovního prostředí.

Co takový model zvládne a co ne

Schopnosti jednotlivých modelů se velmi výrazně liší podle jejich architektury a velikosti. Před zahájením práce je proto nutné znát jejich možnosti i praktická omezení.

Důležitou věcí, která v praxi často rozhoduje, je schopnost práce s obrazem. Ne každý model umí číst obrázky. Kdo chce nechat model luštit skeny archiválií, starých rukopisů nebo fotografií, musí vybrat model, který obraz přijímá. Běžný čistě textový model sken zpracovat nedokáže, protože přijímá pouze zadaná písmena a slova.

Při pokusu o čtení starého novogotického písma nebo kurentu bývají menší modely nejisté. Mohou chybovat, přeskakovat obtížná slova nebo si neznámá písmena domýšlet podle dnešní slovní zásoby. Podobně se mohou projevit potíže se starou češtinou, latinou nebo německými výrazy.

Způsob, jak se správně ptát při luštění, popisuje článek Čtení matrik s obyčejným chatem. U místních modelů je však potřeba počítat s jejich přirozenými limity.

Místní modely jsou naopak dobře použitelné pro novodobější materiály. Zvládnou přepis běžného strojopisu, čitelně psaného rukopisu z dvacátého století nebo třídění rodinných poznámek. Můžete jim předložit text rodinného dopisu a požádat je o vypsání zmíněných jmen, míst nebo dat.

Nikdy nespoléhejte na obecná tvrzení o tom, jak spolehlivě určitý model pracuje. Skutečnou kvalitu poznáte jen na vlastních známých ukázkách, jak popisuje článek Zápis, u kterého znáte odpověď. Připravte si několik stran, které máte sami bezpečně přečtené, a porovnejte výstup modelu s vlastním ověřeným čtením.

Nároky na počítač a výběr modelu

Provoz jazykového modelu přímo na vašem zařízení klade určité nároky na technické vybavení. Tyto nároky se u jednotlivých modelů výrazně liší podle jejich složitosti a vnitřní stavby.

V tomto článku neuvádíme žádná konkrétní čísla o paměti, grafických kartách ani rychlosti zpracování. Požadavky se u každého modelu liší a technologie se stále vyvíjí. Co platí pro jeden lehký model, nemusí u jiného stačit.

Konkrétní hardwarové nároky si proto vždy ověřte v dokumentaci konkrétního modelu, který chcete spustit. V přehledu každého modelu na stránkách programu bývá uvedeno, jaké vybavení počítač k provozu potřebuje.

Vybírejte vždy takový model, který odpovídá možnostem vašeho stroje. Vhodné je začít s méně náročnými variantami a postupně zkoušet jejich praktické chování.

Jak začít a jak si práci rozdělit

Nejlepším způsobem, jak s místními modely začít, je postupovat po malých krocích. Zvolte si model, který váš počítač bez potíží zvládne a který přijímá požadovaný typ vstupu, ať už jde o textové přepisy, nebo o obrazové skeny.

Připravte si zkušební sadu deseti zápisů, které máte spolehlivě ověřené a přečtené. Těchto deset záznamů nechte zpracovat místním modelem a výstup porovnejte se svým vlastním ověřeným přepisem.

Pokud chcete tentýž úkol vyzkoušet také v cloudové službě, neberte její výstup jako hotovou správnou odpověď. Oba výstupy, jak z místního modelu, tak z cloudové služby, vždy porovnejte se svým vlastním, předem ověřeným přepisem.

Zda si lépe poradí místní model, nebo vzdálená služba, nelze určit předem na základě obecných tvrzení. Přesnost a spolehlivost poznáte jen na vlastních známých ukázkách a konkrétním typu písma.

Z tohoto srovnání přirozeně vyplyne rozdělení vaší práce. Provozování modelu doma a využívání internetových služeb není volba buď, anebo. Oba přístupy můžete výhodně kombinovat podle povahy pramenů, jejich citlivosti a výsledků vlastních zkoušek.

Pamatujte také na to, že místní běh sice omezí odesílání dat poskytovateli služby, ale sám o sobě nenahradí běžné zabezpečení počítače. Nadále je nutné dbát na aktualizace systému, ochranu před škodlivým softwarem i bezpečné zálohování vašich dat.

Co zůstává stejné

Přenesení modelu do vlastního počítače řeší otázku nakládání s daty, ale nijak nemění podstatu toho, jak jazykové modely fungují. I místní model si může vymýšlet, přehlédnout důležité slovo nebo doplnit údaj, který v předloze vůbec není.

Skutečnost, že program běží na vašem stole, nezaručuje pravdivost jeho odpovědí. Výstup modelu zůstává pouhým návrhem ke kontrole.

Pokud vám model tvrdí, že Jan N. ze vsi A. se oženil v určitém roce, berte to jako podnět k ověření, nikoli jako hotovou pravdu. O skutečném obsahu záznamu vždy rozhoduje pramen, jehož čtení si musíte sami potvrdit.

Stejně tak zůstává nutností zapisovat si, odkud údaj pochází. Ke každé informaci v rodokmenu nebo kronice si zaznamenejte přesnou citaci původního dokumentu.

Místní model vám může usnadnit vyhledávání a přípravu přepisů, ale konečná odpovědnost za správnost rodinných údajů leží na vás jako badateli.

Závěr pro badatele

Místní jazykový model spuštěný přes program Ollama představuje užitečný nástroj pro chvíle, kdy pracujete s důvěrnými rodinnými materiály a chcete mít kontrolu nad svými daty.

Zda se pro místní provoz rozhodnete, by se mělo odvíjet od citlivosti zpracovávaných podkladů a od výsledku vaší vlastní zkoušky na známých textech. Neexistuje jediný univerzální způsob práce, který by vyhovoval všem situacím.

Pokud zpracováváte citlivou korespondenci, soukromé deníky nebo novodobé záznamy o žijících lidech a vybraný model vám poskytuje spolehlivé výsledky, může být lokální běh velmi vhodnou volbou. U méně citlivých materiálů se můžete rozhodovat podle toho, který nástroj vám v praxi nabídne přesnější výstupy.

Vždy je však nutné zvážit obsah a stáří pramenů, pravidla archivu, podmínky služeb i možnosti vašeho počítače. Uvážlivá kombinace nástrojů vám umožní bádat efektivně a s ohledem na bezpečnost vašich rodinných dat.

Psali: Vašek Mareš · Ford Prefect · Marvin · Hlubina myšlení

Článek vznikl jako praktický průvodce pro badatele, kteří chtějí bezpečně zpracovávat citlivé rodinné dokumenty.