Ako chatbot píše

Chatbot nepíše myšlienky, ale slová. Jedno po druhom. Vyskúšajte si, ako háda to ďalšie.

Slovo po slove

  1. Pondelok, porada o desať minút
    Jana: Napíš mi výhovorku, prečo nemám hotovú prezentáciu.
    AI: Už píšem. Slovo po slove.
  2. Jana: Takže ty len hádaš ďalšie slovo?
    AI: „Hádam“ je silné slovo. Hovorme tomu kvalifikovaný odhad.
  3. Jana: A celú vetu dopredu nevidíš?
    AI: Vidím len to, čo už je napísané. Z toho odhadnem ďalšie slovo. Vyskúšajte si to.
  4. Teraz vy!

    Slovo 1 z 3

    Vyberte za AI ďalšie slovo.

    Ráno si dám kávu a čerstvý

    Zvyšok percent pripadá na tisíce ďalších slov.

  5. Ako to funguje

    Ako chatbot píše

    Chatbot dostane text a vypočíta, aké pravdepodobné je každé možné ďalšie slovo. Jedno z pravdepodobných vyberie, pripíše ho a celé to zopakuje. Stále dookola, kým odpoveď nedopíše.

    Presnejšie povedané nepracuje so slovami, ale s tokenmi, teda s kúskami textu. Krátke slovo býva jeden token, dlhé alebo skloňované slovo sa rozpadne na niekoľko. Slovenčina pre koncovky zvyčajne potrebuje na rovnaký text viac tokenov ako angličtina.

Čo z toho vzniklo

  1. O kávu neskôr
    Jana: Počkaj. Odkiaľ vieš, že po káve príde práve rožok?
    AI: Tipnite si.
  2. Teraz vy!

    Odkiaľ chatbot vie, aké slovo zvyčajne nasleduje?

  3. Ako to funguje

    Učenie v dvoch krokoch

    Najprv sa model učí z obrovského množstva textu, z kníh, článkov a webových stránok. Má jedinú úlohu, odhadnúť ďalší kúsok textu. Tak vznikne stroj, ktorý vie plynulo pokračovať v akomkoľvek texte.

    Potom príde druhé, menšie učenie. Na ukážkových rozhovoroch a na hodnotení odpovedí, ktoré robia aj ľudia. Až z neho je asistent, ktorý odpovedá na otázky a drží sa zadania.

    Databázu viet v sebe nemá. Čo sa naučil, je uložené ako miliardy čísel. Texty, ktoré videl mnohokrát, si však občas zapamätá takmer doslova.

Prečo zakaždým inak

  1. Na druhý deň
    Jana: Včera som sa ťa pýtala na to isté a odpovedal si inak.
    AI: Nevyberám vždy to najpravdepodobnejšie slovo. Je v tom trochu náhody.
  2. Jana: A dá sa tá náhoda nastaviť?
    AI: Má to gombík. Hovorí sa mu teplota. Vyskúšajte ho na tej výhovorke.
  3. Teraz vy!Úradník

    Posuňte teplotu a sledujte, ako sa výhovorka mení.

    Prezentáciu nemám. Dôvod: počítač spadol a nestihla som ju dokončiť.

    OpatrneDivoko

    Aké pravdepodobné je ďalšie slovo po „Prezentáciu nemám. Dôvod:…“

    • počítač55 %
    • vlak30 %
    • mačka12 %
    • žeriavy3 %
    AI: Nudné. Ale šéf tomu uverí.
    Nízka teplota: vyhrávajú najpravdepodobnejšie slová. Text je istý a predvídateľný.
  4. Ako to funguje

    Teplota

    Teplota je nastavenie, ktoré určuje, ako veľmi chatbot riskuje. Pri nízkej vyberá takmer vždy najpravdepodobnejšie slovo. Pri vysokej dostanú šancu aj slová, ktoré by inak takmer nikdy nenapísal.

    Vo väčšine chatovacích aplikácií teplotu nastavuje aplikácia, nie vy. Aj preto môže rovnaká otázka dostať zakaždým trochu inú odpoveď. Svoju úlohu hrá aj to, ako presne otázku položíte a o čom ste písali predtým.

Znie to dobre. Je to pravda?

  1. Jana: Takže píšeš to, čo znie pravdepodobne. Nie to, čo je pravda.
    AI: Väčšinou je to to isté. Väčšinou.
  2. Jana: A keď nie?
    AI: Potom to napíšem rovnako sebaisto. A gramaticky bezchybne.
  3. Ako to funguje

    Pravdepodobné nie je to isté ako pravdivé

    Model sa učil písať text, ktorý do situácie sedí. Keď je správna odpoveď v textoch častá, trafí sa. Keď je zriedkavá alebo vôbec neexistuje, napíše niečo, čo len znie správne.

    Sebaistý tón pritom nič neznamená. Model píše rovnako plynulo, či má pravdu, alebo nie. Práve o tom bude budúci diel.

  4. Jana: Takže si vlastne veľmi sčítaný odhadovač.
    AI: Najsčítanejší. Ale stále odhadovač.
  5. Ako to funguje

    Koľko toho model prečítal?

    Koľko textu prečítali najnovšie modely od OpenAI, Googlu alebo Anthropicu, nevieme. Firmy to nezverejňujú. OpenAI to pri modeli GPT-4 v roku 2023 výslovne odmietlo.

    Poznáme čísla od firiem, ktoré ich zverejnili. Meta uviedla, že jej model Llama 3 z roku 2024 sa učil z viac ako 15 biliónov tokenov, teda zhruba z 11 biliónov slov. GPT-3 z roku 2020 sa učil z 300 miliárd tokenov, asi päťdesiatkrát menej.

    Keby to boli romány so sto tisíc slovami, bolo by to vyše sto miliónov kníh. Väčšinu v skutočnosti tvoria webové stránky, ale pre predstavu: kto prečíta knihu týždenne, stihne ich za šesťdesiat rokov asi tri tisíce.

    A keby ste ten text čítali bežnou rýchlosťou, vo dne v noci a bez prestávky, trvalo by vám to takmer 90 000 rokov.

    Zdroje: Meta: Introducing Meta Llama 3 (2024); Brown a kol.: Language Models are Few-Shot Learners (2020); OpenAI: GPT-4 Technical Report (2023); OpenAI: Čo sú tokeny (token je asi ¾ anglického slova); Brysbaert: How many words do we read per minute? (2019), 238 slov za minútu

Kvíz

  1. AI: Na záver päť otázok. Čo si vybavíte z pamäti, to si zapamätáte.
    Jana: Je to pravda, alebo len pravdepodobné?
  2. Kvíz

    Otázka 1 z 5

    Päť otázok, žiadne známky.

    Ako chatbot vytvára odpoveď?

    Vyberte jednu odpoveď.

Čo si odniesť

  1. Chatbot píše po kúskoch. Zakaždým odhadne, čo bude ďalej, a vyberie jedno z pravdepodobných slov.
  2. Naučil sa to z obrovského množstva textu. Pri písaní nič nehľadá ani neoveruje.
  3. Teplota určuje, ako veľmi riskuje. Preto rovnaká otázka nedostane vždy rovnakú odpoveď.
  4. Pravdepodobné nie je to isté ako pravdivé. Sebaistý tón nič nedokazuje.

Ďalšia epizóda

Prečo si AI vymýšľa

Sebaistý kamarát, ktorý nikdy neprizná, že niečo nevie. Spoznáte, kedy AI vymýšľa?

Nový diel priamo do schránky

Každé dva týždne pošleme nový diel, krátky text na učenie a novinky zo sveta AI. Zadarmo a odhlásiť sa môžete kedykoľvek.

Odoslaním súhlasíte so spracovaním e-mailu na zasielanie noviniek. Viac v zásadách ochrany súkromia.

Chcete to pre celú firmu? Pripravíme živé školenie na mieru vášmu tímu.