Načítám článek…
Proč ti dochází limit v Claudovi: 9 tipů, jak přestat pálit tokeny
Limit v Claudovi ani v ChatGPT nevzniká z počtu zpráv, ale z velikosti kontextového okna. Kontextové okno je celá historie konverzace, kterou si model musí znovu přečíst při každé jedné zprávě. Když s tím zacházíš neefektivně, sežere ti to klidně 90 % spotřeby - a to se dá srazit dolů bez placení vyššího tarifu.
Tenhle článek je přepis a rozšíření mého videa. Projdeme to od úplných základů, které zvládneš za pár minut z mobilu, až po věci pro ty, co z AI kódujou.
Proč mi AI uprostřed práce zhloupne?
AI nečte tvoje zprávy jako slova. Čte je jako tokeny - zjednodušeně kousky slov.
A teď to hlavní. Při každé jedné zprávě, co pošleš, si model musí znovu přečíst úplně celou historii konverzace od začátku.
Takže když máš rozjetou konverzaci na 10 000 slov a napíšeš jenom „super, díky", AI si těch 10 000 slov přečte znovu. A ty za to znovu zaplatíš. Čte všechny svoje odpovědi, všechny tvoje vstupy, všechna nahraná PDF. Úplně všechno.
Přesně tady vzniká to plýtvání. Není to o tom, kolikrát za den něco napíšeš. Je to o tom, jak dlouhý balvan za sebou ta konverzace táhne.
Které nástroje ti žerou tokeny, i když je nepoužíváš?
První věc nevyžaduje, abys cokoliv psal. Jenom to zkontroluješ.
Kolikrát máš v Claudovi nebo ChatGPT připojenou hromadu konektorů - Canvu, Google Drive, kdo ví co ještě. A v téhle konkrétní konverzaci řešíš úplně něco jiného.
Je to jako kdybys na stůl vytáhl 10 různých kusů nářadí, ale zrovna nic neopravuješ. Nikdo s tím nehýbe, ale pořád ti zabírá místo na stole.
Definice a možnosti každého připojeného nástroje se totiž posílají do modelu s každou další zprávou. I když ten nástroj v životě nepoužiješ.
Projdi si to jednou za čas a odpoj, co nepotřebuješ. Vsadím se, že je to zrovna ta Canva. Já jsem tam toho při vlastním auditu našel hromadu.
Jak velký má být CLAUDE.md nebo AGENTS.md?
Stejná kategorie problému. Pokud používáš Claude Code a máš tam velký systémový soubor CLAUDE.md, čte se pokaždé znovu.
Čím je ten soubor větší, tím míň místa logicky zbyde na tvůj vlastní úkol.
Chápu, že „drž ho stručný" se lehko řekne. Všechno nám tam připadá důležité. Ale udělej si tam občas audit a nacpi do něj jenom to, co fakt pořád potřebuješ.
Pokud pracuješ v aplikaci ChatGPT na počítači (dřív Codex, teď už to sjednotili), ten soubor se jmenuje AGENTS.md. Zkontroluj ho tam.
Proč nepsat AI jako kámošovi na Messengeru?
Znáš to. Napíšeš „ahoj". Pak „mám dotaz". Pak teprve ten dotaz samotný.
Tohle je tokenová sebevražda. Tři zprávy znamenají třikrát přečtenou historii.
Napiš to rovnou celé v jedné zprávě. A ideálně ještě líp: nauč se diktovat přes nějakou apku. Já používám Wispr Flow - zapnu nahrávání a nasypu mu tam veškerý obsah hlavy.
Klidně 5 až 10 minut mluvím a pak mu pošlu všechny myšlenky najednou. Extrémně efektivní věc, protože dostaneš dlouhý a přesný vstup za cenu jednoho přečtení historie.
Proč nemíchat modely v jedné konverzaci?
Jeden model rovná se jedna session. Tohle je nejdůležitější tip z celého článku a upřímně, sám jsem to dlouho dělal špatně.
Vidím to pořád dokola: lidi si v jedné konverzaci přehazují Opus za Sonnet, GPT za jinou verzi, sem tam přidají fast mode.
AI systémy si totiž tvoji historii pamatují v mezipaměti, které se říká cache. A ta cache stojí zlomek běžné ceny - podle ceníku Anthropicu vyjde čtení z cache na desetinu ceny běžného vstupního tokenu.
Jenže cache platí jenom pro přesně stejné nastavení modelu. Jakmile uprostřed konverzace přepneš model, změníš úroveň přemýšlení nebo přidáš fast mode, celá mezipaměť se zahodí. A model musí načíst celou historii znovu za plnou cenu.
Chceš jiný model nebo jinou úroveň přemýšlení? Otevři si nový chat.
Kdy upravit zprávu místo posílání nové?
Zjistil jsi, že jsi zadání napsal blbě nebo nepřesně. Neposílej „aha, myslel jsem spíš tohle".
Edituj rovnou tu původní zprávu. Dělá se to malou tužkou pod tvým minulým vstupem.
Ušetříš tím jedno celé znovu přečtení celé historie. A u dlouhé konverzace to není málo.
Který model vybrat na jaký úkol?
Vybírej model podle náročnosti úkolu. Zdá se to jasné, ale většině lidí jasné není.
Používat nejtěžší a nejdražší model na opravu gramatiky v mejlu je kanón na vrabce. Velké modely žerou tokeny jak blázen. Na běžnou operativu ti bohatě stačí menší a rychlejší model.
A pokud má tvůj nástroj přepínač na přemýšlení (extended thinking), u jednoduchého úkolu ho vypni. Jinak AI stráví čas přemýšlením nad banalitou a ty za to přemýšlení platíš vstupními tokeny, které ani nevidíš.
Kolik tokenů sežere jeden screenshot?
Tady mám sám máslo na hlavě, protože jsem to dělal pořád.
Jeden screenshot dokáže sežrat klidně 5 000 tokenů, když máš 4K monitor. Nahraný obrázek je super věc, ale pro model je to mega zátěž.
Pokud jde o jednoduchou chybku nebo o text, zkopíruj to jako text. Je to míň pohodlné, ale mnohem levnější.
To stejné platí, když ladíš design. Tam to žere úplně nejvíc, protože posíláš screenshot za screenshotem.
Kdy použít /clear a kdy /compact?
V Claude Code píše hrozně moc lidí /compact. Ten má celou session zkomprimovat.
Jenže aby ji zkrátil, musí ji celou přečíst a projít tam a zpátky. Takže tě to samo o sobě stojí tokeny.
Mnohem líp funguje /clear, který to prostě vyčistí, když máš nový úkol.
Mrkni se taky do nastavení účtu do záložky usage. Uvidíš přesně, kolik už má konverzace tokenů v mezipaměti. V Claude Code na to použij /usage nebo malé kolečko vpravo dole.
Co s tím, když z AI kóduješ?
Než necháš AI psát stovky řádků kódu, které pak stejně pětkrát opravuješ, použij nejdřív plánovací režim.
Minulý měsíc jsem asi 10krát viděl, že to lidi bouchali rovnou bez plánu. Je to úplně zbytečné. Plán ti ušetří kolečka oprav, a právě ta kolečka žerou tokenů nejvíc.
Bonus pro ty, co spravují velkou codebase: AI ji běžně prohledává soubor po souboru a načte si do paměti spoustu věcí, které vůbec nepotřebuje, i když ty hledáš jednu jedinou funkci.
Existují open source nástroje, co si jednou udělají mapu tvého kódu, a model pak přesně ví, kam sáhnout. Mrkni třeba na Graphify nebo Code Graph.
Přehled: co ušetří nejvíc?
| Tip | Náročnost | Pro koho |
|---|---|---|
| Odpojit nepoužívané konektory | 2 minuty, jednorázově | všichni |
| Jedna zpráva místo tří | změna návyku | všichni |
| Jeden model = jedna session | změna návyku | všichni |
| Editovat zprávu místo opravy | jedno kliknutí | všichni |
| Text místo screenshotu | míň pohodlné | všichni |
| Zkrátit CLAUDE.md / AGENTS.md | půl hodiny | Claude Code, ChatGPT app |
| Plánovací režim před kódem | pár minut navíc | vývojáři |
| Mapa codebase (Graphify, Code Graph) | setup navíc | velké projekty |
Kdy tyhle tipy NEfungují?
Ehm, nebudu ti lhát, že je to univerzální recept. Pár výjimek tady je.
- Dlouhé refactoringy. Když děláš jednu velkou věc napříč projektem, rozsekat to na nové sessiony tě bude stát víc než nechat běžet jednu. Kontext má cenu.
- Design a vizuální ladění. Tady se screenshotu prostě nevyhneš. Jenom si je ořízni, ať neposíláš celý 4K monitor kvůli jednomu tlačítku.
- Složité rozhodování. Tam extended thinking vypínat nechceš. Vypínej ho u banalit, ne u věcí, kde záleží na kvalitě.
- Když ti limit nevadí. Když jedeš pár konverzací denně, tohle celé neřeš. Optimalizace dává smysl až při intenzivní práci.
Čím začít hned dneska?
Když si z toho máš odnést tři věci, ať jsou to tyhle:
- Projdi si připojené konektory a odpoj, co v dané práci nepotřebuješ.
- Přestaň přepínat modely uprostřed konverzace. Nový model = nový chat.
- Piš jeden dlouhý vstup místo pěti krátkých. Ideálně nadiktovaný.
A poslední věc: když se ti něco povede a najdeš funkční postup nebo styl, ulož si ho. Ať už jako skill, nebo do CLAUDE.md či AGENTS.md. Nemusíš ho pak vysvětlovat pokaždé znovu, což je samo o sobě úspora.
Já jsem při vlastním auditu našel čísla, která mě fakt šokovala. Napiš mi do komentářů u videa, kolikrát tě minulý týden vypekl limit a který z těch tipů tě nejvíc překvapil.
Podívej se na celé video
Obsah tohoto blogu vzniká s pomocí AI z Martinových LinkedIn postů a videí na YouTube.