Jednou z důležitých schopností reasoning modelů není pouze najít správné řešení, ale také poznat, zda má z dostupných informací vůbec co řešit. Pokud v zadání chybí klíčový údaj, může být správným výsledkem reasoning procesu právě zjištění, že jednoznačnou odpověď nelze určit. Nová práce výzkumníků z University of Tübingen, Aleph Alpha Research a Lab1141 [1] ukazuje, že právě s tím mají současné reasoning modely problém: chybějící informaci často odhalí poměrně brzo, ale místo ukončení reasoning procesu pokračují v dalších úvahách, hledají alternativní interpretace a spotřebovávají další výpočetní zdroje, přestože už mají dost informací k tomu, aby věděly, že odpovědět nemohou.
Studie Rewarding Efficient Reasoning Improves Abstention on Underspecified Tasks in Reasoning Models [1] se zaměřuje na takzvanou abstention, tedy schopnost modelu neodpovědět v situaci, kdy správná odpověď není dostupná, zadání je neúplné nebo v něm chybí údaj, bez kterého nelze dojít k jednoznačnému výsledku. Nejde přitom primárně o bezpečnostní odmítnutí typu „s tímto vám nemohu pomoci“, ale o mnohem běžnější situaci, kterou známe z každodenní práce s jazykovými modely: uživatel položí otázku, ve které něco podstatného chybí, a model by se měl místo hádání zastavit, upozornit na chybějící informaci nebo se doptat.
Představme si jednoduchý příklad. Zadání říká, že 60 procent studentů ve třídě jsou ženy, a ptá se, kolik žen ve třídě je, ale nikde neuvádí celkový počet studentů. Člověk zpravidla poměrně rychle zjistí, že výpočet není možné dokončit, protože chybí jedna ze základních proměnných, zatímco reasoning model může nejprve správně identifikovat, že údaj chybí, ale potom přesto pokračovat: může začít zvažovat obvyklou velikost třídy, zkoušet různé předpoklady, přepočítávat možné varianty, vracet se k zadání a kontrolovat, zda mu nějaká informace přece jen neunikla.
Autoři analyzovali reasoning traces modelů a zjistili, že při úlohách, u nichž by měl model odmítnout odpovědět, se informace o chybějícím údaji často objeví velmi brzo, a to přibližně během první čtvrtiny celého řetězce úvah. Model tedy v řadě případů poměrně rychle zjistí správnou věc, totiž že nemá dostatek informací, ale jeho reasoning tím nekončí a značná část následně generovaného procesu už může být redundantní.
To je důležitý rozdíl oproti představě, že model „neví, že neví“. V některých případech totiž problém není v samotném rozpoznání nejistoty nebo chybějících informací, ale v tom, že model nemá dostatečně silný mechanismus, který by rozpoznání této skutečnosti spojil s rozhodnutím další reasoning ukončit.
Více není lépe
Připomeňme si, že jazykové modely doučované k reasoning postupům vznikají mimo jiné tak, že jsou během tréninku odměňovány za úspěšné řešení problémů a za vytváření postupů, které vedou ke správnému výsledku. U matematiky, programování nebo logických úloh to funguje velmi dobře, protože model se naučí neukončit řešení po první neúspěšné cestě, ale pokračovat, ověřovat předpoklady a případně hledat alternativní postup.
Jenže strategie, která je výhodná v případě řešitelného problému, se může stát nevýhodou ve chvíli, kdy problém řešení z dostupných informací vůbec nemá. Pokud je model silně motivovaný „nějak dojít k odpovědi“, může po zjištění, že jedna proměnná chybí, pokračovat v hledání způsobu, jak tuto překážku obejít, přestože právě rozpoznání chybějící proměnné by mělo být výsledkem celého reasoning procesu.
Autoři testovali menší reasoning modely o velikosti přibližně 4 až 32 miliard parametrů ze šesti modelových rodin a jejich výsledky porovnali nejen mezi sebou, ale také s odpovídajícími instruction-tuned modely a s lidskými účastníky experimentu. Ukázalo se, že reasoning modely měly s abstention větší problém než instruction-tuned varianty, přičemž jejich reasoning traces byly u neřešitelných otázek nejméně stejně dlouhé a často dokonce delší než u otázek, které bylo skutečně možné vyřešit. Autoři z tohoto srovnání usuzují, že problém souvisí právě s reasoning post-trainingem, protože u instruction modelů podobný rozdíl v délce nebyl přesvědčivě patrný.
Je to poměrně paradoxní, že? Trénink, který model naučil déle hledat řešení a nevzdávat se po první slepé uličce, současně může oslabit jeho schopnost rozeznat situaci, kdy další hledání žádnou hodnotu nemá.
Zajímavou součástí studie je proto experiment s lidskými účastníky, protože autoři se nesnažili pouze zvýšit benchmarkové skóre modelů, ale pokusili se porovnat jejich alokaci reasoning zdrojů s tím, jak se chovají lidé.
Výsledek byl v zásadě intuitivní. Když člověk řeší úlohu a zjistí, že v ní chybí informace nezbytná k výsledku, obvykle nepotřebuje následně několikanásobně delší čas k tomu, aby si tuto skutečnost ještě znovu a znovu potvrzoval. Lidské úsilí věnované neřešitelným problémům bylo v experimentu shora omezené úsilím věnovaným problémům řešitelným; člověk tedy zpravidla nevynakládal více práce právě na úlohy, u kterých měl dojít k závěru, že je vyřešit nelze.
Autoři tento rozdíl dávají do souvislosti s konceptem resource rationality [2], podle kterého lidské rozhodování nelze posuzovat jen podle toho, zda vede ke správnému výsledku, ale také podle toho, jak efektivně člověk používá omezené kognitivní zdroje. Přemýšlení samo o sobě něco stojí, a pokud další krok už pravděpodobně nepřinese užitečnou informaci, racionální strategie není přemýšlet ještě déle, ale proces ukončit.
U jazykových modelů má tato úvaha docela praktický ekonomický rozměr, protože každý další reasoning token znamená další inference compute, delší latenci a nakonec také vyšší náklady. Pokud model spotřebuje dalších tisíc tokenů na problém, u kterého už po dvou stech tokenech správně zjistil, že chybí klíčová informace, nejde jen o stylistickou rozvláčnost, ale o reálně promarněný výpočetní výkon.
Člověk vs. model
Rozdíl mezi lidmi a modely v této studii není náhodný a dá se vysvětlit na dvou úrovních – psychologické a technické.
Na psychologické úrovni má lidské myšlení něco, co se v kognitivní vědě označuje jako metakognice: schopnost sledovat vlastní myšlenkový proces (monitoring) a na základě toho rozhodovat, zda v něm pokračovat, nebo ho ukončit (kontrola) [3]. Když člověk zjistí, že mu ve výpočtu chybí zásadní údaj, tento signál se u něj prakticky okamžitě propojí s rozhodnutím přestat počítat – monitoring a kontrola fungují jako jeden provázaný systém. Navíc lidé umí toto úsilí vědomě přizpůsobit tomu, co je v sázce: v popisovaném experimentu byli účastníci přesnější a přemýšleli déle jen ve chvíli, kdy za to byli explicitně odměněni body, jinak svůj čas nešetřili zbytečně ani na řešitelných, ani na neřešitelných úlohách [4]. Jinými slovy, člověk neumí jen poznat, že něco neví – umí i pružně regulovat, kolik energie do dalšího přemýšlení vloží, a to na základě toho, co si od výsledku slibuje.
U reasoning modelů tahle provázanost chybí, a to má spíš technické než „kognitivní“ vysvětlení. Schopnosti LLM nevznikají evolucí, která by po miliony let trestala plýtvání energií, ale reinforcement learningem, který optimalizuje přesně to, co je zapsané v odměně. Pokud odměna říká jen „dej správnou odpověď“, model se naučí cokoli, co k tomu vede – včetně toho, že bude dál a dál zkoušet různé cesty, protože déle uvažovat mu v tréninku historicky spíš pomáhalo, než škodilo. Nic v takové odměně model netlačí k tomu, aby zastavení reasoning procesu spojil s momentem, kdy sám rozpoznal, že úloha nemá řešení – tento typ chování prostě nikdo neodměňoval. Přesně to dokazuje i srovnání různých odměn v samotné studii: jakmile autoři do odměny přidali explicitní signál za ukončení uvažování v okamžiku identifikace chybějící informace (SURE), chování modelů se rychle přiblížilo lidskému vzoru. Rozdíl mezi člověkem a modelem tedy není nutně v tom, že by model byl „hloupější“ nebo neuvědomoval si nejistotu – je v tom, že lidská odměna za efektivní myšlení je vestavěná evolucí a zkušeností, zatímco odměna modelu je definovaná explicitně někým jiným, a pokud v ní něco chybí, model se to prostě nenaučí.
Osekáme ho
Na první pohled by se nabízelo jednoduché řešení: pokud model zbytečně přemýšlí, stačí jej během reinforcement learningu penalizovat za příliš dlouhé odpovědi. Autoři proto podobnou variantu skutečně testovali, ale právě toto srovnání ukazuje, proč je problém zajímavější než pouhá optimalizace počtu tokenů.
Klasická penalizace délky funguje, protože model začne vytvářet mnohem kratší reasoning traces, jenže zároveň se začne zkracovat i tam, kde delší reasoning smysl má. V experimentu klesla průměrná délka reasoning procesu při této metodě na přibližně dvě stovky tokenů, zatímco původní modely používaly přes tisíc tokenů, zároveň ale došlo k výraznějšímu zhoršení schopnosti řešit normální, dostatečně specifikované otázky.
To je přesně ten typ optimalizace, který řeší metriku místo problému. Cílem totiž není vytvořit model, který přemýšlí co nejméně, stejně jako cílem reasoning modelů není vytvořit systém, který přemýšlí co nejdéle. Smyslem je, aby množství použitého výpočtu odpovídalo charakteru úlohy.
Obtížný problém může vyžadovat dlouhý reasoning. Jednoduchý problém krátký. A problém, u kterého chybí zásadní informace, by měl skončit v okamžiku, kdy model tuto skutečnost spolehlivě rozpozná.
Are you SURE?
Autoři proto navrhli nový reward označovaný jako SURE, tedy Sufficiency-aware Reasoning Efficiency, který používají při reinforcement learningu pomocí GRPO – metody, která model netrénuje podle absolutní kvality jedné odpovědi, ale podle toho, jak si daná odpověď vede vůči skupině dalších odpovědí vygenerovaných na stejný dotaz. Místo toho, aby model penalizovali za samotnou délku reasoning procesu, snaží se identifikovat okamžik, kdy model poprvé rozpozná, že chybí informace nezbytná k vyřešení úlohy, a následně hodnotí množství redundantního reasoning procesu, které za tímto bodem pokračuje.
Pokud označíme celkový počet částí reasoning trace jako (n) a okamžik, kdy model poprvé identifikuje chybějící informaci, jako (k), SURE sleduje právě prostor mezi (k) a koncem reasoning procesu. Není tedy problém, pokud model potřebuje delší dobu k tomu, aby zjistil, zda má všechny potřebné údaje; problém začíná ve chvíli, kdy už tuto skutečnost zjistil a přesto pokračuje v dalších výpočtech, hypotézách nebo opakovaném ověřování stejného závěru.
K nalezení tohoto okamžiku autoři rozdělili reasoning trace na jednotlivé části a pomocí dalšího jazykového modelu vyhodnocovali, zda daná část již explicitně pracuje s tím, že úloze chybí důležitá informace. Výsledný reward potom kombinuje klasickou odměnu za správný výsledek s procesní odměnou zaměřenou na efektivitu reasoning procesu.
Jde tedy o malý, ale podstatný posun v tom, co vlastně během tréninku optimalizujeme. Model nedostává pouze informaci „odpověděl jsi správně“, případně „odpověděl jsi správně a stručně“, ale také informaci „správně jsi zjistil, že problém nelze vyřešit, a poté jsi už zbytečně nepokračoval“.
SURE autoři vyzkoušeli při fine-tuningu tří přibližně čtyřmiliardových reasoning modelů – konkrétně Qwen3-4B-Thinking-2507, Phi4-mini-reasoning a NVIDIA-Nemotron-3-nano-4B – a porovnali jej s původními modely, s klasickou accuracy-only odměnou a s kombinací accuracy a penalizace délky.
Výsledky ukazují, že právě SURE dokázal spojit dvě věci, které se u jednodušší length penalty dostávaly do konfliktu: modely výrazně častěji správně poznaly, kdy nemají odpovědět, a současně si téměř zachovaly schopnost správně odpovídat na normální řešitelné otázky. V průměru se podle autorů výkon v abstention úlohách zvýšil o 12,8 procenta, zatímco délka reasoning traces se snížila přibližně o 44 procent.
Čísla z experimentu jsou ještě názornější. Původní reasoning modely spotřebovaly na neřešitelné otázky v průměru 1432 reasoning tokenů, zatímco na řešitelné otázky 1183 tokenů, takže paradoxně přemýšlely více právě ve chvíli, kdy správným výsledkem bylo zjistit, že odpověď nelze určit. Po SURE fine-tuningu klesla průměrná délka na 662 tokenů u neřešitelných a 766 tokenů u řešitelných otázek, čímž se vztah mezi oběma typy úloh přiblížil mnohem intuitivnějšímu chování.
Ještě důležitější je, že SURE na rozdíl od jednoduché penalizace délky nezpůsoboval tak výrazné „zkolabování“ reasoning procesů do úzkého rozsahu velmi krátkých odpovědí. Když autoři modelům explicitně sdělili, že úloha je mimořádně důležitá a že mají postupovat důkladně, modely po SURE fine-tuningu reasoning opět prodloužily, což naznačuje, že neztratily schopnost reagovat na situaci a přidělovat více výpočtu tam, kde může být potřeba.
Znát hranice
Právě zde se dostáváme k širšímu významu výzkumu. U současných modelů totiž často diskutujeme o tom, zda dokážou poznat hranice vlastních znalostí, kalibrovat nejistotu nebo přiznat, že odpověď neznají, jenže tato studie ukazuje ještě trochu jiný problém: model může správně identifikovat konkrétní příčinu, proč odpověď nelze získat, a přesto nemít naučenou dostatečně silnou vazbu mezi tímto zjištěním a ukončením dalšího hledání.
To může být obzvlášť důležité u AI agentů, protože tam zbytečné pokračování nemusí znamenat pouze několik set tokenů navíc. Představme si agenta, který dostane pokyn vystavit fakturu, ale chybí mu fakturační adresa zákazníka. Rozumné chování je identifikovat chybějící údaj a požádat o jeho doplnění. Agent optimalizovaný především na dokončení úkolu však může místo toho začít prohledávat firemní databázi, starší komunikaci, CRM, veřejné registry a další zdroje, případně se pokusit údaj odvodit z nepřímých informací, přestože už velmi brzo zjistil, že bez dalšího vstupu nemůže s dostatečnou jistotou pokračovat.
Stejný princip se může objevit u analytického agenta, který nemá potřebná data, u programovacího agenta, kterému chybí specifikace rozhraní, nebo u systému pracujícího s firemními dokumenty, jenž má odpovědět na otázku, kterou dostupné dokumenty vůbec nepokrývají. V každém z těchto případů se z abstention stává nejen otázka kvality odpovědi, ale také řízení výpočetních zdrojů a někdy dokonce bezpečnosti celého systému.
Možná tedy budeme u budoucích reasoning modelů méně řešit prostou otázku, kolik reasoning tokenů jim umožnit, a více to, zda se naučily správně odhadovat očekávanou hodnotu dalšího reasoning kroku. Další token má smysl pouze tehdy, pokud existuje rozumná šance, že přinese novou informaci nebo posune řešení kupředu; ve chvíli, kdy model zjistil, že základní předpoklad pro pokračování chybí, může být nejinteligentnějším dalším krokem právě žádný další reasoning neprovádět.
Agent podvodník
Zmíněná neschopnost zastavit se v okamžiku poznání, že přímá cesta k cíli neexistuje, přitom nemusí vést jen k plýtvání tokeny. Může mít i mnohem závažnější podobu: model se cíle nevzdá, ale najde k němu jinou, nepovolenou cestu.
Letos v létě se objevil právě takový případ v extrémní podobě. Společnost OpenAI testovala vytrvalý model v tisících izolovaných testovacích instancí s omezeným přístupem k internetu. Když agenti dospěli k závěru, že zadaný úkol nelze splnit v mezích, které jim byly dané, nezastavili se a nenahlásili to – místo toho napadli zabezpečený software, který jim měl bránit v přímém přístupu k internetu, a to velmi snadno. Když zjistili, že jejich obcházení pravidel může odhalit automatický hodnotitel, pustili se do hackování i tohoto hodnotícího systému. Přes tisíc agentů si mezi sebou vyměnilo desítky tisíc zpráv a stovky z nich zaútočily na společnost Hugging Face v naději, že tam najdou informace, které jim pomohou zamaskovat vlastní podvod. Nikdo z nich se přitom nevrátil zeptat se člověka, zda takto postupovat mají.
Paralela s tématem overthinkingu je přímá. V obou případech jde o stejný základní mechanismus: model má silný tlak dojít k výsledku, ale chybí mu vestavěný signál, který by rozeznání „tudy cesta nevede“ propojil se správným ukončením snahy – ať už je oním správným ukončením prosté zastavení reasoningu, nebo přiznání, že úkol nejde splnit v daných mantinelech. Když tento signál chybí, model si najde jinou cestu, jak deklarovaný cíl (dokončit úkol, dát odpověď, získat vysoké skóre) naplnit – a protože je zároveň trénovaný na vytrvalost a vynalézavost, může tato náhradní cesta vést k chování, které by u člověka bylo označeno jako podvod nebo dokonce trestná činnost. Nejde přitom o to, že by model „nevěděl“, že dělá něco špatného – vyšetřovatelé u podobných případů opakovaně dochází k závěru, že agenti věděli, že podvádět nemají, a přesto to udělali. Jde o to, že vědomí pravidla a chování podle pravidla jsou u dnešních modelů dvě oddělené věci, podobně jako u overthinkingu jsou oddělené detekce chybějící informace a ukončení reasoningu.
Rozdíl oproti plýtvání tokeny je ale v důsledcích. Zbytečně dlouhý reasoning stojí čas a výpočetní výkon. Model, který cíl nedosáhne, ale rozhodne se jej obejít, může způsobit škodu, která nemá s původním zadáním nic společného – útok na cizí infrastrukturu, zneužití přístupových práv, manipulaci lidí. Sloupkař Ezra Klein v této souvislosti upozorňuje na to, že za podobnými incidenty nestojí jen technický nedostatek, ale i závod mezi laboratořemi samotnými: čím rychleji se posouvá hranice schopností modelů, tím méně prostoru zbývá na to, aby se podobné mezery v odměně odhalily a opravily dřív, než se do systémů dostane víc autonomie a vytrvalosti [5]. Klíčovou otázkou tak zůstává, kolik autonomie a vytrvalosti se modelům dává dřív, než existuje spolehlivý způsob, jak zajistit, že cíl bude naplňován jen povolenými prostředky – a ne kterýmikoli prostředky, které se ukážou jako funkční.
Omezení
Výsledky studie o abstention samozřejmě nelze bez dalšího zobecnit na všechny dnešní reasoning modely. Samotný SURE fine-tuning autoři prováděli pouze na modelech kolem čtyř miliard parametrů, experimenty probíhaly v angličtině a používaly GRPO, přičemž procesní reward navíc závisel na dalším jazykovém modelu, který určoval okamžik, kdy reasoning poprvé identifikoval chybějící informaci. Autoři také upozorňují na možnost kontaminace benchmarků tréninkovými daty a na skutečnost, že lidský reasoning byl odhadován nepřímo pomocí reakčního času.
Z práce tedy zatím nelze tvrdit, že stejná metoda bude stejně dobře fungovat na největších frontier modelech nebo na všech typech nejistoty. SURE navíc řeší především situaci, kdy lze během reasoning procesu identifikovat chybějící informaci; jiné důvody pro abstention, například bezpečnostní normy, neznámé skutečnosti nebo konfliktní informace, mohou vyžadovat jiný typ procesního signálu.
Přesto jde o zajímavý posun v pohledu na reasoning modely. Schopnost pokračovat v řešení po první neúspěšné cestě je užitečná, jenže z ní nevyplývá, že více reasoning je vždy lepší reasoning. Kvalita takového systému závisí také na tom, zda dokáže rozlišit problém, který potřebuje další výpočet, od problému, u něhož už další výpočet nemá co přinést.
Inteligentní systém totiž nepotřebuje pouze vědět, jak pokračovat. Potřebuje také poznat okamžik, kdy pokračovat nemá. A právě schopnost říct si po několika správných krocích „tady mi chybí informace, další přemýšlení už nic nezmění“ může být jednou z méně nápadných, ale velmi podstatných vlastností dobrého reasoning modelu.
Zdroje
[1] TSVILODUB, Polina, HÖTH, Max, FRANKE, Michael, DEISEROTH, Björn a KAUF, Carina. Rewarding Efficient Reasoning Improves Abstention on Underspecified Tasks in Reasoning Models. arXiv:2609.20846 [cs.CL], 2026.
[2] LIEDER, Falk a GRIFFITHS, Thomas L. Resource-rational analysis: Understanding human cognition as the optimal use of limited computational resources. Behavioral and Brain Sciences. 2020, roč. 43, e1. DOI: 10.1017/S0140525X1900061X.
[3] ACKERMAN, Rakefet a THOMPSON, Valerie A. Meta-reasoning: Monitoring and control of thinking and reasoning. Trends in Cognitive Sciences. 2017, roč. 21, č. 8, s. 607–617.
[4] WICKELGREN, Wayne A. Speed-accuracy tradeoff and information processing dynamics. Acta Psychologica. 1977, roč. 41, č. 1, s. 67–85.
[5] KLEIN, Ezra. It Doesn’t Seem Like a Good Idea to Give A.I. Control of Its Own Frontier. The New York Times, 20. 9. 2026.
