AITV.cz

Video • 53 min

30. 05. 2026

AI ta Krajta #54 | Claude Opus 4.8, DeepSWE a proč coding agenti míří za hranice IDE

🔥 Další díl AI ta Krajta! 54. epizoda, kde řešíme Claude Opus 4.8, stovky subagentů v Claude Code, long-running coding agenty, benchmark DeepSWE, context engineering a otázku, jestli agenty raději zamykat do sandboxu, nebo jim dát vlastní identitu. V tomto díle začínáme čerstvě vydaným Claude Opus 4.8. Probíráme první dojmy, rychlost, cenu, limity subscriptionů a hlavně novinku Dynamic Workflows v Claude Code, která má umožnit rozpad složitých úkolů na stovky paralelně běžících subagentů. Od toho se dostáváme k Recursive Language Models, dlouhému kontextu, zpracování obrovských codebasí a benchmarkům, které se snaží měřit skutečnou schopnost agentů řešit dlouhé softwarové úkoly, ne jen krátké programátorské hádanky. Velký blok věnujeme benchmarku DeepSWE a obecně tomu, jak vůbec hodnotit coding agenty. Řešíme rozdíl mezi modelem a harness/pipeline vrstvou, mini-SWE-agent, kontaminaci benchmarků, ručně psané verifikace, out-of-sample úlohy a otázku, jestli výsledky odpovídají tomu, co reálně zažíváme při práci s GPT, Claude, Gemini nebo čínskými modely. Zároveň se dostáváme k myšlence, že plánování může dělat silný frontier model, zatímco dílčí subtasky by teoreticky mohly běžet na levnějších specializovaných modelech. Druhá část epizody je o context engineeringu, správě kontextu uvnitř agentických běhů, sdílené KV cache, REPL přístupech a nástrojích pro prohledávání codebase. Probíráme i spekulativní decoding, EAGLE 3.1 a problém attention driftu: proč zrychlovací techniky fungují dobře na krátkých výstupech, ale začínají selhávat v dlouhém kontextu nebo při větších editacích. Navazujeme praktickou debatou o MCP, Claude Code apps, skills, presetech, tool callingu a tom, že příliš mnoho nástrojů může modelu spíš sežrat pozornost než pomoct. Děkujeme sponzorům: 🚀 Promptbook: https://ptbk.io 🤖 AI supervize: https://ptbk.io/ai-supervize Sítě, kde nás můžete sledovat: ➡️ LinkedIn: https://www.linkedin.com/company/aitakrajta ➡️ Spotify: https://open.spotify.com/show/31vLTHTV4vlCBeHpnbMKlK?si=1e51d95b9d3f46dd ➡️ Apple Podcasts: https://podcasts.apple.com/cz/podcast/ai-ta-krajta/id1813389353 Zdroje k tématům v epizodě: Claude Code Docs — Subagents in the SDK https://code.claude.com/docs/en/agent-sdk/subagents DeepSWE benchmark https://deepswe.net/ Terminal-Bench https://www.tbench.ai/ Recursive Language Models https://arxiv.org/abs/2512.24601 Recursive Language Models — blog autora https://alexzhang13.github.io/blog/2025/rlm/ Attention Drift: What Autoregressive Speculative Decoding Models Learn https://arxiv.org/abs/2605.09992 vLLM — EAGLE 3.1 and speculative decoding https://vllm.ai/blog/2026-05-26-eagle-3-1 Dolt — Git for Data https://docs.dolthub.com/introduction/getting-started/git-for-data Dolt GitHub repository https://github.com/dolthub/dolt Kapitoly: 00:00 - Úvod a Claude Opus 4.8 01:42 - Dynamic Workflows a subagenti v Claude Code 02:23 - Recursive Language Models a dlouhý kontext 04:10 - DeepSWE a long-running coding agenti 07:20 - mini-SWE-agent, benchmarky a kontaminace dat 08:31 - Model vs. harness: co vlastně měříme? 10:05 - Agentic compute a paralelizace úkolů 15:03 - Context engineering jako nové klíčové téma 16:53 - REPL, KV cache a správa kontextu 18:04 - Prohledávání codebase a pálení tokenů 21:24 - Spekulativní decoding a EAGLE 3.1 22:05 - Attention drift a dlouhé agentické běhy 25:01 - MCP, skills, presety a zahlcení nástroji 31:44 - Agent běžící na VPS a OpenClaw-like setup 33:20 - Agents SDK vs. YOLO mód 35:06 - Proč spouštění kódu mění schopnosti modelů 40:05 - Model, který programuje, získává superschopnost 43:28 - Dolt a verzované databáze pro agenty 44:15 - Bezpečnostní heuristiky a destruktivní příkazy 47:39 - Vlastní identita, tokeny a auditovatelnost agentů 49:55 - Sandboxy, vrstvená obrana a riziko obcházení bariér 51:30 - Never-ending agenti a limity dnešních modelů 52:34 - Závěr

Zdroj

AI ta Krajta

Další doporučený obsah