Jak si AI pamatuje konverzaci? KV Cache vysvětlena jednoduše
Proč dokáže ChatGPT, Gemini nebo Claude odpovídat téměř okamžitě, i když si pamatují celou vaši konverzaci? Odpověď se jmenuje KV cache a v tomto videu vám ukážu, jak tato technologie funguje na jednoduchém příkladu s čtením detektivky. Vysvětlím, proč si velké jazykové modely nemusí při každém novém slově znovu promýšlet celý kontext konverzace, jak KV cache šetří výpočetní výkon a proč zabírá tolik paměti na grafické kartě. 00:00 Úvod 00:21 Vysvětlení problému 01:11 Jak funguje KV cache 02:35 Paměť 03:04 Závěr





