一句話,走完 Token、Attention 到 KV Cache
用「小美養貓」這句例子,拆開 token、位置資訊、Q/K/V、attention、residual connection 與 KV cache,說清楚自回歸 LLM 每產生一個新 token 時,哪些資料能沿用、哪些工作仍得重做。
AI TECHNOLOGY AI TECHNOLOGY
用漫畫與工程拆解 LLM、Token、KV Cache、AI 推論、記憶體瓶頸與加速器架構。
用「小美養貓」這句例子,拆開 token、位置資訊、Q/K/V、attention、residual connection 與 KV cache,說清楚自回歸 LLM 每產生一個新 token 時,哪些資料能沿用、哪些工作仍得重做。
AI TECHNOLOGY 這篇先用六張漫畫回答一個問題:LLM 為什麼能一句一句接出像樣的回答?我們會從「猜下一個字」開始,慢慢帶到 token、向量、K/V 筆記與 KV Cache,最後再看為什麼對話越長,AI 系統越容易被記憶體與資料搬移拖慢。