为什么现在聚焦 kv cache;分清楚:kv权重 和 kv向量
权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大目录权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大一、先看两者怎么随长度变化二、算出来的结果三、为什么必然如此(本质)四、现代大模型呢一、先看两者怎么随长度变化模型权重:固定一份,和输入多长完全无关→ GPT-2 small 恒为0.23 GBKV Cache:每来 1 个 token 就新增一份K/V,随序列长度线性累积→ 36 KB/token二、算出来的结果临界长度 ≈ 6700 token:上下文到约6.7K时,KV Cache 就追平整个模型权重10万 token ÷ 6700 ≈ 15 倍→ 这就是"十几倍"的来源三、为什么必然如此(本质)两者都含"层数",一除层数约掉:临界长度 = 权重总参数 每token存的KV个数 = 1.24 亿 2 ( K , V ) ×
上一篇/下一篇内容由系统自动关联
返回资讯列表 →