DeepSeek 又出新模型了。据 InfoQ 报道,DeepSeek 近日发布 DeepSeek-V4.1-Flash,一款原生多模态的 MoE(混合专家)模型,最高支持 100 万 Token 的超长上下文——相当于能一口气读完一部长篇小说。 参数翻倍,干活反而更省 这次有点反常识:新模型主干参数 552B(上一代 V4-Flash 是 284B),规模几乎翻倍;但它在"读题"(Prefill)阶段每个 Token 只激活 8B 参数,答话(Decode)阶段激活 16B——比上一代还少。据官方技术报告,参数变大一倍,跑起来却更省。 为什么揪着 KV Cache 不放? 现在 AI 智能体(Agent)干活,往往是"读得多、写得少":不停读代码、网页、文档和工具返回结果,上下文越堆越长。这带来一个比参数更烧钱的问题——长上下文占的显存(KV Cache)、硬盘和搬运成本。 DeepSeek 的办法是把模型的"记忆"压缩共享:层与层之间共享 KV 缓存,只精算真正重要的位置,不再每次重扫全部历史。结果是上下文从 4K 拉到 100 万 Token(涨 256 倍),单个 Token 的算力开销只多约 25%;关键缓存被压到约 890 字节/Token,只有上一代的四分之一。此外,不常用的缓存从硬盘挪到内存暂存,整体持久缓存降到上一代约八分之一。 对我们意味着什么 一句话:以后让 AI 处理超长文档、当长跑 Agent,成本有望明显下降。据了解,模型还首次把多模态放进预训练,能看图(支持约 1344×1344 输入)。目前 DeepSeek 已放出技术报告,具体上线与价格以官方为准。 来源:InfoQ《参数几乎翻倍,推理反而更省:DeepSeek V4.1-Flash 重构 KV Cache》 https://www.infoq.cn/article/sbaJrAa8VTIRKIPCpKlo |
工具速递阶跃一口气发布五款语音大模型:StepAudio 2026-09-18
AI生活B站「AI无限竞技场」上线:百大AI模型同台P2026-09-17
业界动态荣耀发布MagicOS 11:行业首个系统级Agent 2026-09-16