DeepSeek
2026-09-10 06:03:55DeepSeek 发布 V4.1 Flash:552B 架构输入仅激活 8B
DeepSeek 正式发布 V4.1 Flash。该模型总参数为 552B,采用新的 Causal-Encoder-Decoder 架构,并原生支持图片理解。官方称,模型在读取输入时仅激活 8B 参数、生成回答时激活 16B,以压低推理成本。DeepSeek 还表示,V4.1 Flash 在官方基准中已超过 V4 Pro,并同步上线 API,调用模型名已更新为 deepseek-flash。
80


