PChome 9月10日消息,DeepSeek正式推出V4.1 Flash,并同步在API上线。新模型总参数552B,采用MoE与Causal-Encoder-Decoder非对称结构,输入侧激活约8B、输出侧激活约16B。
PChome 9月10日消息,DeepSeek正式推出V4.1 Flash,并同步在API上线。新模型总参数552B,采用MoE与Causal-Encoder-Decoder非对称结构,输入侧激活约8B、输出侧激活约16B,定位“小成本跑大任务”,原生具备视觉理解能力,不再依赖外挂视觉模块处理图文请求。

成本端是本轮重点。官方称KV Cache较上一代压缩明显,HBM需求降至1/4、SSD降至1/8;若对照初代架构,累计缩小约437倍。对长上下文、Agent反复调用缓存的场景,存储和命中费用会直接下降。基准方面,Terminal-Bench 2.1达90.6、DeepSWE v1.1为74.2、Automation-Bench为54.8,代码与自动化代理任务表现接近或优于其V4 Pro版本。

调用层面,API模型名改为deepseek-flash即可;旧deepseek-v4-flash、vision-exp暂路由至新模型。9月14日12:00后,deepseek-v4-pro请求也将转接V4.1 Flash并按新价计费。新价9月10日12:00生效,峰谷分时:空闲输入缓存命中0.02元、未命中1元、输出4元/百万token;高峰翻倍,工作日9—12点、14—18点为高峰。腾讯WorkBuddy、CodeBuddy及OpenCode已接入,模型权重与技术报告在HuggingFace发布,面向具备大规模GPU和存储的部署方开放适配。