F's Blog
返回文章列表
··fish

DeepSeek-V4.1-Flash 登陆 Fireworks:以 1/15 的成本达到 Astra 级的 DeepSWE 水平

说明:本文为 Fireworks AI 官方 X 长文(@FireworksAI_HQ,2026 年 9 月 15 日发布)的全文中文翻译,原题为《DeepSeek-V4.1-Flash on Fireworks: Astra-level DeepSWE at 1/15th the cost》。译文力求忠实原文。


上周,Fireworks 发布了最新的 DeepSeek-V4.1-Flash。在将它投入一整套基准测试之后,结果显示,它在质量、速度、成本等关键权衡上树立了新的帕累托前沿。在 DeepSWE 上,它以每任务 1/15 的价格达到了 GPT-6 Astra 级别的编码准确率。

开发者们经常问我们:该如何挑选合适的模型?现实是,模型只是地图上的一个点,而你的应用是一整套系统。AI 的能力是参差不齐的(jagged)——一个模型可能在某类任务上表现出色,在另一类任务上却步履蹒跚。既然没有任何一个模型能在所有场景中取胜,工作负载设计的关键就在于把正确的模型匹配到正确的任务上:无论你需要的是低延迟处理,还是面向复杂推理的深度计算。

下面我们就来看看 DeepSeek-V4.1-Flash 在不同工作负载下的真实表现,以及它适合放进你技术栈的哪个位置。

DeepSeek 在 DeepSWE 帕累托前沿上的表现

我们评测了 DeepSWE 基准,观察各模型如何在准确率与每任务成本之间取得平衡。

在质量上,这四款模型属于同一梯队:它们在 DeepSWE 上的 pass@1 成绩全部落在 0.7 分 的范围之内,而我们测得的运行间波动为 1.4 到 3.2 分,所以这一组里没有任何模型在质量上明显领先。真正的分化完全体现在成本上:Fireworks 上的 DeepSeek-V4.1-Flash 以 每任务 0.43 美元 的价格提供了同样的准确率区间——成本仅为 Gemini 3.8 Flash 的 1/5.5、GPT-6 Astra 的 1/15、Claude Opus 5 的 1/28。

新的 DeepSeek-V4.1-Flash 从根本上改变了自主软件工程任务的单位经济学。在 GPT-6 Astra、Opus 5 这类昂贵的闭源模型上跑高迭代次数的 Agent 工作流、多轮 bug 扫描或大规模测试生成,会迅速烧穿工程预算。而在 每任务 0.43 美元 的价位上,前沿级的 SWE Agent 第一次可以作为持续运行的后台基础设施变得可行。有了 DeepSeek V4.1 Flash,一次 Astra 调用的钱,现在可以跑 15 次自主编码尝试

深入底层:全新的分离激活架构

DeepSeek-V4.1-Flash 是 DeepSeek 新架构家族中最小的模型,并带来了一些新的架构增强。

它是一个 552B 参数的 MoE 模型,采用了全新的编码器–解码器分离架构(encoder–decoder split)。在这种架构下,模型不再为整个前向传播过程设置单一的激活预算,而是把它拆成 输入侧 8B 激活参数输出侧 16B 激活参数。这一设计效率更高,让 token 花费更加经济。

这种不对称恰好契合编码 Agent 的运行方式。一条典型的 Agent 轨迹是极度“输入偏重”的:编码 Agent 往往要反复读取文件、反复读取自己的草稿板、反复读取工具输出,最后只输出一小段相对精简的补丁。在我们的 DeepSWE 运行中,模型每任务消耗 3690 万输入 token,而输出仅 21.1 万 token,比例高达 174:1。这种架构让开发者在通常占 token 大头的输入侧,把算力开销省下一半。

KV Cache 优化

与上一代 DeepSeek V4 相比,DeepSeek 提升了 DeepSeek-V4.1-Flash 的 KV Cache 利用率:HBM(显存)占用只需原来的 1/4,SSD 存储占用只需原来的 1/8

这项新的 KV Cache 优化为你的编码 Agent 带来了更好的经济学。以下是我们这次 DeepSWE 运行中的实际开销:

大多数人以为 Agent 的开销主要花在模型生成的内容上。然而在一个长时间运行的 Agent 循环里,大头花费其实来自反复读取同样的上下文。这种由重复任务造成的花费循环,使得 KV Cache 显存占用降低 4 倍对 token 支出的影响格外大——它直接瞄准了 Agent 设计中最大的成本驱动因素,在保住 74% 档 DeepSWE 分数的同时把成本压低了 15 倍。SSD 开销降低 8 倍则与 HBM 优化形成互补,让长轨迹中的缓存命中率保持在接近 99%

Terminal-Bench 2.1:质量只差 1 分,价格便宜 12 倍

在另一类任务上,我们看到了类似的情况——DeepSeek-V4.1-Flash 正以极低的成本逼近前沿水平。

Terminal-Bench 2.1 上的成绩与 Astra 只相差 1 分,但两者的经济学差异非常显著。DeepSeek-V4.1-Flash 平均消耗的输出 token 约为 Astra 的 4 倍,也就是说它“想”得更久、写得更多。单看输出定价,它就已经便宜了 20 倍。把未缓存输入、缓存命中和输出全部加总,DeepSeek-V4.1-Flash 在质量几乎相同的情况下,每任务成本低 12 倍

HLE 与“神谕路由”评测

我们运行的第三个基准是“人类最后的考试”(Humanity's Last Exam,简称 HLE),这是一个多模态基准,用于衡量大模型在研究生级学术科目上的能力极限。在这项测试中,我们还用“神谕路由”(oracle router)做了一些评测,方法与我们此前评测 Kimi K3 和 DeepSeek V4 Pro 时相同。简单回顾一下:神谕路由是一种测量理论最佳性能的方法——把任务分别交给每个模型运行,然后挑出成本最优的正确答案,以此确立成本与性能的上限。

在 HLE 上,DeepSeek-V4.1-Flash 单独运行时落后于 Astra。这说明,与 HLE 这类推理任务相比,DeepSeek 单独使用更适合 DeepSWE 这类 Agent 编码任务。如果你的工作负载只有高难度科学推理,这可能不是正确的选择。

真正有趣的结果来自神谕路由,它展示了路由与多模型系统的重要性。Astra 加 DeepSeek V4.1 的神谕路由组合,表现超过了单独的 GPT-6 Astra。这 4.4% 的差距之所以可能出现,是因为 V4.1-Flash 正确回答了一部分 Astra 会答错的题目:34.52% 并不是 50.40% 的子集——两个模型做错的题目并不相同。需要考虑的是,神谕路由代表的是你的应用可能达到的上限。真实的路由器未必能完全吃到这 4.4 个百分点的差距,但神谕路由展示了一种可能性:一组模型组成的系统可以超越单独一个 Astra 模型

开始使用 DeepSeek-V4.1-Flash

Fireworks 的 DeepSeek-V4.1-Flash 树立了新的成本–性能基线:以每任务 1/15 的成本,在编码准确率上比肩 GPT-6 Astra 等顶级模型。其 552B MoE 设计采用分离的输入/输出激活预算,并配合削减显存占用的 KV Cache 升级,为你的编码 Agent 带来更好的经济学。它在复杂学术推理上仍有差距(HLE 上 34.52%,Astra 为 50.40%),但由于它与 Astra 的错误分布并不重叠,把两者组成路由系统反而能超越单独的 Astra——而预算只是零头。

今天的上手方式:直接在 Fireworks Serverless 上使用 DeepSeek-V4.1-Flash,生产工作负载可使用专属容量(Dedicated Capacity)。面向受监管行业的美国本土托管端点即将推出,敬请关注。

如果你有兴趣,欢迎联系 Fireworks 团队获取后续的训练支持。

正在用它跑你自己的工作负载?他们很乐意听听你的体验——去原帖下方 @ 他们,告诉大家你在构建什么!


原文出处:DeepSeek-V4.1-Flash on Fireworks: Astra-level DeepSWE at 1/15th the cost(@FireworksAI_HQ,X 长文,2026-09-15)。本文为中文翻译,版权归原作者所有。