DeepSeek-V4-Flash 正式版跑分报告:约 98% 缓存命中打造 AI 极致性价比
4 小时前 / 阅读约4分钟
来源:IT之家
DeepSeek-V4-Flash正式版API上线公测,在AI基准测试中表现优异,智能指数获50分,单任务成本比GPT-5.6 Luna低约60%,在Frontend Code Arena榜单中重塑排名,性价比高。

IT之家 8 月 1 日消息,深度求索(DeepSeek)昨日(7 月 31 日)通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测。@ArtificialAnlys、@arena 等 AI 跑分基准平台今天(8 月 1 日)同步更新了相关基准测试结果。

@ArtificialAnlys (Artificial Analysis)

@ArtificialAnlys (Artificial Analysis) 是一家领先的国际独立 AI 基准测试与分析机构,专门针对大语言模型(LLM)、视频生成、AI 音乐等多领域进行无偏见的性能与托管成本评估。

其中,Artificial Analysis Intelligence Index(智能指数)是最核心的综合性技术基准,用来全面衡量 AI 模型的绝对智能水平并追踪技术演进。

报告指出 DeepSeek V4 Flash 0731 在人工智能分析智能指数 (AII) 中获得 50 分,比 DeepSeek V4 Flash(2026 年 4 月发布)高出 10 分,比 DeepSeek V4 Pro 高出 6 分。

DeepSeek V4 Flash 0731 的智能指数比 GPT-5.6 Luna(最高 51 分)低 1 分。即使 OpenAI 今天将 GPT-5.6 Luna 的价格下调了 80%,DeepSeek V4 Flash 0731 在其自有 API 上的单任务成本仍然比 GPT-5.6 Luna(最高 51 分)低约 60%。

造成这一差异的关键因素是 DeepSeek 为其自有 API 提供了约 98% 的缓存命中折扣,这一折扣力度远超业内大多数厂商提供的 90% 缓存命中折扣。

@arena (Arena.ai)

@arena (Arena.ai) 是当前全球 AI 行业最权威的“人类偏好”大模型即时对战与评测平台。它源自著名的 LMSYS Chatbot Arena 团队,采用类似国际象棋的 Elo 积分系统,通过纯粹的人类开发者双盲盲测(Blind A/B Testing)来对全球 AI 模型进行高强度的淘汰赛排名。

在其细分榜单中,Frontend Code Arena(前端代码竞技场,又称 WebDev Arena)是目前评估大模型网页开发、前端工程与 Agent 级自动化编码能力的黄金标准与行业风向标。

报告称 DeepSeek-V4-Flash-High 以 1586 分的成绩重塑了 Frontend Code Arena 跑分榜单。

每个 MToken 的价格为 0.14 美元(IT之家注:现汇率约合 0.95 元人民币)/0.28 美元(现汇率约合 1.9 元人民币),是同类产品中性价比最高的。

在前端代码领域,它的总排名为第 7,开放类别的排名第 3!在各个类别中,它在消费产品领域排名第 4,在基于参考的设计、数据与分析、游戏领域排名第 6,在品牌与营销领域排名第 7。

与 DeepSeek-V4-Flash-High-Preview 相比,这是一个显著的提升,性能提高了 154 分。而与 DeepSeek-V4-Pro-Preview 相比,提升幅度更大,达到了 121 分。

和其它模型对比

IT之家查询 X 平台,发现有不少开发者分享了使用 DeepSeek-V4-Flash 正式版的对比视频:

DeepSeek-V4-Flash 和 GPT-5.6 Luna 模型的视频对比

DeepSeek-V4-Flash 和 GPT-5.6 Luna 模型的视频对比

DeepSeek-V4-Flash 和 GPT-5.6 Luna 模型的视频对比

DeepSeek-V4-Flash 和 Kimi K3 模型的视频对比