大家好 欢迎收看新一期视频 Deepseek刚刚发布了一个很有意思的更新 Deepseek V4 Flash官方API现已开启公测 新版本命名为Deepseek V4 Flash 0731 这可不只是一个小补丁 Deepseek表示他们大幅提升了智能体能力 在该模型上甚至 使其测试分数如今已远超V4 Pro预览版 也就是说 这个小模型现在击败了预览版 极大模型在智能体任务上的版本 这确实挺疯狂的 我也用我自己的Kinbench测试了它 而在我的基准测试中 它做到了 其他任何模型都未曾做到的事 包括Code 3.5 以及Opus稍后我们会细聊 但首先 我们先聊聊这次更新到底是什么 前阵子我介绍过DeepSeek V4 Pro 和V4 Flash的预览版 包括如何通过NVIDIA Link免费使用它们 视频链接已放在下方 我们先快速回顾一下Flash 它是V4系列中较小的模型 该混合专家模型拥有2000 0840亿的总参数量 约130亿激活参数 支持100万Token上下文窗口 它定位为主打快速 与低成本版本 而V4 Pro 是1.6万亿参数旗舰大模型 关于这次0731更新 有一个关键细节 DeepSea明确表示 V4Flash 0731 保持了完全相同的模型架构 和参数规模与预览版完全一致 所以它并没有变大 依然是 那款2840亿参数的Flash 但在此基础上 它似乎进行了高强度的智能体后训练 所有的性能提升都源于训练的优化 而不是增加参数量 他们还明确指出 这次升级仅是用于DeepSeek V4 Flash API V4 Pro API 以及App端D模型 和网页端目前都保持不变 公告最后提到 DeepSeek V4 Pro的正式版本 很快就会发布 所以这次Flash更新基本只是热身 真正的重头戏还在后头 另外 这次发布中还有一点 我觉得非常明智 官方V4Flash现在原生支持Response API格式 Dipsy还表示他已完全适配Codex 所以他们不仅是发布了一个模型 而不是被动等待工具链的适配 他们直接面向Codex适配框架进行了开发 这意味着你可以将其接入 到Codex风格的工作流中且毫无阻碍 GLM以及国内的其他一些实验室也在做 类似的框架适配 事实证明效果立竿见影 这确实是个明智之举 接下来看看官方的基准测试数据 这次性能提升太惊人了 在Terminal Bench 2.1测试中 新版Flash跑分高达82.7 而此前的预览版仅为61.8 甚至连V4 Pro预览版也只有72.1分 这也让它超越了81分的GLM40520 而且距离85分的OPUS差距并不大 要知道后者的价格可要贵得多 而最夸张的是SWBEC 预览版在这个测试中仅获得了7.3分 而新版本直接飙升到54.4分 实现了从基本无法使用 到足以于46.2分的GLM40520正面竞争的水平 甚至是58分的OPUS Cybergen也从38.7分 升至76.7分涂了冷验证机 从49.7分升至70.3分 在其内部DSBench测试集上 全战任务得分从37升至68.7 高难度编码智能体任务也 从25.8升至59.6 总的来说 这叫其自身的预览板有了巨大飞跃 且在大多数智能体基准测试中 它已逼近OPUS 4.8 而它作为一款尺寸小得多 且更便宜的模型 不过需要说明的是 Deep-C指出 在公开的编码智能体任务测试中 V4 Flash使用了 其即将推出的Deep-C Harness框架在极简模式下 以最高档位运行 且套采样设为0.95 温度参数设为一可见 测试框架的选择至关重要 测试结果可能不同 数据仅供参考 不过了解本频道的人都知道 我们从不只看官方宣传数据 所以我用自己的基准测试跑了一下 话不多说我们直接切入正题 和往常一样 我用我的TingBench进行了测试 其中涵盖了一些前端 与动画一些FreeJS任务以及SVG测试 一道数学题以及一个长城智能体任务 最后还有一个超难的3D任务 每项测试满分10分 最后我们会通过最终的图表来看看 看看它的表现与其他模型相比如何 第一题是电梯模拟 模型需要构建一个模拟程序 你可以在不同楼层生成乘客 共有三部电梯 其每部只能在一人 没赶上的人需要搭乘下一班电梯 还需要有提示框显示每个人的目标楼层 当鼠标悬停在他们身上时 我们发送提示词看看效果 这个表现只能算一半 得了五分基本框架是有了 但关于乘客没赶上电梯 并被下一班电梯接走的核心逻辑并没有完全跑通 而且动画也不够流畅 作为参考 只有OPUS模型在这项测试中拿过10分 而像CLUD3.5这样的模型 和KIMMYK3也只有9分 所以这开局只能算重归重矩 第二个测试是FreeJF隐形眼镜盒 它需要生成一个3D模型 是一个带有明显L和R标识盖子的隐形眼镜盒 并且点击盖子能够将其打开这项测试 几乎所有模型都会在这里翻车 我们发送过去看看 好的 这其实做得非常好 它拿到了8分 盒子看起来很像样 像个合格的眼镜盒L 而且L和二盖也清晰可见 点击打开的交互也有效 这让他与Quan2.5Maps并列 而Opus拿到了5分 是历史第二高分 在该测试中仅次于Plus 3.5 他仍然是唯一在这个测试中 拿到满分10分的模型 所以对于一个小模型来说 能有这样的表现已经非常惊艳了 第三题是 FreeJF折叠桌 这里有一个滑块 当你向右拖动它时 桌子应该展开 向左拖则折叠回去 动画需要无缝衔剑 且呈现出真正的3D效果 我们发送请求看看 这个得到了7分 桌子确实能折叠起来 并能随滑快拖动而展开 过度基本自然 只是还不够完全流畅 表现最好的模型 如Cloud 3.5 KIMI GLM4 以及Summit 3.5 在这项测试中都拿到了9分 但对比来看 Opus在这项测试中仅得了5分 所以这表现绝对算很不错了 第四题是生成熊猫的SVG 吃着汉堡 我们发送过去看看 好 这确实能看出是一只熊猫 也能看出是汉堡 但构图有点别扭 而且看起来不太像在吃汉堡 这题给五分 在这项测试中 像Pimi和Gemini 1.5这样表现最好的模型 以及Quain 2.5 Max得分也仅为8分 所以并不算惊艳 第五题是制作弓箭 模拟游戏里面设计了四个靶子 玩家需要以最短的时间击中所有靶子 从而登上排行榜 我们发送代码运行一下看看 这道题得了7分 核心射击机制可以正常运行 靶子能判定击中 排行榜功能也正常 但整体手感和细节打磨 还达不到顶尖模型的水平 比如Grog 1.5和Quang 2.5 Math 虽然Opus模型在这里都拿了满分 但这依然是个可玩的游戏 所以表现还算不错 第六题是一道数学难题 关于计算有序队的排列数 答应该是2460 很多模型在这一题上完全翻车 我们提交一下 看看 他完美答对了2460 完全正确 拿了满分10分 这让他机身同一梯队 与Cloud 3.5 Timmy Chat Queen Max 以及Opus模型并列 有趣的是 在我测试时 V4 Pro预览版也做对了这道题 所以V4系列的推理能力显然非常过瘾 第七题是一个复杂的长城任务 生成一个关于熊猫知识的数据集 并用该数据集为调一个GEM2B模型 接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识 全程从零开始完全自主完成 且完全在本地运行 我们启动任务看看效果 这次的表现绝对可以达满分 它生成了数据集并完成了整个微调 独自运行期间完全没有卡科 生成的Web UI正常运行 每次刷新都显示新的熊猫冷知识 这正是那种复杂的长程智能体任务 Deep C声称对其进行过针对性升级 说实话 效果显而易见 之前的预览版远没这么可靠 这波表现确实堪称完美 第八题也是最后一题 是制作一个3D万秒 要求是一个功能完整的3D万秒 能显示当前实际时间 秒针 分针 以及时针都要平滑转动 还要有日期 核心器显示 以及双时区 这是整个测试集中最难的一题 之前没有任何模型 能在这道题上拿到好成绩 历史最高分是Fibo5创下的 4分 让我们直接运行测试 但你感谢 Lip6 V4 Flav竟然拿到了6分 创下这道题历史记录 手表完整呈现出来 指针转动平滑 只能实时同步时间 双时区设置也基本正常 虽然还不完美 所以没能拿到更高的分数 但这个小模型刚刚击败了 Cloud 3.5 Opus 以及我测试集最难题目上的 其他所有前沿模型 这完全出乎我的意料 来看一下最终的图表 Deep Seek V4 Flash 0731 最终拿到了58分 得分率为72.5% 这让它排在 略高于GPT4O513的71.25% 稍低于Gemini 1.5 Pro的75% 而在它之上 有Kinning和 Opas并列77.5% GTT 450808达80% 接着是Quain Quain 2.5 Max拿下81.25% 而Cloud 3.5仍以82.5%稳居榜首 而对比以下背景 你就能明白这有多惊人 我之前测试Deep Seek V4 Pro预览版时 它在此测试中仅得了24.8% 新的Flash模型得分达到了72.5% 这意味着该系列的小模型现在 比大模型预览版的表现提升了近三倍 在我的测试中 而且在架构和尺寸与预览版相同 单靠后训练就能取得惊人提升 不可思议 这也印证了Deep Seed所宣称的Agent能力升级 从得分规律中也可以清楚地看到 所有射击推理 或长城Agent任务基本上都拿到了满分 比如数学和微调任务 还有创纪录的时钟生成常识 但像熊猫SVG这种纯视觉打磨的任务 还有电梯动画 在这些方面它的表现依然平平 所以这确实很像是一个 针对智能体编程深度微调的模型 正如官方基准测试所示 那么结论是什么 这绝对是目前性价比最高的模型之一 可用于智能体编程 在我的测试中 它的表现已经达到了Gemini 1.5 Pro的水平 它可以直接接入Cursor等代码工具 这得益于其API知识 而且Ditsig的价格 一直都非常便宜 如果你是学生 或者对于预算有限的开发者 这绝对是个极佳的选择 他显然还无法击败Cloud 3.5 或是在综合表现上超越OPUS 而且他的视觉能力依然表现平平 但考虑到他的体量和价格 这已经足够经验了 而且别忘了 这还仅仅是Flash版本 官方的DeepSick V4 Pro也即将发布 据官方介绍 如果将同样的智能体后训练应用 到1.6万亿参数的模型上 那对市面上昂贵的B元模型来说 将是降维打击般的存在 我会在上线后第一时间进行测试 尽情关注 总的来说 这非常酷