WEBVTT

00:00:00.000 --> 00:00:07.460
大家好 欢迎收看新一期视频

00:00:07.460 --> 00:00:10.720
Deepseek刚刚发布了一个很有意思的更新

00:00:10.720 --> 00:00:14.980
Deepseek V4 Flash官方API现已开启公测

00:00:14.980 --> 00:00:19.240
新版本命名为Deepseek V4 Flash 0731

00:00:19.240 --> 00:00:21.600
这可不只是一个小补丁

00:00:21.600 --> 00:00:25.000
Deepseek表示他们大幅提升了智能体能力

00:00:25.000 --> 00:00:27.180
在该模型上甚至

00:00:27.180 --> 00:00:30.600
使其测试分数如今已远超V4 Pro预览版

00:00:30.600 --> 00:00:31.780
也就是说

00:00:31.780 --> 00:00:33.980
这个小模型现在击败了预览版

00:00:33.980 --> 00:00:36.720
极大模型在智能体任务上的版本

00:00:36.720 --> 00:00:38.420
这确实挺疯狂的

00:00:38.420 --> 00:00:40.420
我也用我自己的Kinbench测试了它

00:00:40.420 --> 00:00:42.320
而在我的基准测试中

00:00:42.320 --> 00:00:43.040
它做到了

00:00:43.040 --> 00:00:45.200
其他任何模型都未曾做到的事

00:00:45.200 --> 00:00:46.400
包括Code 3.5

00:00:46.400 --> 00:00:48.360
以及Opus稍后我们会细聊

00:00:48.360 --> 00:00:48.860
但首先

00:00:48.860 --> 00:00:51.040
我们先聊聊这次更新到底是什么

00:00:51.040 --> 00:00:53.340
前阵子我介绍过DeepSeek V4 Pro

00:00:53.340 --> 00:00:55.120
和V4 Flash的预览版

00:00:55.120 --> 00:00:58.120
包括如何通过NVIDIA Link免费使用它们

00:00:58.120 --> 00:00:59.560
视频链接已放在下方

00:00:59.560 --> 00:01:00.940
我们先快速回顾一下Flash

00:01:00.940 --> 00:01:03.120
它是V4系列中较小的模型

00:01:03.120 --> 00:01:05.400
该混合专家模型拥有2000

00:01:05.400 --> 00:01:07.720
0840亿的总参数量

00:01:07.720 --> 00:01:09.660
约130亿激活参数

00:01:09.660 --> 00:01:12.000
支持100万Token上下文窗口

00:01:12.000 --> 00:01:13.780
它定位为主打快速

00:01:13.780 --> 00:01:15.180
与低成本版本

00:01:15.180 --> 00:01:15.900
而V4 Pro

00:01:15.900 --> 00:01:18.200
是1.6万亿参数旗舰大模型

00:01:18.200 --> 00:01:19.940
关于这次0731更新

00:01:19.940 --> 00:01:21.040
有一个关键细节

00:01:21.040 --> 00:01:22.500
DeepSea明确表示

00:01:22.500 --> 00:01:24.340
V4Flash 0731

00:01:24.340 --> 00:01:26.540
保持了完全相同的模型架构

00:01:26.540 --> 00:01:29.060
和参数规模与预览版完全一致

00:01:29.060 --> 00:01:30.700
所以它并没有变大

00:01:30.700 --> 00:01:31.300
依然是

00:01:31.300 --> 00:01:33.480
那款2840亿参数的Flash

00:01:33.480 --> 00:01:34.820
但在此基础上

00:01:34.820 --> 00:01:36.880
它似乎进行了高强度的智能体后训练

00:01:36.880 --> 00:01:39.640
所有的性能提升都源于训练的优化

00:01:39.640 --> 00:01:41.200
而不是增加参数量

00:01:41.200 --> 00:01:42.240
他们还明确指出

00:01:42.240 --> 00:01:45.040
这次升级仅是用于DeepSeek V4 Flash API

00:01:45.040 --> 00:01:46.480
V4 Pro API

00:01:46.480 --> 00:01:48.240
以及App端D模型

00:01:48.240 --> 00:01:50.120
和网页端目前都保持不变

00:01:50.120 --> 00:01:52.000
公告最后提到

00:01:52.000 --> 00:01:54.240
DeepSeek V4 Pro的正式版本

00:01:54.240 --> 00:01:55.960
很快就会发布

00:01:55.960 --> 00:01:58.240
所以这次Flash更新基本只是热身

00:01:58.240 --> 00:02:00.780
真正的重头戏还在后头

00:02:00.780 --> 00:02:01.720
另外

00:02:01.720 --> 00:02:03.260
这次发布中还有一点

00:02:03.260 --> 00:02:05.020
我觉得非常明智

00:02:05.020 --> 00:02:08.940
官方V4Flash现在原生支持Response API格式

00:02:08.940 --> 00:02:11.620
Dipsy还表示他已完全适配Codex

00:02:11.620 --> 00:02:13.820
所以他们不仅是发布了一个模型

00:02:13.820 --> 00:02:15.880
而不是被动等待工具链的适配

00:02:15.880 --> 00:02:18.280
他们直接面向Codex适配框架进行了开发

00:02:18.280 --> 00:02:20.320
这意味着你可以将其接入

00:02:20.320 --> 00:02:22.980
到Codex风格的工作流中且毫无阻碍

00:02:22.980 --> 00:02:25.740
GLM以及国内的其他一些实验室也在做

00:02:25.740 --> 00:02:26.940
类似的框架适配

00:02:26.940 --> 00:02:28.840
事实证明效果立竿见影

00:02:28.840 --> 00:02:30.100
这确实是个明智之举

00:02:30.100 --> 00:02:32.440
接下来看看官方的基准测试数据

00:02:32.440 --> 00:02:33.820
这次性能提升太惊人了

00:02:33.820 --> 00:02:35.180
在Terminal Bench 2.1测试中

00:02:35.180 --> 00:02:37.440
新版Flash跑分高达82.7

00:02:37.440 --> 00:02:39.960
而此前的预览版仅为61.8

00:02:39.960 --> 00:02:42.980
甚至连V4 Pro预览版也只有72.1分

00:02:42.980 --> 00:02:46.260
这也让它超越了81分的GLM40520

00:02:46.260 --> 00:02:49.160
而且距离85分的OPUS差距并不大

00:02:49.160 --> 00:02:51.300
要知道后者的价格可要贵得多

00:02:51.300 --> 00:02:52.800
而最夸张的是SWBEC

00:02:52.980 --> 00:02:55.580
预览版在这个测试中仅获得了7.3分

00:02:55.580 --> 00:02:58.040
而新版本直接飙升到54.4分

00:02:58.040 --> 00:02:59.900
实现了从基本无法使用

00:02:59.900 --> 00:03:03.900
到足以于46.2分的GLM40520正面竞争的水平

00:03:03.900 --> 00:03:05.920
甚至是58分的OPUS

00:03:05.920 --> 00:03:08.140
Cybergen也从38.7分

00:03:08.140 --> 00:03:10.680
升至76.7分涂了冷验证机

00:03:10.680 --> 00:03:13.280
从49.7分升至70.3分

00:03:13.280 --> 00:03:15.500
在其内部DSBench测试集上

00:03:15.500 --> 00:03:18.260
全战任务得分从37升至68.7

00:03:18.260 --> 00:03:20.380
高难度编码智能体任务也

00:03:20.380 --> 00:03:22.740
从25.8升至59.6

00:03:22.740 --> 00:03:23.800
总的来说

00:03:23.800 --> 00:03:25.840
这叫其自身的预览板有了巨大飞跃

00:03:25.840 --> 00:03:28.200
且在大多数智能体基准测试中

00:03:28.200 --> 00:03:29.820
它已逼近OPUS 4.8

00:03:29.820 --> 00:03:31.820
而它作为一款尺寸小得多

00:03:31.820 --> 00:03:33.160
且更便宜的模型

00:03:33.160 --> 00:03:34.100
不过需要说明的是

00:03:34.100 --> 00:03:35.120
Deep-C指出

00:03:35.120 --> 00:03:36.820
在公开的编码智能体任务测试中

00:03:36.820 --> 00:03:38.380
V4 Flash使用了

00:03:38.380 --> 00:03:41.360
其即将推出的Deep-C Harness框架在极简模式下

00:03:41.360 --> 00:03:42.760
以最高档位运行

00:03:42.760 --> 00:03:44.120
且套采样设为0.95

00:03:44.120 --> 00:03:45.840
温度参数设为一可见

00:03:45.840 --> 00:03:47.500
测试框架的选择至关重要

00:03:47.500 --> 00:03:49.000
测试结果可能不同

00:03:49.000 --> 00:03:50.580
数据仅供参考

00:03:50.580 --> 00:03:52.660
不过了解本频道的人都知道

00:03:52.660 --> 00:03:54.640
我们从不只看官方宣传数据

00:03:54.640 --> 00:03:56.380
所以我用自己的基准测试跑了一下

00:03:56.380 --> 00:03:58.360
话不多说我们直接切入正题

00:03:58.360 --> 00:03:59.440
和往常一样

00:03:59.440 --> 00:04:00.860
我用我的TingBench进行了测试

00:04:00.860 --> 00:04:02.400
其中涵盖了一些前端

00:04:02.400 --> 00:04:05.200
与动画一些FreeJS任务以及SVG测试

00:04:05.200 --> 00:04:08.780
一道数学题以及一个长城智能体任务

00:04:08.780 --> 00:04:10.720
最后还有一个超难的3D任务

00:04:10.720 --> 00:04:12.500
每项测试满分10分

00:04:12.500 --> 00:04:15.280
最后我们会通过最终的图表来看看

00:04:15.280 --> 00:04:18.060
看看它的表现与其他模型相比如何

00:04:18.060 --> 00:04:19.880
第一题是电梯模拟

00:04:19.880 --> 00:04:22.300
模型需要构建一个模拟程序

00:04:22.300 --> 00:04:24.520
你可以在不同楼层生成乘客

00:04:24.520 --> 00:04:26.020
共有三部电梯

00:04:26.020 --> 00:04:27.500
其每部只能在一人

00:04:27.500 --> 00:04:29.980
没赶上的人需要搭乘下一班电梯

00:04:29.980 --> 00:04:32.760
还需要有提示框显示每个人的目标楼层

00:04:32.760 --> 00:04:34.720
当鼠标悬停在他们身上时

00:04:34.720 --> 00:04:36.500
我们发送提示词看看效果

00:04:36.500 --> 00:04:38.020
这个表现只能算一半

00:04:38.020 --> 00:04:40.000
得了五分基本框架是有了

00:04:40.000 --> 00:04:42.020
但关于乘客没赶上电梯

00:04:42.020 --> 00:04:44.620
并被下一班电梯接走的核心逻辑并没有完全跑通

00:04:44.620 --> 00:04:46.500
而且动画也不够流畅

00:04:46.500 --> 00:04:47.360
作为参考

00:04:47.360 --> 00:04:49.860
只有OPUS模型在这项测试中拿过10分

00:04:49.860 --> 00:04:51.800
而像CLUD3.5这样的模型

00:04:51.800 --> 00:04:53.620
和KIMMYK3也只有9分

00:04:53.620 --> 00:04:55.540
所以这开局只能算重归重矩

00:04:55.540 --> 00:04:58.640
第二个测试是FreeJF隐形眼镜盒

00:04:58.640 --> 00:05:01.240
它需要生成一个3D模型

00:05:01.240 --> 00:05:04.940
是一个带有明显L和R标识盖子的隐形眼镜盒

00:05:04.940 --> 00:05:08.660
并且点击盖子能够将其打开这项测试

00:05:08.660 --> 00:05:11.280
几乎所有模型都会在这里翻车

00:05:11.280 --> 00:05:12.480
我们发送过去看看

00:05:12.480 --> 00:05:14.800
好的 这其实做得非常好

00:05:14.800 --> 00:05:16.140
它拿到了8分

00:05:16.140 --> 00:05:17.880
盒子看起来很像样

00:05:17.880 --> 00:05:19.300
像个合格的眼镜盒L

00:05:19.300 --> 00:05:21.800
而且L和二盖也清晰可见

00:05:21.800 --> 00:05:23.240
点击打开的交互也有效

00:05:23.240 --> 00:05:25.080
这让他与Quan2.5Maps并列

00:05:25.080 --> 00:05:26.420
而Opus拿到了5分

00:05:26.420 --> 00:05:27.340
是历史第二高分

00:05:27.340 --> 00:05:29.520
在该测试中仅次于Plus 3.5

00:05:29.520 --> 00:05:31.140
他仍然是唯一在这个测试中

00:05:31.140 --> 00:05:32.180
拿到满分10分的模型

00:05:32.180 --> 00:05:33.860
所以对于一个小模型来说

00:05:33.860 --> 00:05:35.640
能有这样的表现已经非常惊艳了

00:05:35.640 --> 00:05:37.120
第三题是

00:05:37.120 --> 00:05:38.580
FreeJF折叠桌

00:05:38.580 --> 00:05:39.860
这里有一个滑块

00:05:39.860 --> 00:05:42.040
当你向右拖动它时

00:05:42.040 --> 00:05:43.400
桌子应该展开

00:05:43.400 --> 00:05:44.780
向左拖则折叠回去

00:05:44.780 --> 00:05:46.480
动画需要无缝衔剑

00:05:46.480 --> 00:05:48.500
且呈现出真正的3D效果

00:05:48.500 --> 00:05:49.780
我们发送请求看看

00:05:49.780 --> 00:05:51.260
这个得到了7分

00:05:51.260 --> 00:05:52.780
桌子确实能折叠起来

00:05:52.780 --> 00:05:55.220
并能随滑快拖动而展开

00:05:55.220 --> 00:05:56.820
过度基本自然

00:05:56.820 --> 00:05:58.400
只是还不够完全流畅

00:05:58.400 --> 00:06:00.160
表现最好的模型

00:06:00.160 --> 00:06:01.160
如Cloud 3.5

00:06:01.160 --> 00:06:02.340
KIMI GLM4

00:06:02.340 --> 00:06:03.800
以及Summit 3.5

00:06:03.800 --> 00:06:05.440
在这项测试中都拿到了9分

00:06:05.440 --> 00:06:06.640
但对比来看

00:06:06.640 --> 00:06:08.460
Opus在这项测试中仅得了5分

00:06:08.460 --> 00:06:10.740
所以这表现绝对算很不错了

00:06:10.740 --> 00:06:13.060
第四题是生成熊猫的SVG

00:06:13.060 --> 00:06:14.220
吃着汉堡

00:06:14.220 --> 00:06:15.420
我们发送过去看看

00:06:15.420 --> 00:06:16.500
好

00:06:16.500 --> 00:06:18.620
这确实能看出是一只熊猫

00:06:18.620 --> 00:06:20.420
也能看出是汉堡

00:06:20.420 --> 00:06:21.860
但构图有点别扭

00:06:21.860 --> 00:06:24.620
而且看起来不太像在吃汉堡

00:06:24.620 --> 00:06:26.020
这题给五分

00:06:26.020 --> 00:06:28.000
在这项测试中

00:06:28.000 --> 00:06:31.600
像Pimi和Gemini 1.5这样表现最好的模型

00:06:31.600 --> 00:06:35.240
以及Quain 2.5 Max得分也仅为8分

00:06:35.240 --> 00:06:37.340
所以并不算惊艳

00:06:37.340 --> 00:06:39.180
第五题是制作弓箭

00:06:39.180 --> 00:06:41.940
模拟游戏里面设计了四个靶子

00:06:41.940 --> 00:06:44.700
玩家需要以最短的时间击中所有靶子

00:06:44.700 --> 00:06:46.120
从而登上排行榜

00:06:46.120 --> 00:06:47.740
我们发送代码运行一下看看

00:06:47.740 --> 00:06:49.140
这道题得了7分

00:06:49.140 --> 00:06:50.960
核心射击机制可以正常运行

00:06:50.960 --> 00:06:52.660
靶子能判定击中

00:06:52.660 --> 00:06:54.040
排行榜功能也正常

00:06:54.040 --> 00:06:56.200
但整体手感和细节打磨

00:06:56.200 --> 00:06:57.840
还达不到顶尖模型的水平

00:06:57.840 --> 00:07:00.740
比如Grog 1.5和Quang 2.5 Math

00:07:00.740 --> 00:07:03.560
虽然Opus模型在这里都拿了满分

00:07:03.560 --> 00:07:05.100
但这依然是个可玩的游戏

00:07:05.100 --> 00:07:06.960
所以表现还算不错

00:07:06.960 --> 00:07:09.240
第六题是一道数学难题

00:07:09.240 --> 00:07:11.320
关于计算有序队的排列数

00:07:11.320 --> 00:07:13.300
答应该是2460

00:07:13.300 --> 00:07:15.740
很多模型在这一题上完全翻车

00:07:15.740 --> 00:07:16.620
我们提交一下

00:07:16.620 --> 00:07:17.700
看看

00:07:17.700 --> 00:07:19.860
他完美答对了2460

00:07:19.860 --> 00:07:21.420
完全正确

00:07:21.420 --> 00:07:22.640
拿了满分10分

00:07:22.640 --> 00:07:24.300
这让他机身同一梯队

00:07:24.300 --> 00:07:26.160
与Cloud 3.5

00:07:26.160 --> 00:07:26.800
Timmy Chat

00:07:26.800 --> 00:07:28.060
Queen Max

00:07:28.060 --> 00:07:29.400
以及Opus模型并列

00:07:29.400 --> 00:07:30.060
有趣的是

00:07:30.060 --> 00:07:31.600
在我测试时

00:07:31.600 --> 00:07:33.760
V4 Pro预览版也做对了这道题

00:07:33.760 --> 00:07:37.320
所以V4系列的推理能力显然非常过瘾

00:07:37.320 --> 00:07:40.600
第七题是一个复杂的长城任务

00:07:40.600 --> 00:07:43.580
生成一个关于熊猫知识的数据集

00:07:43.580 --> 00:07:46.880
并用该数据集为调一个GEM2B模型

00:07:46.880 --> 00:07:51.240
接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识

00:07:51.240 --> 00:07:53.500
全程从零开始完全自主完成

00:07:53.500 --> 00:07:55.180
且完全在本地运行

00:07:55.180 --> 00:07:56.500
我们启动任务看看效果

00:07:56.500 --> 00:07:58.560
这次的表现绝对可以达满分

00:07:58.560 --> 00:08:01.040
它生成了数据集并完成了整个微调

00:08:01.040 --> 00:08:03.260
独自运行期间完全没有卡科

00:08:03.672 --> 00:08:05.532
生成的Web UI正常运行

00:08:05.532 --> 00:08:08.052
每次刷新都显示新的熊猫冷知识

00:08:08.052 --> 00:08:11.372
这正是那种复杂的长程智能体任务

00:08:11.372 --> 00:08:13.392
Deep C声称对其进行过针对性升级

00:08:13.392 --> 00:08:14.472
说实话

00:08:14.472 --> 00:08:15.432
效果显而易见

00:08:15.432 --> 00:08:17.192
之前的预览版远没这么可靠

00:08:17.192 --> 00:08:19.372
这波表现确实堪称完美

00:08:19.372 --> 00:08:21.032
第八题也是最后一题

00:08:21.032 --> 00:08:22.112
是制作一个3D万秒

00:08:22.112 --> 00:08:23.992
要求是一个功能完整的3D万秒

00:08:23.992 --> 00:08:25.392
能显示当前实际时间

00:08:25.392 --> 00:08:26.312
秒针 分针

00:08:26.312 --> 00:08:27.832
以及时针都要平滑转动

00:08:27.832 --> 00:08:28.492
还要有日期

00:08:28.492 --> 00:08:29.492
核心器显示

00:08:29.492 --> 00:08:30.112
以及双时区

00:08:30.112 --> 00:08:31.632
这是整个测试集中最难的一题

00:08:31.632 --> 00:08:33.172
之前没有任何模型

00:08:33.172 --> 00:08:34.572
能在这道题上拿到好成绩

00:08:34.572 --> 00:08:36.712
历史最高分是Fibo5创下的

00:08:36.712 --> 00:08:37.452
4分

00:08:37.452 --> 00:08:38.612
让我们直接运行测试

00:08:38.612 --> 00:08:39.672
但你感谢

00:08:39.672 --> 00:08:41.572
Lip6 V4 Flav竟然拿到了6分

00:08:41.572 --> 00:08:43.212
创下这道题历史记录

00:08:43.212 --> 00:08:44.772
手表完整呈现出来

00:08:47.192 --> 00:08:48.272
指针转动平滑

00:08:48.272 --> 00:08:49.552
只能实时同步时间

00:08:49.552 --> 00:08:51.352
双时区设置也基本正常

00:08:51.352 --> 00:08:52.172
虽然还不完美

00:08:52.172 --> 00:08:54.152
所以没能拿到更高的分数

00:08:54.152 --> 00:08:56.112
但这个小模型刚刚击败了

00:08:56.112 --> 00:08:57.092
Cloud 3.5 Opus

00:08:57.092 --> 00:08:59.272
以及我测试集最难题目上的

00:08:59.272 --> 00:09:00.332
其他所有前沿模型

00:09:00.332 --> 00:09:02.092
这完全出乎我的意料

00:09:02.092 --> 00:09:03.892
来看一下最终的图表

00:09:03.892 --> 00:09:05.932
Deep Seek V4 Flash 0731

00:09:05.932 --> 00:09:07.912
最终拿到了58分

00:09:07.912 --> 00:09:10.052
得分率为72.5%

00:09:10.052 --> 00:09:10.712
这让它排在

00:09:10.712 --> 00:09:15.272
略高于GPT4O513的71.25%

00:09:15.272 --> 00:09:18.852
稍低于Gemini 1.5 Pro的75%

00:09:18.852 --> 00:09:19.752
而在它之上

00:09:19.752 --> 00:09:21.172
有Kinning和

00:09:21.172 --> 00:09:23.352
Opas并列77.5%

00:09:23.352 --> 00:09:25.192
GTT 450808达80%

00:09:25.192 --> 00:09:25.832
接着是Quain

00:09:25.832 --> 00:09:29.152
Quain 2.5 Max拿下81.25%

00:09:29.152 --> 00:09:32.032
而Cloud 3.5仍以82.5%稳居榜首

00:09:32.032 --> 00:09:33.572
而对比以下背景

00:09:33.572 --> 00:09:35.092
你就能明白这有多惊人

00:09:35.092 --> 00:09:37.732
我之前测试Deep Seek V4 Pro预览版时

00:09:37.732 --> 00:09:40.532
它在此测试中仅得了24.8%

00:09:40.532 --> 00:09:44.092
新的Flash模型得分达到了72.5%

00:09:44.092 --> 00:09:45.892
这意味着该系列的小模型现在

00:09:45.892 --> 00:09:48.472
比大模型预览版的表现提升了近三倍

00:09:48.472 --> 00:09:49.872
在我的测试中

00:09:49.872 --> 00:09:52.572
而且在架构和尺寸与预览版相同

00:09:52.572 --> 00:09:54.892
单靠后训练就能取得惊人提升

00:09:54.892 --> 00:09:55.472
不可思议

00:09:55.472 --> 00:09:59.052
这也印证了Deep Seed所宣称的Agent能力升级

00:09:59.052 --> 00:10:01.932
从得分规律中也可以清楚地看到

00:10:01.932 --> 00:10:03.712
所有射击推理

00:10:03.712 --> 00:10:06.892
或长城Agent任务基本上都拿到了满分

00:10:06.892 --> 00:10:09.292
比如数学和微调任务

00:10:09.292 --> 00:10:11.532
还有创纪录的时钟生成常识

00:10:11.532 --> 00:10:14.112
但像熊猫SVG这种纯视觉打磨的任务

00:10:14.112 --> 00:10:15.252
还有电梯动画

00:10:15.252 --> 00:10:16.892
在这些方面它的表现依然平平

00:10:16.892 --> 00:10:18.592
所以这确实很像是一个

00:10:18.592 --> 00:10:20.372
针对智能体编程深度微调的模型

00:10:20.372 --> 00:10:22.292
正如官方基准测试所示

00:10:22.292 --> 00:10:23.292
那么结论是什么

00:10:23.292 --> 00:10:25.532
这绝对是目前性价比最高的模型之一

00:10:25.532 --> 00:10:26.772
可用于智能体编程

00:10:26.772 --> 00:10:27.792
在我的测试中

00:10:27.792 --> 00:10:29.692
它的表现已经达到了Gemini 1.5 Pro的水平

00:10:29.692 --> 00:10:32.012
它可以直接接入Cursor等代码工具

00:10:32.012 --> 00:10:33.392
这得益于其API知识

00:10:33.392 --> 00:10:34.972
而且Ditsig的价格

00:10:34.972 --> 00:10:36.312
一直都非常便宜

00:10:36.312 --> 00:10:37.112
如果你是学生

00:10:37.112 --> 00:10:39.092
或者对于预算有限的开发者

00:10:39.092 --> 00:10:40.412
这绝对是个极佳的选择

00:10:40.412 --> 00:10:42.612
他显然还无法击败Cloud 3.5

00:10:42.612 --> 00:10:44.572
或是在综合表现上超越OPUS

00:10:44.572 --> 00:10:46.672
而且他的视觉能力依然表现平平

00:10:46.672 --> 00:10:48.252
但考虑到他的体量和价格

00:10:48.252 --> 00:10:49.292
这已经足够经验了

00:10:49.292 --> 00:10:50.032
而且别忘了

00:10:50.032 --> 00:10:51.672
这还仅仅是Flash版本

00:10:51.672 --> 00:10:53.412
官方的DeepSick V4 Pro也即将发布

00:10:53.412 --> 00:10:54.652
据官方介绍

00:10:54.652 --> 00:10:56.492
如果将同样的智能体后训练应用

00:10:56.492 --> 00:10:58.452
到1.6万亿参数的模型上

00:10:58.452 --> 00:11:00.452
那对市面上昂贵的B元模型来说

00:11:00.452 --> 00:11:01.812
将是降维打击般的存在

00:11:01.812 --> 00:11:03.932
我会在上线后第一时间进行测试

00:11:03.932 --> 00:11:04.592
尽情关注

00:11:04.592 --> 00:11:05.692
总的来说

00:11:05.692 --> 00:11:06.432
这非常酷
