實際影片長度:7:58.000。原文、繁中、雙語可點擊句子跳轉影片。
0:00.166–0:02.866
据说 DeepSeek Harness 这个 AI 工具
0:02.866–0:04.266
刚发布两天
0:04.333–0:05.866
就有高手挖出了
0:05.866–0:08.300
一个核弹级邪修玩法
0:08.500–0:10.166
只要切换到极简模式
0:10.333–0:13.433
DeepSeek 模型的性能就会瞬间暴增
0:13.566–0:16.133
甚至做到了 Fable 5 级别的效果
0:16.433–0:17.500
真的假的
0:17.566–0:18.666
你们信吗
0:18.966–0:21.366
有评论区的朋友叫我试试看
0:21.700–0:22.833
试试就逝世
0:23.466–0:25.100
打开 DeepSeek Harness
0:25.100–0:27.266
默认使用的是标准模式
0:27.300–0:30.333
会给模型提供 AI 工具该有的能力
0:30.400–0:32.300
你就把它当 Codex 用
0:32.400–0:34.666
而极简模式就朴素多了
0:34.666–0:37.866
只给模型提供一个能持续运行的终端
0:37.933–0:39.733
加一个文件编辑器
0:39.800–0:41.766
其他的能力全部关掉
0:42.166–0:44.066
我先让 DeepSeek V4 Pro
0:44.066–0:46.666
开发 3D 第一人称射击游戏
0:46.933–0:48.133
同一套提示词
0:48.133–0:50.100
我先用标准模式跑了一遍
0:50.133–0:52.100
再用极简模式跑了一遍
0:52.600–0:53.600
标准模式下
0:53.600–0:55.000
AI 调用了技能
0:55.066–0:56.800
中间有很多文字输出
0:56.800–0:59.066
会告诉你 AI 在想什么
0:59.066–1:00.166
准备干什么
1:00.300–1:03.400
就是我们日常使用 AI 编程工具的那种感觉
1:03.933–1:06.433
而极简模式只有思考 终端
1:06.433–1:09.133
和字符串替换这个工具调用
1:09.266–1:11.533
中间没有任何多余的输出
1:11.866–1:14.166
AI 就像个哑巴一样
1:14.933–1:17.366
标准模式跑完用了 50 步
1:17.566–1:19.800
AI 自己检测并修复了 Bug
1:19.933–1:21.900
总共花了 33 分钟
1:22.366–1:24.766
极简模式跑完用了 77 步
1:24.966–1:27.266
总共只花了 23 分钟
1:27.600–1:30.000
比标准模式快了 10 分钟
1:30.333–1:34.500
但是输入 Tokens 反而比标准模式多了 70 万
1:34.966–1:36.400
再看看成品效果
1:36.600–1:39.500
标准模式做出来的游戏体验非常顺畅
1:39.733–1:43.333
移动 跳跃 疾跑 射击 杀敌都是 OK 的
1:43.400–1:45.900
甚至还可以用 CF 里的二段跳
1:46.366–1:48.666
但是敌人不能发射子弹
1:48.666–1:49.933
只能追着你跑
1:49.966–1:51.366
没有什么压迫感
1:51.400–1:52.700
而且还有个 Bug
1:52.966–1:54.766
敌人追着我跑了一会之后
1:54.766–1:56.266
就被我吓跑了
1:56.666–1:59.066
我提示词里好像没有这么要求啊
1:59.100–2:00.300
这合理吗
2:00.666–2:02.566
如果你被人机给锤死了
2:02.566–2:04.500
还会触发倒地效果
2:04.666–2:07.366
视角跟真人倒在地上一模一样
2:07.500–2:09.200
哎 这个细节做的不错
2:09.733–2:11.166
再看看极简模式
2:11.366–2:13.966
它的界面比标准模式做得更简洁
2:14.266–2:15.866
背景墙也更真实
2:16.000–2:18.366
各种功能同样都是正常的
2:18.566–2:20.600
而且敌人能够发射子弹
2:20.800–2:22.100
感觉更智能
2:22.133–2:23.933
游玩的压迫感也更强
2:24.500–2:26.000
不过被击倒的时候
2:26.000–2:27.933
我的身体还是站立着的
2:27.933–2:31.866
跟标准模式那个倒地视角相比就差点意思了
2:32.400–2:33.866
从成品效果来看
2:33.866–2:35.466
两者半斤八两吧
2:35.466–2:36.400
各有优缺
2:36.700–2:38.466
但是从耗时来看
2:38.533–2:40.966
极简模式快了整整 10 分钟
2:41.333–2:43.533
虽然输入 Tokens 多了一点
2:43.533–2:46.266
可缓存命中率接近 100%
2:46.300–2:48.933
这点差距的费用基本可以忽略
2:49.300–2:50.366
所以这一局
2:50.366–2:52.966
我会觉得极简模式略胜一筹
2:53.533–2:54.566
第二轮测试
2:54.566–2:58.100
我让 AI 开发一个 AI 宠物领养系统
2:58.400–3:00.200
这个任务需要从电脑文件中
3:00.200–3:02.433
获取 DeepSeek 的模型密钥
3:02.566–3:04.866
还需要联网搜索图片并下载
3:04.933–3:06.766
开发完整的前端和后端
3:06.866–3:08.500
调用 AI 模型能力
3:08.900–3:09.900
看看结果
3:09.966–3:11.933
标准模式跑了 59 步
3:11.966–3:13.800
总共耗时 49 分钟
3:14.166–3:17.866
关键是它成功找到了我电脑上的模型密钥
3:18.066–3:19.600
全程没让我插手
3:19.600–3:21.100
直接交付了成品
3:21.766–3:23.666
极简模式跑了 87 步
3:23.700–3:26.066
总共只耗时不到 28 分钟
3:26.133–3:28.700
比标准模式快了 21 分钟
3:28.933–3:30.666
Tokens 消耗也差不多
3:31.000–3:34.166
但是它没能从我电脑上找到模型密钥
3:34.266–3:35.933
最后还是得我自己填
3:36.000–3:37.933
可交付性就差了一些
3:38.400–3:40.100
看看标准模式的成果
3:40.266–3:41.933
整体布局还是不错的
3:42.000–3:43.800
宠物卡片的排版很舒服
3:44.100–3:46.000
嗯 但也没有到惊艳的程度
3:46.200–3:49.700
而且右上方那行提示文字的位置没有对齐
3:50.166–3:53.266
不过 AI 顺利完成了抓取鲸鱼娘图片
3:53.333–3:56.533
并且调用 AI 大模型来生成文案的任务
3:57.266–4:00.100
点击就可以领养你想要的鲸鱼娘了
4:00.333–4:03.400
被领养走的小鲸鱼卡片样式会发生变化
4:03.500–4:05.166
还可以通过筛选功能
4:05.166–4:07.166
快速找到已领养的宠物
4:07.766–4:09.666
再来看看极简模式的效果
4:09.733–4:13.000
我得先手动填写模型密钥来运行程序
4:13.500–4:15.266
主页面效果也还 OK
4:15.366–4:17.900
看起来跟标准模式做的差不多
4:17.966–4:19.366
毕竟是同一种模型
4:20.100–4:22.400
功能也都是可以正常使用的
4:22.533–4:24.733
但是实用性上差了一截
4:24.900–4:26.766
没有做任何筛选功能
4:26.800–4:29.600
你看不到自己到底领养过哪些宠物
4:30.100–4:33.900
而且卡片上的信息也比标准模式简陋很多
4:34.000–4:37.766
还有右上角那个「AI 文案 DeepSeek 已生成」
4:38.133–4:41.266
怎么看都不像是面向用户的正经产品吧
4:41.733–4:43.133
OK 就测试到这里
4:43.166–4:46.300
大家猜一猜上面 4 次任务加起来
4:46.300–4:48.100
总共花了多少米呢
4:48.766–4:50.466
答案是 3 块
4:50.666–4:52.066
你觉得贵不贵
4:52.533–4:54.366
涨价前最后的倔强啊
4:58.433–4:59.333
整体来看
4:59.333–5:02.133
极简模式最大的优点是执行速度快
5:02.166–5:04.233
说话直截了当不绕弯子
5:04.333–5:07.766
这是因为不需要装载太多工具到上下文
5:07.966–5:11.600
AI 也不用纠结选择哪些工具来执行任务
5:11.800–5:13.966
AI 的注意力可以保持集中
5:14.300–5:16.233
从执行速度的角度来看
5:16.233–5:17.533
说是性能暴增
5:17.533–5:19.000
我觉得没啥问题
5:19.233–5:21.300
但它的短板也很明显
5:21.433–5:24.100
整个过程 AI 几乎不跟你汇报
5:24.133–5:25.800
你不知道它在干什么
5:26.033–5:28.133
没办法直接通过工具联网
5:28.133–5:30.533
还要通过终端脚本另辟蹊径
5:30.900–5:33.700
如果你的任务强依赖某个特定工具
5:33.800–5:35.133
比如理解图片
5:35.300–5:38.033
那么整个差距会被进一步放大
5:38.433–5:41.166
其实官方对极简模式的定位也很清楚
5:41.333–5:44.200
就是专门来跑模型基准测试的
5:44.333–5:46.700
所以把环境削到最干净
5:46.733–5:50.433
好让不同的模型能在同一个标准下公平比较
5:51.000–5:51.933
也就是说
5:51.966–5:54.900
极简模式根本不是给人干活用的
5:54.900–5:56.966
是给模型考试用的
5:57.233–6:00.133
虽然它最后交出来的功能可以正常运行
6:00.233–6:02.966
但是细节和完整度都差了一截
6:03.100–6:04.900
说是能对标 Fable 5
6:04.900–6:06.500
我觉得还是有点夸张了
6:07.200–6:09.766
本来我以为故事到这里就结束了
6:09.900–6:11.766
极简模式跑分虽然猛
6:11.933–6:13.300
但是并不实用
6:13.400–6:15.100
想要好的交付质量
6:15.133–6:17.566
还是得老老实实用标准模式
6:18.133–6:21.333
但是某位大神自己写了一个插件
6:21.433–6:23.966
能做到在完整保留标准模式
6:23.966–6:26.300
那 20 多个工具的前提下
6:26.366–6:29.500
跑分还略微反超了极简模式
6:30.033–6:32.800
作者发现 DeepSeek V4 Pro
6:32.800–6:35.066
对首轮请求的工具结构极其敏感
6:35.566–6:38.233
你第一轮就把 20 多个工具全甩给它
6:38.400–6:39.600
它就会犯迷糊
6:39.833–6:42.333
但如果第一轮沿用极简模式
6:42.333–6:43.800
那句系统提示词
6:44.133–6:47.166
并且只给终端和读文件这两个工具
6:47.300–6:51.166
让模型先用极简模式的思维链进入状态
6:51.433–6:53.766
等第一次工具调用完成之后
6:53.800–6:56.633
再立刻把全部工具恢复回来
6:56.700–6:58.133
跑分就上来了
6:58.300–7:00.800
这大概也是为什么 DeepSeek Harness
7:01.000–7:03.300
被称为 DeepSeek 的角色专武
7:03.500–7:05.600
能让它发挥出更好的效果
7:06.100–7:08.000
我觉得这个发现很有价值
7:08.133–7:10.166
它揭示了一个更深的问题
7:10.366–7:12.166
像 V4 Pro 这样的模型
7:12.300–7:14.166
能力能不能被释放出来
7:14.200–7:17.033
很大程度上取决于你给它的接口
7:17.033–7:19.733
跟它训练时见过的那套像不像
7:20.100–7:21.766
未来 Harness 的优化方向
7:21.766–7:23.900
可能不是给 AI 更多工具
7:23.933–7:25.300
或者砍掉工具
7:25.500–7:29.333
而是搞清楚怎么在启动阶段对齐训练分布
7:29.733–7:32.133
唤醒模型最强的执行状态
7:32.233–7:34.533
然后再释放完整能力
7:34.933–7:36.400
学会了 学废了
7:36.400–7:38.433
感兴趣的同学可以试试看
7:39.233–7:40.633
OK 就分享到这里
7:40.633–7:41.900
本期视频的文字版
7:41.900–7:45.200
会收录到我免费开源的 AI 编程零基础入门教程
7:45.300–7:46.000
上千张图
7:46.000–7:46.433
几十万字
7:46.433–7:47.333
带你从 0 开始
7:47.333–7:48.600
快速学会 AI 编程
7:48.600–7:49.500
做出自己的产品
7:49.500–7:50.700
跑通变现全流程
7:50.700–7:51.500
一次拿捏
7:51.833–7:54.233
我是持续分享 AI 编程干货的鱼皮
7:54.233–7:55.400
欢迎点赞关注
7:55.400–7:57.633
助力俺冲击百万哦 感谢
0:00.166–0:02.866
据说 DeepSeek Harness 这个 AI 工具
0:02.866–0:04.266
刚发布两天
0:04.333–0:05.866
就有高手挖出了
0:05.866–0:08.300
一个核弹级邪修玩法
0:08.500–0:10.166
只要切换到极简模式
0:10.333–0:13.433
DeepSeek 模型的性能就会瞬间暴增
0:13.566–0:16.133
甚至做到了 Fable 5 级别的效果
0:16.433–0:17.500
真的假的
0:17.566–0:18.666
你们信吗
0:18.966–0:21.366
有评论区的朋友叫我试试看
0:21.700–0:22.833
试试就逝世
0:23.466–0:25.100
打开 DeepSeek Harness
0:25.100–0:27.266
默认使用的是标准模式
0:27.300–0:30.333
会给模型提供 AI 工具该有的能力
0:30.400–0:32.300
你就把它当 Codex 用
0:32.400–0:34.666
而极简模式就朴素多了
0:34.666–0:37.866
只给模型提供一个能持续运行的终端
0:37.933–0:39.733
加一个文件编辑器
0:39.800–0:41.766
其他的能力全部关掉
0:42.166–0:44.066
我先让 DeepSeek V4 Pro
0:44.066–0:46.666
开发 3D 第一人称射击游戏
0:46.933–0:48.133
同一套提示词
0:48.133–0:50.100
我先用标准模式跑了一遍
0:50.133–0:52.100
再用极简模式跑了一遍
0:52.600–0:53.600
标准模式下
0:53.600–0:55.000
AI 调用了技能
0:55.066–0:56.800
中间有很多文字输出
0:56.800–0:59.066
会告诉你 AI 在想什么
0:59.066–1:00.166
准备干什么
1:00.300–1:03.400
就是我们日常使用 AI 编程工具的那种感觉
1:03.933–1:06.433
而极简模式只有思考 终端
1:06.433–1:09.133
和字符串替换这个工具调用
1:09.266–1:11.533
中间没有任何多余的输出
1:11.866–1:14.166
AI 就像个哑巴一样
1:14.933–1:17.366
标准模式跑完用了 50 步
1:17.566–1:19.800
AI 自己检测并修复了 Bug
1:19.933–1:21.900
总共花了 33 分钟
1:22.366–1:24.766
极简模式跑完用了 77 步
1:24.966–1:27.266
总共只花了 23 分钟
1:27.600–1:30.000
比标准模式快了 10 分钟
1:30.333–1:34.500
但是输入 Tokens 反而比标准模式多了 70 万
1:34.966–1:36.400
再看看成品效果
1:36.600–1:39.500
标准模式做出来的游戏体验非常顺畅
1:39.733–1:43.333
移动 跳跃 疾跑 射击 杀敌都是 OK 的
1:43.400–1:45.900
甚至还可以用 CF 里的二段跳
1:46.366–1:48.666
但是敌人不能发射子弹
1:48.666–1:49.933
只能追着你跑
1:49.966–1:51.366
没有什么压迫感
1:51.400–1:52.700
而且还有个 Bug
1:52.966–1:54.766
敌人追着我跑了一会之后
1:54.766–1:56.266
就被我吓跑了
1:56.666–1:59.066
我提示词里好像没有这么要求啊
1:59.100–2:00.300
这合理吗
2:00.666–2:02.566
如果你被人机给锤死了
2:02.566–2:04.500
还会触发倒地效果
2:04.666–2:07.366
视角跟真人倒在地上一模一样
2:07.500–2:09.200
哎 这个细节做的不错
2:09.733–2:11.166
再看看极简模式
2:11.366–2:13.966
它的界面比标准模式做得更简洁
2:14.266–2:15.866
背景墙也更真实
2:16.000–2:18.366
各种功能同样都是正常的
2:18.566–2:20.600
而且敌人能够发射子弹
2:20.800–2:22.100
感觉更智能
2:22.133–2:23.933
游玩的压迫感也更强
2:24.500–2:26.000
不过被击倒的时候
2:26.000–2:27.933
我的身体还是站立着的
2:27.933–2:31.866
跟标准模式那个倒地视角相比就差点意思了
2:32.400–2:33.866
从成品效果来看
2:33.866–2:35.466
两者半斤八两吧
2:35.466–2:36.400
各有优缺
2:36.700–2:38.466
但是从耗时来看
2:38.533–2:40.966
极简模式快了整整 10 分钟
2:41.333–2:43.533
虽然输入 Tokens 多了一点
2:43.533–2:46.266
可缓存命中率接近 100%
2:46.300–2:48.933
这点差距的费用基本可以忽略
2:49.300–2:50.366
所以这一局
2:50.366–2:52.966
我会觉得极简模式略胜一筹
2:53.533–2:54.566
第二轮测试
2:54.566–2:58.100
我让 AI 开发一个 AI 宠物领养系统
2:58.400–3:00.200
这个任务需要从电脑文件中
3:00.200–3:02.433
获取 DeepSeek 的模型密钥
3:02.566–3:04.866
还需要联网搜索图片并下载
3:04.933–3:06.766
开发完整的前端和后端
3:06.866–3:08.500
调用 AI 模型能力
3:08.900–3:09.900
看看结果
3:09.966–3:11.933
标准模式跑了 59 步
3:11.966–3:13.800
总共耗时 49 分钟
3:14.166–3:17.866
关键是它成功找到了我电脑上的模型密钥
3:18.066–3:19.600
全程没让我插手
3:19.600–3:21.100
直接交付了成品
3:21.766–3:23.666
极简模式跑了 87 步
3:23.700–3:26.066
总共只耗时不到 28 分钟
3:26.133–3:28.700
比标准模式快了 21 分钟
3:28.933–3:30.666
Tokens 消耗也差不多
3:31.000–3:34.166
但是它没能从我电脑上找到模型密钥
3:34.266–3:35.933
最后还是得我自己填
3:36.000–3:37.933
可交付性就差了一些
3:38.400–3:40.100
看看标准模式的成果
3:40.266–3:41.933
整体布局还是不错的
3:42.000–3:43.800
宠物卡片的排版很舒服
3:44.100–3:46.000
嗯 但也没有到惊艳的程度
3:46.200–3:49.700
而且右上方那行提示文字的位置没有对齐
3:50.166–3:53.266
不过 AI 顺利完成了抓取鲸鱼娘图片
3:53.333–3:56.533
并且调用 AI 大模型来生成文案的任务
3:57.266–4:00.100
点击就可以领养你想要的鲸鱼娘了
4:00.333–4:03.400
被领养走的小鲸鱼卡片样式会发生变化
4:03.500–4:05.166
还可以通过筛选功能
4:05.166–4:07.166
快速找到已领养的宠物
4:07.766–4:09.666
再来看看极简模式的效果
4:09.733–4:13.000
我得先手动填写模型密钥来运行程序
4:13.500–4:15.266
主页面效果也还 OK
4:15.366–4:17.900
看起来跟标准模式做的差不多
4:17.966–4:19.366
毕竟是同一种模型
4:20.100–4:22.400
功能也都是可以正常使用的
4:22.533–4:24.733
但是实用性上差了一截
4:24.900–4:26.766
没有做任何筛选功能
4:26.800–4:29.600
你看不到自己到底领养过哪些宠物
4:30.100–4:33.900
而且卡片上的信息也比标准模式简陋很多
4:34.000–4:37.766
还有右上角那个「AI 文案 DeepSeek 已生成」
4:38.133–4:41.266
怎么看都不像是面向用户的正经产品吧
4:41.733–4:43.133
OK 就测试到这里
4:43.166–4:46.300
大家猜一猜上面 4 次任务加起来
4:46.300–4:48.100
总共花了多少米呢
4:48.766–4:50.466
答案是 3 块
4:50.666–4:52.066
你觉得贵不贵
4:52.533–4:54.366
涨价前最后的倔强啊
4:58.433–4:59.333
整体来看
4:59.333–5:02.133
极简模式最大的优点是执行速度快
5:02.166–5:04.233
说话直截了当不绕弯子
5:04.333–5:07.766
这是因为不需要装载太多工具到上下文
5:07.966–5:11.600
AI 也不用纠结选择哪些工具来执行任务
5:11.800–5:13.966
AI 的注意力可以保持集中
5:14.300–5:16.233
从执行速度的角度来看
5:16.233–5:17.533
说是性能暴增
5:17.533–5:19.000
我觉得没啥问题
5:19.233–5:21.300
但它的短板也很明显
5:21.433–5:24.100
整个过程 AI 几乎不跟你汇报
5:24.133–5:25.800
你不知道它在干什么
5:26.033–5:28.133
没办法直接通过工具联网
5:28.133–5:30.533
还要通过终端脚本另辟蹊径
5:30.900–5:33.700
如果你的任务强依赖某个特定工具
5:33.800–5:35.133
比如理解图片
5:35.300–5:38.033
那么整个差距会被进一步放大
5:38.433–5:41.166
其实官方对极简模式的定位也很清楚
5:41.333–5:44.200
就是专门来跑模型基准测试的
5:44.333–5:46.700
所以把环境削到最干净
5:46.733–5:50.433
好让不同的模型能在同一个标准下公平比较
5:51.000–5:51.933
也就是说
5:51.966–5:54.900
极简模式根本不是给人干活用的
5:54.900–5:56.966
是给模型考试用的
5:57.233–6:00.133
虽然它最后交出来的功能可以正常运行
6:00.233–6:02.966
但是细节和完整度都差了一截
6:03.100–6:04.900
说是能对标 Fable 5
6:04.900–6:06.500
我觉得还是有点夸张了
6:07.200–6:09.766
本来我以为故事到这里就结束了
6:09.900–6:11.766
极简模式跑分虽然猛
6:11.933–6:13.300
但是并不实用
6:13.400–6:15.100
想要好的交付质量
6:15.133–6:17.566
还是得老老实实用标准模式
6:18.133–6:21.333
但是某位大神自己写了一个插件
6:21.433–6:23.966
能做到在完整保留标准模式
6:23.966–6:26.300
那 20 多个工具的前提下
6:26.366–6:29.500
跑分还略微反超了极简模式
6:30.033–6:32.800
作者发现 DeepSeek V4 Pro
6:32.800–6:35.066
对首轮请求的工具结构极其敏感
6:35.566–6:38.233
你第一轮就把 20 多个工具全甩给它
6:38.400–6:39.600
它就会犯迷糊
6:39.833–6:42.333
但如果第一轮沿用极简模式
6:42.333–6:43.800
那句系统提示词
6:44.133–6:47.166
并且只给终端和读文件这两个工具
6:47.300–6:51.166
让模型先用极简模式的思维链进入状态
6:51.433–6:53.766
等第一次工具调用完成之后
6:53.800–6:56.633
再立刻把全部工具恢复回来
6:56.700–6:58.133
跑分就上来了
6:58.300–7:00.800
这大概也是为什么 DeepSeek Harness
7:01.000–7:03.300
被称为 DeepSeek 的角色专武
7:03.500–7:05.600
能让它发挥出更好的效果
7:06.100–7:08.000
我觉得这个发现很有价值
7:08.133–7:10.166
它揭示了一个更深的问题
7:10.366–7:12.166
像 V4 Pro 这样的模型
7:12.300–7:14.166
能力能不能被释放出来
7:14.200–7:17.033
很大程度上取决于你给它的接口
7:17.033–7:19.733
跟它训练时见过的那套像不像
7:20.100–7:21.766
未来 Harness 的优化方向
7:21.766–7:23.900
可能不是给 AI 更多工具
7:23.933–7:25.300
或者砍掉工具
7:25.500–7:29.333
而是搞清楚怎么在启动阶段对齐训练分布
7:29.733–7:32.133
唤醒模型最强的执行状态
7:32.233–7:34.533
然后再释放完整能力
7:34.933–7:36.400
学会了 学废了
7:36.400–7:38.433
感兴趣的同学可以试试看
7:39.233–7:40.633
OK 就分享到这里
7:40.633–7:41.900
本期视频的文字版
7:41.900–7:45.200
会收录到我免费开源的 AI 编程零基础入门教程
7:45.300–7:46.000
上千张图
7:46.000–7:46.433
几十万字
7:46.433–7:47.333
带你从 0 开始
7:47.333–7:48.600
快速学会 AI 编程
7:48.600–7:49.500
做出自己的产品
7:49.500–7:50.700
跑通变现全流程
7:50.700–7:51.500
一次拿捏
7:51.833–7:54.233
我是持续分享 AI 编程干货的鱼皮
7:54.233–7:55.400
欢迎点赞关注
7:55.400–7:57.633
助力俺冲击百万哦 感谢
0:00.166–0:02.866
据说 DeepSeek Harness 这个 AI 工具
据说 DeepSeek Harness 这个 AI 工具
0:02.866–0:04.266
刚发布两天
刚发布两天
0:04.333–0:05.866
就有高手挖出了
就有高手挖出了
0:05.866–0:08.300
一个核弹级邪修玩法
一个核弹级邪修玩法
0:08.500–0:10.166
只要切换到极简模式
只要切换到极简模式
0:10.333–0:13.433
DeepSeek 模型的性能就会瞬间暴增
DeepSeek 模型的性能就会瞬间暴增
0:13.566–0:16.133
甚至做到了 Fable 5 级别的效果
甚至做到了 Fable 5 级别的效果
0:16.433–0:17.500
真的假的
真的假的
0:17.566–0:18.666
你们信吗
你们信吗
0:18.966–0:21.366
有评论区的朋友叫我试试看
有评论区的朋友叫我试试看
0:21.700–0:22.833
试试就逝世
试试就逝世
0:23.466–0:25.100
打开 DeepSeek Harness
打开 DeepSeek Harness
0:25.100–0:27.266
默认使用的是标准模式
默认使用的是标准模式
0:27.300–0:30.333
会给模型提供 AI 工具该有的能力
会给模型提供 AI 工具该有的能力
0:30.400–0:32.300
你就把它当 Codex 用
你就把它当 Codex 用
0:32.400–0:34.666
而极简模式就朴素多了
而极简模式就朴素多了
0:34.666–0:37.866
只给模型提供一个能持续运行的终端
只给模型提供一个能持续运行的终端
0:37.933–0:39.733
加一个文件编辑器
加一个文件编辑器
0:39.800–0:41.766
其他的能力全部关掉
其他的能力全部关掉
0:42.166–0:44.066
我先让 DeepSeek V4 Pro
我先让 DeepSeek V4 Pro
0:44.066–0:46.666
开发 3D 第一人称射击游戏
开发 3D 第一人称射击游戏
0:46.933–0:48.133
同一套提示词
同一套提示词
0:48.133–0:50.100
我先用标准模式跑了一遍
我先用标准模式跑了一遍
0:50.133–0:52.100
再用极简模式跑了一遍
再用极简模式跑了一遍
0:52.600–0:53.600
标准模式下
标准模式下
0:53.600–0:55.000
AI 调用了技能
AI 调用了技能
0:55.066–0:56.800
中间有很多文字输出
中间有很多文字输出
0:56.800–0:59.066
会告诉你 AI 在想什么
会告诉你 AI 在想什么
0:59.066–1:00.166
准备干什么
准备干什么
1:00.300–1:03.400
就是我们日常使用 AI 编程工具的那种感觉
就是我们日常使用 AI 编程工具的那种感觉
1:03.933–1:06.433
而极简模式只有思考 终端
而极简模式只有思考 终端
1:06.433–1:09.133
和字符串替换这个工具调用
和字符串替换这个工具调用
1:09.266–1:11.533
中间没有任何多余的输出
中间没有任何多余的输出
1:11.866–1:14.166
AI 就像个哑巴一样
AI 就像个哑巴一样
1:14.933–1:17.366
标准模式跑完用了 50 步
标准模式跑完用了 50 步
1:17.566–1:19.800
AI 自己检测并修复了 Bug
AI 自己检测并修复了 Bug
1:19.933–1:21.900
总共花了 33 分钟
总共花了 33 分钟
1:22.366–1:24.766
极简模式跑完用了 77 步
极简模式跑完用了 77 步
1:24.966–1:27.266
总共只花了 23 分钟
总共只花了 23 分钟
1:27.600–1:30.000
比标准模式快了 10 分钟
比标准模式快了 10 分钟
1:30.333–1:34.500
但是输入 Tokens 反而比标准模式多了 70 万
但是输入 Tokens 反而比标准模式多了 70 万
1:34.966–1:36.400
再看看成品效果
再看看成品效果
1:36.600–1:39.500
标准模式做出来的游戏体验非常顺畅
标准模式做出来的游戏体验非常顺畅
1:39.733–1:43.333
移动 跳跃 疾跑 射击 杀敌都是 OK 的
移动 跳跃 疾跑 射击 杀敌都是 OK 的
1:43.400–1:45.900
甚至还可以用 CF 里的二段跳
甚至还可以用 CF 里的二段跳
1:46.366–1:48.666
但是敌人不能发射子弹
但是敌人不能发射子弹
1:48.666–1:49.933
只能追着你跑
只能追着你跑
1:49.966–1:51.366
没有什么压迫感
没有什么压迫感
1:51.400–1:52.700
而且还有个 Bug
而且还有个 Bug
1:52.966–1:54.766
敌人追着我跑了一会之后
敌人追着我跑了一会之后
1:54.766–1:56.266
就被我吓跑了
就被我吓跑了
1:56.666–1:59.066
我提示词里好像没有这么要求啊
我提示词里好像没有这么要求啊
1:59.100–2:00.300
这合理吗
这合理吗
2:00.666–2:02.566
如果你被人机给锤死了
如果你被人机给锤死了
2:02.566–2:04.500
还会触发倒地效果
还会触发倒地效果
2:04.666–2:07.366
视角跟真人倒在地上一模一样
视角跟真人倒在地上一模一样
2:07.500–2:09.200
哎 这个细节做的不错
哎 这个细节做的不错
2:09.733–2:11.166
再看看极简模式
再看看极简模式
2:11.366–2:13.966
它的界面比标准模式做得更简洁
它的界面比标准模式做得更简洁
2:14.266–2:15.866
背景墙也更真实
背景墙也更真实
2:16.000–2:18.366
各种功能同样都是正常的
各种功能同样都是正常的
2:18.566–2:20.600
而且敌人能够发射子弹
而且敌人能够发射子弹
2:20.800–2:22.100
感觉更智能
感觉更智能
2:22.133–2:23.933
游玩的压迫感也更强
游玩的压迫感也更强
2:24.500–2:26.000
不过被击倒的时候
不过被击倒的时候
2:26.000–2:27.933
我的身体还是站立着的
我的身体还是站立着的
2:27.933–2:31.866
跟标准模式那个倒地视角相比就差点意思了
跟标准模式那个倒地视角相比就差点意思了
2:32.400–2:33.866
从成品效果来看
从成品效果来看
2:33.866–2:35.466
两者半斤八两吧
两者半斤八两吧
2:35.466–2:36.400
各有优缺
各有优缺
2:36.700–2:38.466
但是从耗时来看
但是从耗时来看
2:38.533–2:40.966
极简模式快了整整 10 分钟
极简模式快了整整 10 分钟
2:41.333–2:43.533
虽然输入 Tokens 多了一点
虽然输入 Tokens 多了一点
2:43.533–2:46.266
可缓存命中率接近 100%
可缓存命中率接近 100%
2:46.300–2:48.933
这点差距的费用基本可以忽略
这点差距的费用基本可以忽略
2:49.300–2:50.366
所以这一局
所以这一局
2:50.366–2:52.966
我会觉得极简模式略胜一筹
我会觉得极简模式略胜一筹
2:53.533–2:54.566
第二轮测试
第二轮测试
2:54.566–2:58.100
我让 AI 开发一个 AI 宠物领养系统
我让 AI 开发一个 AI 宠物领养系统
2:58.400–3:00.200
这个任务需要从电脑文件中
这个任务需要从电脑文件中
3:00.200–3:02.433
获取 DeepSeek 的模型密钥
获取 DeepSeek 的模型密钥
3:02.566–3:04.866
还需要联网搜索图片并下载
还需要联网搜索图片并下载
3:04.933–3:06.766
开发完整的前端和后端
开发完整的前端和后端
3:06.866–3:08.500
调用 AI 模型能力
调用 AI 模型能力
3:08.900–3:09.900
看看结果
看看结果
3:09.966–3:11.933
标准模式跑了 59 步
标准模式跑了 59 步
3:11.966–3:13.800
总共耗时 49 分钟
总共耗时 49 分钟
3:14.166–3:17.866
关键是它成功找到了我电脑上的模型密钥
关键是它成功找到了我电脑上的模型密钥
3:18.066–3:19.600
全程没让我插手
全程没让我插手
3:19.600–3:21.100
直接交付了成品
直接交付了成品
3:21.766–3:23.666
极简模式跑了 87 步
极简模式跑了 87 步
3:23.700–3:26.066
总共只耗时不到 28 分钟
总共只耗时不到 28 分钟
3:26.133–3:28.700
比标准模式快了 21 分钟
比标准模式快了 21 分钟
3:28.933–3:30.666
Tokens 消耗也差不多
Tokens 消耗也差不多
3:31.000–3:34.166
但是它没能从我电脑上找到模型密钥
但是它没能从我电脑上找到模型密钥
3:34.266–3:35.933
最后还是得我自己填
最后还是得我自己填
3:36.000–3:37.933
可交付性就差了一些
可交付性就差了一些
3:38.400–3:40.100
看看标准模式的成果
看看标准模式的成果
3:40.266–3:41.933
整体布局还是不错的
整体布局还是不错的
3:42.000–3:43.800
宠物卡片的排版很舒服
宠物卡片的排版很舒服
3:44.100–3:46.000
嗯 但也没有到惊艳的程度
嗯 但也没有到惊艳的程度
3:46.200–3:49.700
而且右上方那行提示文字的位置没有对齐
而且右上方那行提示文字的位置没有对齐
3:50.166–3:53.266
不过 AI 顺利完成了抓取鲸鱼娘图片
不过 AI 顺利完成了抓取鲸鱼娘图片
3:53.333–3:56.533
并且调用 AI 大模型来生成文案的任务
并且调用 AI 大模型来生成文案的任务
3:57.266–4:00.100
点击就可以领养你想要的鲸鱼娘了
点击就可以领养你想要的鲸鱼娘了
4:00.333–4:03.400
被领养走的小鲸鱼卡片样式会发生变化
被领养走的小鲸鱼卡片样式会发生变化
4:03.500–4:05.166
还可以通过筛选功能
还可以通过筛选功能
4:05.166–4:07.166
快速找到已领养的宠物
快速找到已领养的宠物
4:07.766–4:09.666
再来看看极简模式的效果
再来看看极简模式的效果
4:09.733–4:13.000
我得先手动填写模型密钥来运行程序
我得先手动填写模型密钥来运行程序
4:13.500–4:15.266
主页面效果也还 OK
主页面效果也还 OK
4:15.366–4:17.900
看起来跟标准模式做的差不多
看起来跟标准模式做的差不多
4:17.966–4:19.366
毕竟是同一种模型
毕竟是同一种模型
4:20.100–4:22.400
功能也都是可以正常使用的
功能也都是可以正常使用的
4:22.533–4:24.733
但是实用性上差了一截
但是实用性上差了一截
4:24.900–4:26.766
没有做任何筛选功能
没有做任何筛选功能
4:26.800–4:29.600
你看不到自己到底领养过哪些宠物
你看不到自己到底领养过哪些宠物
4:30.100–4:33.900
而且卡片上的信息也比标准模式简陋很多
而且卡片上的信息也比标准模式简陋很多
4:34.000–4:37.766
还有右上角那个「AI 文案 DeepSeek 已生成」
还有右上角那个「AI 文案 DeepSeek 已生成」
4:38.133–4:41.266
怎么看都不像是面向用户的正经产品吧
怎么看都不像是面向用户的正经产品吧
4:41.733–4:43.133
OK 就测试到这里
OK 就测试到这里
4:43.166–4:46.300
大家猜一猜上面 4 次任务加起来
大家猜一猜上面 4 次任务加起来
4:46.300–4:48.100
总共花了多少米呢
总共花了多少米呢
4:48.766–4:50.466
答案是 3 块
答案是 3 块
4:50.666–4:52.066
你觉得贵不贵
你觉得贵不贵
4:52.533–4:54.366
涨价前最后的倔强啊
涨价前最后的倔强啊
4:58.433–4:59.333
整体来看
整体来看
4:59.333–5:02.133
极简模式最大的优点是执行速度快
极简模式最大的优点是执行速度快
5:02.166–5:04.233
说话直截了当不绕弯子
说话直截了当不绕弯子
5:04.333–5:07.766
这是因为不需要装载太多工具到上下文
这是因为不需要装载太多工具到上下文
5:07.966–5:11.600
AI 也不用纠结选择哪些工具来执行任务
AI 也不用纠结选择哪些工具来执行任务
5:11.800–5:13.966
AI 的注意力可以保持集中
AI 的注意力可以保持集中
5:14.300–5:16.233
从执行速度的角度来看
从执行速度的角度来看
5:16.233–5:17.533
说是性能暴增
说是性能暴增
5:17.533–5:19.000
我觉得没啥问题
我觉得没啥问题
5:19.233–5:21.300
但它的短板也很明显
但它的短板也很明显
5:21.433–5:24.100
整个过程 AI 几乎不跟你汇报
整个过程 AI 几乎不跟你汇报
5:24.133–5:25.800
你不知道它在干什么
你不知道它在干什么
5:26.033–5:28.133
没办法直接通过工具联网
没办法直接通过工具联网
5:28.133–5:30.533
还要通过终端脚本另辟蹊径
还要通过终端脚本另辟蹊径
5:30.900–5:33.700
如果你的任务强依赖某个特定工具
如果你的任务强依赖某个特定工具
5:33.800–5:35.133
比如理解图片
比如理解图片
5:35.300–5:38.033
那么整个差距会被进一步放大
那么整个差距会被进一步放大
5:38.433–5:41.166
其实官方对极简模式的定位也很清楚
其实官方对极简模式的定位也很清楚
5:41.333–5:44.200
就是专门来跑模型基准测试的
就是专门来跑模型基准测试的
5:44.333–5:46.700
所以把环境削到最干净
所以把环境削到最干净
5:46.733–5:50.433
好让不同的模型能在同一个标准下公平比较
好让不同的模型能在同一个标准下公平比较
5:51.000–5:51.933
也就是说
也就是说
5:51.966–5:54.900
极简模式根本不是给人干活用的
极简模式根本不是给人干活用的
5:54.900–5:56.966
是给模型考试用的
是给模型考试用的
5:57.233–6:00.133
虽然它最后交出来的功能可以正常运行
虽然它最后交出来的功能可以正常运行
6:00.233–6:02.966
但是细节和完整度都差了一截
但是细节和完整度都差了一截
6:03.100–6:04.900
说是能对标 Fable 5
说是能对标 Fable 5
6:04.900–6:06.500
我觉得还是有点夸张了
我觉得还是有点夸张了
6:07.200–6:09.766
本来我以为故事到这里就结束了
本来我以为故事到这里就结束了
6:09.900–6:11.766
极简模式跑分虽然猛
极简模式跑分虽然猛
6:11.933–6:13.300
但是并不实用
但是并不实用
6:13.400–6:15.100
想要好的交付质量
想要好的交付质量
6:15.133–6:17.566
还是得老老实实用标准模式
还是得老老实实用标准模式
6:18.133–6:21.333
但是某位大神自己写了一个插件
但是某位大神自己写了一个插件
6:21.433–6:23.966
能做到在完整保留标准模式
能做到在完整保留标准模式
6:23.966–6:26.300
那 20 多个工具的前提下
那 20 多个工具的前提下
6:26.366–6:29.500
跑分还略微反超了极简模式
跑分还略微反超了极简模式
6:30.033–6:32.800
作者发现 DeepSeek V4 Pro
作者发现 DeepSeek V4 Pro
6:32.800–6:35.066
对首轮请求的工具结构极其敏感
对首轮请求的工具结构极其敏感
6:35.566–6:38.233
你第一轮就把 20 多个工具全甩给它
你第一轮就把 20 多个工具全甩给它
6:38.400–6:39.600
它就会犯迷糊
它就会犯迷糊
6:39.833–6:42.333
但如果第一轮沿用极简模式
但如果第一轮沿用极简模式
6:42.333–6:43.800
那句系统提示词
那句系统提示词
6:44.133–6:47.166
并且只给终端和读文件这两个工具
并且只给终端和读文件这两个工具
6:47.300–6:51.166
让模型先用极简模式的思维链进入状态
让模型先用极简模式的思维链进入状态
6:51.433–6:53.766
等第一次工具调用完成之后
等第一次工具调用完成之后
6:53.800–6:56.633
再立刻把全部工具恢复回来
再立刻把全部工具恢复回来
6:56.700–6:58.133
跑分就上来了
跑分就上来了
6:58.300–7:00.800
这大概也是为什么 DeepSeek Harness
这大概也是为什么 DeepSeek Harness
7:01.000–7:03.300
被称为 DeepSeek 的角色专武
被称为 DeepSeek 的角色专武
7:03.500–7:05.600
能让它发挥出更好的效果
能让它发挥出更好的效果
7:06.100–7:08.000
我觉得这个发现很有价值
我觉得这个发现很有价值
7:08.133–7:10.166
它揭示了一个更深的问题
它揭示了一个更深的问题
7:10.366–7:12.166
像 V4 Pro 这样的模型
像 V4 Pro 这样的模型
7:12.300–7:14.166
能力能不能被释放出来
能力能不能被释放出来
7:14.200–7:17.033
很大程度上取决于你给它的接口
很大程度上取决于你给它的接口
7:17.033–7:19.733
跟它训练时见过的那套像不像
跟它训练时见过的那套像不像
7:20.100–7:21.766
未来 Harness 的优化方向
未来 Harness 的优化方向
7:21.766–7:23.900
可能不是给 AI 更多工具
可能不是给 AI 更多工具
7:23.933–7:25.300
或者砍掉工具
或者砍掉工具
7:25.500–7:29.333
而是搞清楚怎么在启动阶段对齐训练分布
而是搞清楚怎么在启动阶段对齐训练分布
7:29.733–7:32.133
唤醒模型最强的执行状态
唤醒模型最强的执行状态
7:32.233–7:34.533
然后再释放完整能力
然后再释放完整能力
7:34.933–7:36.400
学会了 学废了
学会了 学废了
7:36.400–7:38.433
感兴趣的同学可以试试看
感兴趣的同学可以试试看
7:39.233–7:40.633
OK 就分享到这里
OK 就分享到这里
7:40.633–7:41.900
本期视频的文字版
本期视频的文字版
7:41.900–7:45.200
会收录到我免费开源的 AI 编程零基础入门教程
会收录到我免费开源的 AI 编程零基础入门教程
7:45.300–7:46.000
上千张图
上千张图
7:46.000–7:46.433
几十万字
几十万字
7:46.433–7:47.333
带你从 0 开始
带你从 0 开始
7:47.333–7:48.600
快速学会 AI 编程
快速学会 AI 编程
7:48.600–7:49.500
做出自己的产品
做出自己的产品
7:49.500–7:50.700
跑通变现全流程
跑通变现全流程
7:50.700–7:51.500
一次拿捏
一次拿捏
7:51.833–7:54.233
我是持续分享 AI 编程干货的鱼皮
我是持续分享 AI 编程干货的鱼皮
7:54.233–7:55.400
欢迎点赞关注
欢迎点赞关注
7:55.400–7:57.633
助力俺冲击百万哦 感谢
助力俺冲击百万哦 感谢

影片筆記:DeepSeek Harness 最新邪修!被吹成核弹的极简模式,真的夯吗?#ai #vibecoding #编程 #ai编程 #deepseek

一句話總結

影片實測 DeepSeek Harness 的「極簡模式」與「標準模式」,發現極簡模式雖能透過限制工具數量大幅提升執行速度並降低成本,但交付品質與功能完整性較差;同時揭示模型對初始工具結構敏感的特性,並介紹了透過「先極簡後標準」插件策略來優化跑分的方法。

核心重點

  1. 極簡模式 vs. 標準模式效能差異
  • 速度優勢:極簡模式因限制工具數量,執行速度顯著快於標準模式(實測分別快 10 分鐘與 21 分鐘)。
  • 成本優勢:四次任務總計僅花費 3 塊錢。
  • 品質劣勢:極簡模式在交付品質、功能完整性及細節處理上不如標準模式,且缺乏直接聯網能力。
  1. 極簡模式的本質與限制
  • 官方定位為模型基準測試用途,確保不同模型在乾淨環境下公平比較。
  • 僅提供持續運行的終端與檔案編輯器,關閉其他能力,AI 表現像「啞巴」。
  • 無法直接通過工具聯網,需透過終端腳本另闢蹊徑。
  1. 模型對工具結構的敏感性(邪修策略)
  • DeepSeek V4 Pro 對首輪請求的工具結構極度敏感。
  • 若首輪直接給 20 多個工具,模型會犯迷糊。
  • 大神插件策略:先沿用極簡模式(僅給終端與讀文件工具)讓模型進入狀態,第一次工具調用完成後,立即恢復全部工具,可在保留完整工具的前提下提升跑分。
  1. 核心洞察
  • DeepSeek Harness 被稱為 DeepSeek 的「角色專武」。
  • 模型能力釋放程度取決於給它的介面是否與訓練時見過的分布相似。
  • 未來優化方向不在於單純增加或砍掉工具,而在於如何在啟動階段對齊訓練分布,喚醒模型最強執行狀態,再釋放完整能力。

詳細大綱

一、 DeepSeek Harness 模式介紹

  • 標準模式
  • 預設使用模式。
  • 提供 AI 工具應有的完整能力。
  • 類似 Codex 的使用體驗。
  • 會輸出文字說明 AI 的思考過程與準備動作。
  • 極簡模式
  • 功能簡化,僅提供持續運行的終端與檔案編輯器。
  • 關閉其他能力,無多餘輸出。
  • AI 表現像「啞巴」,僅有思考、終端及字串替換工具調用。
  • 官方定位:專門用於跑模型基準測試,確保不同模型在乾淨環境下公平比較。

二、 實測任務一:開發 3D 第一人稱射擊遊戲

  • 測試條件:使用同一套提示詞,分別運行標準模式與極簡模式。
  • 標準模式結果
  • 步驟:50 步。
  • 耗時:33 分鐘。
  • 功能:體驗順暢,移動、跳躍、疾跑、射擊、殺敵正常,包含 CF 風格的二段跳。
  • 缺陷:敵人無法發射子彈,僅追擊玩家,無壓迫感;存在 Bug(敵人追擊後會逃跑);被擊倒時觸發倒地效果與視角,細節不錯。
  • 極簡模式結果
  • 步驟:77 步。
  • 耗時:23 分鐘(比標準模式快 10 分鐘)。
  • Token 消耗:比標準模式多 70 萬 Tokens。
  • 功能:介面更簡潔,背景牆更真實,敵人能發射子彈,壓迫感較強。
  • 缺陷:被擊倒時身體仍站立,無倒地視角,細節稍遜。
  • 結論:成品效果半斤八兩,各有優缺;極簡模式在速度上略勝一籌。

三、 實測任務二:開發 AI 寵物領養系統

  • 測試條件:需從電腦檔案獲取 DeepSeek 模型金鑰、聯網搜尋並下載圖片、開發前後端、調用 AI 模型。
  • 標準模式結果
  • 步驟:59 步。
  • 耗時:49 分鐘。
  • 交付:成功找到電腦上的模型金鑰,全程未需使用者插手,直接交付成品。
  • 功能:佈局良好,寵物卡片排版舒適;成功抓取鯨魚娘圖片並生成文案;點擊可領養,卡片樣式變化,具備篩選功能。
  • 缺陷:右上角提示文字未對齊。
  • 極簡模式結果
  • 步驟:87 步。
  • 耗時:不到 28 分鐘(比標準模式快 21 分鐘)。
  • Token 消耗:與標準模式相近。
  • 交付:未能自動找到模型金鑰,需使用者手動填寫,可交付性較差。
  • 功能:主頁面效果 OK,功能正常,但實用性差。
  • 缺陷:無篩選功能,無法查看已領養寵物;卡片資訊簡陋;右上角顯示「AI 文案 DeepSeek 已生成」,不像面向用戶的正規產品。
  • 結論:極簡模式速度快但交付品質與完整性較差。

四、 成本與綜合評估

  • 成本:四次任務總計花費 3 塊錢(被稱為漲價前最後的倔強)。
  • 極簡模式優點:執行速度快、說話直截了當、不繞彎子。
  • 原因:不需裝載太多工具到上下文,AI 不需糾結選擇工具,注意力集中。
  • 極簡模式缺點
  • AI 幾乎不匯報進度,使用者不知其進行狀態。
  • 無法直接通過工具聯網,需透過終端腳本另闢蹊徑。
  • 若任務強依賴特定工具(如理解圖片),差距會放大。
  • 細節與完整度較差,對標 Fable 5 被認為有些誇張。

五、 大神插件策略與深度分析

  • 插件發現:有大神開發插件,能在保留標準模式 20 多個工具的前提下,跑分略微反超極簡模式。
  • 策略原理
  • DeepSeek V4 Pro 對首輪請求的工具結構極度敏感。
  • 若首輪直接給 20 多個工具,模型會犯迷糊。
  • 若首輪沿用極簡模式(僅給終端與讀文件工具),讓模型以極簡模式思維鏈進入狀態。
  • 第一次工具調用完成後,立即恢復全部工具,跑分即提升。
  • 核心洞察
  • DeepSeek Harness 被稱為 DeepSeek 的角色專武。
  • 模型能力釋放程度取決於給它的介面是否與訓練時見過的分布相似。
  • 未來優化方向:非單純增加或砍掉工具,而是搞清楚如何在啟動階段對齊訓練分布,喚醒模型最強執行狀態,再釋放完整能力。

工具 / 模型 / 名詞整理

  • DeepSeek Harness:影片主要測試的 AI 工具平台。
  • 標準模式:DeepSeek Harness 的預設模式,提供完整工具能力,類似 Codex 體驗。
  • 極簡模式:DeepSeek Harness 的一種模式,僅提供終端與檔案編輯器,用於基準測試,限制工具數量以提升速度。
  • DeepSeek V4 Pro:影片中提及的模型版本,對首輪請求的工具結構極度敏感。
  • Codex:被提及作為標準模式類比的產品/工具。
  • Fable 5:被提及作為性能對標的級別(疑點:需查證此名稱是否為正確拼寫或特定內部代號)。
  • CF:遊戲名稱縮寫(穿越火線),用於描述 3D 射擊遊戲風格。
  • 角色專武:形容 DeepSeek Harness 的詞彙,指其能發揮模型特定能力的工具。

操作流程整理

實測任務流程(標準模式 vs. 極簡模式)

  1. 準備階段
  • 撰寫同一套提示詞。
  • 選擇 DeepSeek Harness 的模式(標準模式 或 極簡模式)。
  1. 執行階段
  • 標準模式:AI 輸出思考過程,調用多種工具,耗時較長,但功能完整。
  • 極簡模式:AI 僅調用終端與字串替換工具,無多餘輸出,耗時較短,但需手動處理部分問題(如金鑰填寫)。
  1. 結果評估
  • 比較步驟數、耗時、Token 消耗。
  • 檢查交付成品的功能完整性、細節處理(如遊戲機制、UI 佈局)。
  • 計算總成本。

大神插件優化策略流程

  1. 初始請求
  • 使用極簡模式配置(僅終端與讀文件工具)發送首輪請求。
  • 目的:讓模型以極簡模式思維鏈進入狀態,避免工具過多導致混亂。
  1. 第一次工具調用
  • 模型完成初步操作。
  1. 恢復工具
  • 在第一次工具調用完成後,立即恢復標準模式下的 20 多個工具。
  1. 後續執行
  • 模型在擁有完整工具的情況下繼續執行,跑分提升。

值得注意的限制或風險

  1. 極簡模式的交付品質限制
  • 無法自動找到電腦上的模型金鑰,需使用者手動填寫。
  • 缺乏篩選功能,無法查看已領養寵物等完整功能。
  • 細節處理較差(如遊戲中倒地視角缺失、UI 文字未對齊)。
  • 右上角顯示「AI 文案 DeepSeek 已生成」,不像面向用戶的正規產品。
  1. 聯網能力限制
  • 極簡模式無法直接通過工具聯網,需透過終端腳本另闢蹊徑。
  • 若任務強依賴特定工具(如理解圖片),極簡模式的差距會放大。
  1. 進度透明度低
  • AI 幾乎不匯報進度,使用者不知其進行狀態。
  1. 成本單位不明
  • 四次任務總計花費「3 塊」,單位未明確說明(人民幣?美元?)。

逐字稿辨識疑點

  1. Fable 5:逐字稿提及「做到了 Fable 5 級別的效果」,此名稱在常見 AI 模型或基準測試中較少見,需查證是否為聽寫錯誤或特定產品名稱。
  2. 3 塊錢:四次任務總計花費「3 塊」,單位未明確說明(人民幣?美元?),需查證實際計費單位。
  3. 角色專武:形容 DeepSeek Harness 的詞彙,需確認是否為官方用語或創作者比喻。
  4. DeepSeek 已生成:極簡模式成果中右上角顯示的文字,需確認是否為產品顯示錯誤或特定提示。

可延伸追問

  1. 大神開發的插件具體是如何實現「先極簡後標準」的技術細節?是否有開源代碼可供參考?
  2. DeepSeek V4 Pro 對工具結構敏感的原理是什麼?這是否適用於其他大型語言模型?
  3. 極簡模式在哪些特定類型的任務中表現最佳?是否有官方推薦的使用場景?
  4. 「Fable 5」具體指代什麼?是否有相關的文獻或基準測試報告可以查證?
  5. DeepSeek Harness 的計費單位「3 塊錢」具體是指什麼貨幣?漲價後的價格是多少?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習