實際影片長度:2:40.124。原文、繁中、雙語可點擊句子跳轉影片。
0:00.360–0:01.040
zh各位朋友大家好
0:01.040–0:01.860
zh欢迎来关注鲲鹏Talk
0:01.860–0:03.220
zh那今天给大家介绍一个
0:03.220–0:04.760
enDeepseek V4 Flash 0731
0:04.760–0:06.920
zh携带多模态的一个版本
0:06.920–0:09.140
zh那这个是社区的大佬他们做的
0:09.140–0:10.560
zh它是怎么实现的
0:10.560–0:13.320
zh其实它是把Deepseek V4 Flash 0731
0:13.320–0:15.080
zh这个模型在前面套了一层
0:15.080–0:16.320
zh然后套的是什么呢
0:16.320–0:17.780
zh我去扒了一下
0:17.780–0:20.040
zh它应该是套的是
0:20.040–0:25.580
zh千问3.535B的模型
0:25.580–0:27.320
zh然后把它的多模态的那部分
0:27.320–0:29.500
zh就是MoonViT这个模块
0:29.500–0:30.800
zh然后把它移植到
0:30.800–0:32.780
zhDeepseek V4 Flash上来
0:32.780–0:33.280
zh这样的话
0:33.280–0:34.280
enDeepseek V4 Flash
0:34.280–0:35.960
zh就可以实现多模态的一个效果
0:35.960–0:37.960
zh那其实前几期的视频
0:37.960–0:38.800
zh我也给大家讲了一下
0:38.800–0:39.800
zh怎么样把
0:39.800–0:41.940
zh比如说通过Skill方式
0:41.940–0:44.820
zh把那个节约的多模态
0:44.820–0:46.300
zh或者是千问的多模态
0:46.300–0:47.980
zh移植到Deepseek V4 Flash上来
0:47.980–0:49.080
zh在Agent里面实现
0:49.080–0:50.420
zh一个多模态的一个效果
0:50.420–0:52.280
zh那那个是通过后期进行合成的
0:52.280–0:52.980
zh那这个项目
0:52.980–0:53.900
zh他们是通过
0:53.900–0:56.340
zh大模型本身的能力上面
0:56.340–0:56.960
zh进行合成的
0:56.960–0:57.500
zh它相当于在
0:57.500–0:59.240
zh上面套了一层视觉编码器
0:59.240–1:01.060
zh当然它这个模型
1:01.060–1:02.580
zh也支持Deepseek V4 Flash
1:02.580–1:03.580
zh然后进行推理
1:03.580–1:05.360
zh目前它的整个一个
1:05.360–1:06.580
zh基准测试的一个速度
1:06.580–1:09.600
zh还是非常成功的
1:09.600–1:10.160
zh它这种合并
1:10.160–1:11.140
zh就是达到了一个
1:11.140–1:12.760
zh就是6.5的一个效果
1:12.760–1:13.640
zh那说明了
1:13.640–1:15.800
zh它的整个的一个模型的能力
1:15.800–1:17.240
zh还是非常不错的
1:17.240–1:18.160
zh那当然它这个的话
1:18.160–1:20.180
zh对Deepseek V4 Flash本身的模型的
1:20.180–1:21.380
zh损失是很小的
1:21.380–1:22.300
zh几乎是可以忽略不计
1:22.300–1:23.500
zh就是它对模型本身
1:23.500–1:24.420
zh没有做改造
1:24.420–1:25.820
zh只是在它前面套了一层
1:25.820–1:26.680
zh就是如果判断是
1:26.680–1:28.560
zh图片的话就路由到
1:28.560–1:30.640
zh它的视觉编码器
1:30.640–1:32.760
zh解码器上面去做一些工作
1:32.760–1:34.700
zh那这个其实
1:34.700–1:36.400
zh它的这个模型的能力
1:36.400–1:38.740
zh虽然说不是很官方
1:38.740–1:40.960
zh前段时间好像也给大家说过
1:40.960–1:42.520
zh当然在我的群里面说过
1:42.520–1:45.460
zh就是说JM5.2给它加上多模态的一个效果
1:45.460–1:46.920
zh那Deepseek V4加上多模态
1:46.920–1:48.760
zh它的那个使用的场景更多
1:48.760–1:49.680
zh那这个模型呢
1:49.680–1:50.180
zh目前呢
1:50.180–1:52.440
zh我在网上看到有人在两台DGX B100上跑
1:52.440–1:53.880
zh有一个不错的一个效果
1:53.880–1:55.040
zh就相当于它完全本地
1:55.040–1:57.340
zh然后呢推你的成本极低的情况下
1:57.340–1:58.640
zh还能实现一个多模态
1:58.640–1:59.960
zh然后亿兆上下文的一个效果
1:59.960–2:01.760
zh那这个模型还是非常非常不错的
2:01.760–2:03.400
zh那我们其实呢
2:03.400–2:06.680
zh社区呢有这样的说明
2:06.680–2:09.160
zh这些还是有非常多的一个需求
2:09.160–2:10.060
zh那目前呢
2:10.060–2:11.340
zh它这个参数还是305B
2:11.340–2:13.520
zh就是本身没有增加太多
2:13.520–2:14.020
zh然后呢
2:14.020–2:16.420
zh它目前是168G的一个大小
2:16.420–2:17.340
zh所以说呢
2:17.340–2:19.380
zh两台DGX吧肯定是可以把它跑起来的
2:19.380–2:20.180
zh当然在麦克上也能跑
2:20.180–2:21.560
zh我目前并没有把它跑起来
2:21.560–2:22.920
zh因为我对这样的一个
2:22.920–2:24.780
zh就是本地去跑的需求不是很大
2:24.780–2:26.220
zh因为如果有这样的话
2:26.220–2:27.980
zh我已经通过我的那个Skills进行合并了
2:27.980–2:28.720
zh那感兴趣的话呢
2:28.720–2:29.480
zh大家可以来尝试一下
2:29.480–2:30.760
zh那我觉得这种的话
2:30.760–2:31.680
zh是一个非常有价值
2:31.680–2:32.520
zh当然我们更希望
2:32.520–2:34.340
zhDeepseek V4官方能够推出
2:34.340–2:35.560
zh在多模态的一个效果
2:35.560–2:37.160
zh那我们再期待一下吧
2:37.160–2:37.660
zh那好的
2:37.660–2:38.640
zh今天就介绍到这
2:38.640–2:39.140
zh谢谢大家
0:00.360–0:01.040
(此句尚無繁中翻譯)
0:01.040–0:01.860
(此句尚無繁中翻譯)
0:01.860–0:03.220
(此句尚無繁中翻譯)
0:03.220–0:04.760
(此句尚無繁中翻譯)
0:04.760–0:06.920
(此句尚無繁中翻譯)
0:06.920–0:09.140
(此句尚無繁中翻譯)
0:09.140–0:10.560
(此句尚無繁中翻譯)
0:10.560–0:13.320
(此句尚無繁中翻譯)
0:13.320–0:15.080
(此句尚無繁中翻譯)
0:15.080–0:16.320
(此句尚無繁中翻譯)
0:16.320–0:17.780
(此句尚無繁中翻譯)
0:17.780–0:20.040
(此句尚無繁中翻譯)
0:20.040–0:25.580
(此句尚無繁中翻譯)
0:25.580–0:27.320
(此句尚無繁中翻譯)
0:27.320–0:29.500
(此句尚無繁中翻譯)
0:29.500–0:30.800
(此句尚無繁中翻譯)
0:30.800–0:32.780
(此句尚無繁中翻譯)
0:32.780–0:33.280
(此句尚無繁中翻譯)
0:33.280–0:34.280
(此句尚無繁中翻譯)
0:34.280–0:35.960
(此句尚無繁中翻譯)
0:35.960–0:37.960
(此句尚無繁中翻譯)
0:37.960–0:38.800
(此句尚無繁中翻譯)
0:38.800–0:39.800
(此句尚無繁中翻譯)
0:39.800–0:41.940
(此句尚無繁中翻譯)
0:41.940–0:44.820
(此句尚無繁中翻譯)
0:44.820–0:46.300
(此句尚無繁中翻譯)
0:46.300–0:47.980
(此句尚無繁中翻譯)
0:47.980–0:49.080
(此句尚無繁中翻譯)
0:49.080–0:50.420
(此句尚無繁中翻譯)
0:50.420–0:52.280
(此句尚無繁中翻譯)
0:52.280–0:52.980
(此句尚無繁中翻譯)
0:52.980–0:53.900
(此句尚無繁中翻譯)
0:53.900–0:56.340
(此句尚無繁中翻譯)
0:56.340–0:56.960
(此句尚無繁中翻譯)
0:56.960–0:57.500
(此句尚無繁中翻譯)
0:57.500–0:59.240
(此句尚無繁中翻譯)
0:59.240–1:01.060
(此句尚無繁中翻譯)
1:01.060–1:02.580
(此句尚無繁中翻譯)
1:02.580–1:03.580
(此句尚無繁中翻譯)
1:03.580–1:05.360
(此句尚無繁中翻譯)
1:05.360–1:06.580
(此句尚無繁中翻譯)
1:06.580–1:09.600
(此句尚無繁中翻譯)
1:09.600–1:10.160
(此句尚無繁中翻譯)
1:10.160–1:11.140
(此句尚無繁中翻譯)
1:11.140–1:12.760
(此句尚無繁中翻譯)
1:12.760–1:13.640
(此句尚無繁中翻譯)
1:13.640–1:15.800
(此句尚無繁中翻譯)
1:15.800–1:17.240
(此句尚無繁中翻譯)
1:17.240–1:18.160
(此句尚無繁中翻譯)
1:18.160–1:20.180
(此句尚無繁中翻譯)
1:20.180–1:21.380
(此句尚無繁中翻譯)
1:21.380–1:22.300
(此句尚無繁中翻譯)
1:22.300–1:23.500
(此句尚無繁中翻譯)
1:23.500–1:24.420
(此句尚無繁中翻譯)
1:24.420–1:25.820
(此句尚無繁中翻譯)
1:25.820–1:26.680
(此句尚無繁中翻譯)
1:26.680–1:28.560
(此句尚無繁中翻譯)
1:28.560–1:30.640
(此句尚無繁中翻譯)
1:30.640–1:32.760
(此句尚無繁中翻譯)
1:32.760–1:34.700
(此句尚無繁中翻譯)
1:34.700–1:36.400
(此句尚無繁中翻譯)
1:36.400–1:38.740
(此句尚無繁中翻譯)
1:38.740–1:40.960
(此句尚無繁中翻譯)
1:40.960–1:42.520
(此句尚無繁中翻譯)
1:42.520–1:45.460
(此句尚無繁中翻譯)
1:45.460–1:46.920
(此句尚無繁中翻譯)
1:46.920–1:48.760
(此句尚無繁中翻譯)
1:48.760–1:49.680
(此句尚無繁中翻譯)
1:49.680–1:50.180
(此句尚無繁中翻譯)
1:50.180–1:52.440
(此句尚無繁中翻譯)
1:52.440–1:53.880
(此句尚無繁中翻譯)
1:53.880–1:55.040
(此句尚無繁中翻譯)
1:55.040–1:57.340
(此句尚無繁中翻譯)
1:57.340–1:58.640
(此句尚無繁中翻譯)
1:58.640–1:59.960
(此句尚無繁中翻譯)
1:59.960–2:01.760
(此句尚無繁中翻譯)
2:01.760–2:03.400
(此句尚無繁中翻譯)
2:03.400–2:06.680
(此句尚無繁中翻譯)
2:06.680–2:09.160
(此句尚無繁中翻譯)
2:09.160–2:10.060
(此句尚無繁中翻譯)
2:10.060–2:11.340
(此句尚無繁中翻譯)
2:11.340–2:13.520
(此句尚無繁中翻譯)
2:13.520–2:14.020
(此句尚無繁中翻譯)
2:14.020–2:16.420
(此句尚無繁中翻譯)
2:16.420–2:17.340
(此句尚無繁中翻譯)
2:17.340–2:19.380
(此句尚無繁中翻譯)
2:19.380–2:20.180
(此句尚無繁中翻譯)
2:20.180–2:21.560
(此句尚無繁中翻譯)
2:21.560–2:22.920
(此句尚無繁中翻譯)
2:22.920–2:24.780
(此句尚無繁中翻譯)
2:24.780–2:26.220
(此句尚無繁中翻譯)
2:26.220–2:27.980
(此句尚無繁中翻譯)
2:27.980–2:28.720
(此句尚無繁中翻譯)
2:28.720–2:29.480
(此句尚無繁中翻譯)
2:29.480–2:30.760
(此句尚無繁中翻譯)
2:30.760–2:31.680
(此句尚無繁中翻譯)
2:31.680–2:32.520
(此句尚無繁中翻譯)
2:32.520–2:34.340
(此句尚無繁中翻譯)
2:34.340–2:35.560
(此句尚無繁中翻譯)
2:35.560–2:37.160
(此句尚無繁中翻譯)
2:37.160–2:37.660
(此句尚無繁中翻譯)
2:37.660–2:38.640
(此句尚無繁中翻譯)
2:38.640–2:39.140
(此句尚無繁中翻譯)
0:00.360–0:01.040
zh各位朋友大家好
(此句尚無繁中翻譯)
0:01.040–0:01.860
zh欢迎来关注鲲鹏Talk
(此句尚無繁中翻譯)
0:01.860–0:03.220
zh那今天给大家介绍一个
(此句尚無繁中翻譯)
0:03.220–0:04.760
enDeepseek V4 Flash 0731
(此句尚無繁中翻譯)
0:04.760–0:06.920
zh携带多模态的一个版本
(此句尚無繁中翻譯)
0:06.920–0:09.140
zh那这个是社区的大佬他们做的
(此句尚無繁中翻譯)
0:09.140–0:10.560
zh它是怎么实现的
(此句尚無繁中翻譯)
0:10.560–0:13.320
zh其实它是把Deepseek V4 Flash 0731
(此句尚無繁中翻譯)
0:13.320–0:15.080
zh这个模型在前面套了一层
(此句尚無繁中翻譯)
0:15.080–0:16.320
zh然后套的是什么呢
(此句尚無繁中翻譯)
0:16.320–0:17.780
zh我去扒了一下
(此句尚無繁中翻譯)
0:17.780–0:20.040
zh它应该是套的是
(此句尚無繁中翻譯)
0:20.040–0:25.580
zh千问3.535B的模型
(此句尚無繁中翻譯)
0:25.580–0:27.320
zh然后把它的多模态的那部分
(此句尚無繁中翻譯)
0:27.320–0:29.500
zh就是MoonViT这个模块
(此句尚無繁中翻譯)
0:29.500–0:30.800
zh然后把它移植到
(此句尚無繁中翻譯)
0:30.800–0:32.780
zhDeepseek V4 Flash上来
(此句尚無繁中翻譯)
0:32.780–0:33.280
zh这样的话
(此句尚無繁中翻譯)
0:33.280–0:34.280
enDeepseek V4 Flash
(此句尚無繁中翻譯)
0:34.280–0:35.960
zh就可以实现多模态的一个效果
(此句尚無繁中翻譯)
0:35.960–0:37.960
zh那其实前几期的视频
(此句尚無繁中翻譯)
0:37.960–0:38.800
zh我也给大家讲了一下
(此句尚無繁中翻譯)
0:38.800–0:39.800
zh怎么样把
(此句尚無繁中翻譯)
0:39.800–0:41.940
zh比如说通过Skill方式
(此句尚無繁中翻譯)
0:41.940–0:44.820
zh把那个节约的多模态
(此句尚無繁中翻譯)
0:44.820–0:46.300
zh或者是千问的多模态
(此句尚無繁中翻譯)
0:46.300–0:47.980
zh移植到Deepseek V4 Flash上来
(此句尚無繁中翻譯)
0:47.980–0:49.080
zh在Agent里面实现
(此句尚無繁中翻譯)
0:49.080–0:50.420
zh一个多模态的一个效果
(此句尚無繁中翻譯)
0:50.420–0:52.280
zh那那个是通过后期进行合成的
(此句尚無繁中翻譯)
0:52.280–0:52.980
zh那这个项目
(此句尚無繁中翻譯)
0:52.980–0:53.900
zh他们是通过
(此句尚無繁中翻譯)
0:53.900–0:56.340
zh大模型本身的能力上面
(此句尚無繁中翻譯)
0:56.340–0:56.960
zh进行合成的
(此句尚無繁中翻譯)
0:56.960–0:57.500
zh它相当于在
(此句尚無繁中翻譯)
0:57.500–0:59.240
zh上面套了一层视觉编码器
(此句尚無繁中翻譯)
0:59.240–1:01.060
zh当然它这个模型
(此句尚無繁中翻譯)
1:01.060–1:02.580
zh也支持Deepseek V4 Flash
(此句尚無繁中翻譯)
1:02.580–1:03.580
zh然后进行推理
(此句尚無繁中翻譯)
1:03.580–1:05.360
zh目前它的整个一个
(此句尚無繁中翻譯)
1:05.360–1:06.580
zh基准测试的一个速度
(此句尚無繁中翻譯)
1:06.580–1:09.600
zh还是非常成功的
(此句尚無繁中翻譯)
1:09.600–1:10.160
zh它这种合并
(此句尚無繁中翻譯)
1:10.160–1:11.140
zh就是达到了一个
(此句尚無繁中翻譯)
1:11.140–1:12.760
zh就是6.5的一个效果
(此句尚無繁中翻譯)
1:12.760–1:13.640
zh那说明了
(此句尚無繁中翻譯)
1:13.640–1:15.800
zh它的整个的一个模型的能力
(此句尚無繁中翻譯)
1:15.800–1:17.240
zh还是非常不错的
(此句尚無繁中翻譯)
1:17.240–1:18.160
zh那当然它这个的话
(此句尚無繁中翻譯)
1:18.160–1:20.180
zh对Deepseek V4 Flash本身的模型的
(此句尚無繁中翻譯)
1:20.180–1:21.380
zh损失是很小的
(此句尚無繁中翻譯)
1:21.380–1:22.300
zh几乎是可以忽略不计
(此句尚無繁中翻譯)
1:22.300–1:23.500
zh就是它对模型本身
(此句尚無繁中翻譯)
1:23.500–1:24.420
zh没有做改造
(此句尚無繁中翻譯)
1:24.420–1:25.820
zh只是在它前面套了一层
(此句尚無繁中翻譯)
1:25.820–1:26.680
zh就是如果判断是
(此句尚無繁中翻譯)
1:26.680–1:28.560
zh图片的话就路由到
(此句尚無繁中翻譯)
1:28.560–1:30.640
zh它的视觉编码器
(此句尚無繁中翻譯)
1:30.640–1:32.760
zh解码器上面去做一些工作
(此句尚無繁中翻譯)
1:32.760–1:34.700
zh那这个其实
(此句尚無繁中翻譯)
1:34.700–1:36.400
zh它的这个模型的能力
(此句尚無繁中翻譯)
1:36.400–1:38.740
zh虽然说不是很官方
(此句尚無繁中翻譯)
1:38.740–1:40.960
zh前段时间好像也给大家说过
(此句尚無繁中翻譯)
1:40.960–1:42.520
zh当然在我的群里面说过
(此句尚無繁中翻譯)
1:42.520–1:45.460
zh就是说JM5.2给它加上多模态的一个效果
(此句尚無繁中翻譯)
1:45.460–1:46.920
zh那Deepseek V4加上多模态
(此句尚無繁中翻譯)
1:46.920–1:48.760
zh它的那个使用的场景更多
(此句尚無繁中翻譯)
1:48.760–1:49.680
zh那这个模型呢
(此句尚無繁中翻譯)
1:49.680–1:50.180
zh目前呢
(此句尚無繁中翻譯)
1:50.180–1:52.440
zh我在网上看到有人在两台DGX B100上跑
(此句尚無繁中翻譯)
1:52.440–1:53.880
zh有一个不错的一个效果
(此句尚無繁中翻譯)
1:53.880–1:55.040
zh就相当于它完全本地
(此句尚無繁中翻譯)
1:55.040–1:57.340
zh然后呢推你的成本极低的情况下
(此句尚無繁中翻譯)
1:57.340–1:58.640
zh还能实现一个多模态
(此句尚無繁中翻譯)
1:58.640–1:59.960
zh然后亿兆上下文的一个效果
(此句尚無繁中翻譯)
1:59.960–2:01.760
zh那这个模型还是非常非常不错的
(此句尚無繁中翻譯)
2:01.760–2:03.400
zh那我们其实呢
(此句尚無繁中翻譯)
2:03.400–2:06.680
zh社区呢有这样的说明
(此句尚無繁中翻譯)
2:06.680–2:09.160
zh这些还是有非常多的一个需求
(此句尚無繁中翻譯)
2:09.160–2:10.060
zh那目前呢
(此句尚無繁中翻譯)
2:10.060–2:11.340
zh它这个参数还是305B
(此句尚無繁中翻譯)
2:11.340–2:13.520
zh就是本身没有增加太多
(此句尚無繁中翻譯)
2:13.520–2:14.020
zh然后呢
(此句尚無繁中翻譯)
2:14.020–2:16.420
zh它目前是168G的一个大小
(此句尚無繁中翻譯)
2:16.420–2:17.340
zh所以说呢
(此句尚無繁中翻譯)
2:17.340–2:19.380
zh两台DGX吧肯定是可以把它跑起来的
(此句尚無繁中翻譯)
2:19.380–2:20.180
zh当然在麦克上也能跑
(此句尚無繁中翻譯)
2:20.180–2:21.560
zh我目前并没有把它跑起来
(此句尚無繁中翻譯)
2:21.560–2:22.920
zh因为我对这样的一个
(此句尚無繁中翻譯)
2:22.920–2:24.780
zh就是本地去跑的需求不是很大
(此句尚無繁中翻譯)
2:24.780–2:26.220
zh因为如果有这样的话
(此句尚無繁中翻譯)
2:26.220–2:27.980
zh我已经通过我的那个Skills进行合并了
(此句尚無繁中翻譯)
2:27.980–2:28.720
zh那感兴趣的话呢
(此句尚無繁中翻譯)
2:28.720–2:29.480
zh大家可以来尝试一下
(此句尚無繁中翻譯)
2:29.480–2:30.760
zh那我觉得这种的话
(此句尚無繁中翻譯)
2:30.760–2:31.680
zh是一个非常有价值
(此句尚無繁中翻譯)
2:31.680–2:32.520
zh当然我们更希望
(此句尚無繁中翻譯)
2:32.520–2:34.340
zhDeepseek V4官方能够推出
(此句尚無繁中翻譯)
2:34.340–2:35.560
zh在多模态的一个效果
(此句尚無繁中翻譯)
2:35.560–2:37.160
zh那我们再期待一下吧
(此句尚無繁中翻譯)
2:37.160–2:37.660
zh那好的
(此句尚無繁中翻譯)
2:37.660–2:38.640
zh今天就介绍到这
(此句尚無繁中翻譯)
2:38.640–2:39.140
zh谢谢大家
(此句尚無繁中翻譯)

影片筆記:DeepSeek V4 Flash终于能看图了?305B模型强行接上视觉能力!Hybrid Vision多模态版实测

一句話總結

影片介紹了由社區開發者製作的 DeepSeek V4 Flash 0731 多模態版本,該版本通過將 Qwen 3.5 35B 中的 MoonViT 模塊移植到 DeepSeek V4 Flash 前面「套層」的方式實現視覺能力,在保持 305B 參數規模與極低性能損耗的同時,實現了低成本本地運行與億兆上下文支持。

核心重點

  • 非官方社區版本:DeepSeek V4 Flash 0731 多模態版並非官方發布,而是由社區大佬製作。
  • 技術實現路徑:採用「套層」方式,將 Qwen 3.5 35B 的多模態模塊 MoonViT 移植到 DeepSeek V4 Flash 模型前端。
  • 運行機制:若輸入為圖片,系統會路由至視覺編碼器/解碼器處理;若為文字,則走原有邏輯。這與之前通過 Skills/Agent 進行後期邏輯合成的方式不同,屬於直接修改模型結構。
  • 性能表現優異
  • 基準測試達到 6.5 的效果。
  • 對原始 DeepSeek V4 Flash 模型的能力損失極小,幾乎可忽略。
  • 部署與成本優勢
  • 參數仍為 305B,模型大小約 168G
  • 可在兩台 DGX B100 上運行,理論上 Mac 也可運行(講者未實際測試)。
  • 實現完全本地運行,推理成本極低,並支持多模態及億兆上下文。

詳細大綱

1. 項目背景與介紹

  • 本集影片介紹的是一個社區開發的多模態版本,名稱為 DeepSeek V4 Flash 0731
  • 強調該版本非官方發布,但由社區高手製作,具有較高價值。

2. 技術原理詳解

  • 核心思路:在 DeepSeek V4 Flash 模型前面「套層」。
  • 具體操作
  • Qwen 3.5 35B(聽似千問)模型中提取多模態部分。
  • 移植名為 MoonViT 的模塊。
  • 區別於前作
  • 前幾期影片講解的是通過 Skills 或 Agent 進行後期合成(邏輯層面)。
  • 本項目是直接修改模型結構(結構層面),屬於合成模型。

3. 性能測試與評估

  • 基準測試:測試結果非常成功,提及達到 6.5 的效果。
  • 模型損耗:對 DeepSeek V4 Flash 本身模型的能力損失極小。
  • 參數規模:合併後的模型參數仍為 305B
  • 模型大小:約 168G

4. 部署場景與講者觀點

  • 硬體需求
  • 明確指出兩台 DGX B100 可以運行。
  • 提及 Mac 理論上也可運行,但講者未實際測試。
  • 優勢總結
  • 完全本地運行。
  • 推理成本極低。
  • 支持多模態及億兆上下文。
  • 講者個人看法
  • 雖然非官方,但價值很高。
  • 希望官方能推出此功能。
  • 講者個人因已有 Skills 合併方案,故無強烈本地運行此模型的需求。

工具 / 模型 / 名詞整理

  • DeepSeek V4 Flash 0731:影片討論的核心模型版本,帶有「多模態」標籤。
  • Qwen 3.5 35B:作為提供多模態能力的源模型,聽似「千問3.535B」。
  • MoonViT:被移植的多模態模塊名稱,用於處理視覺信息。
  • DGX B100:用於運行該模型的硬體設備。
  • Mac:提及可運行的操作系統平台。
  • Skills:講者提及用於後期合成多模態功能的技術/工具。
  • Agent:提及用於實現多模態效果的環境。
  • 6.5:基準測試中提到的數值,指代某種效果或分數。
  • JM5.2:講者提及的模型或技術名稱,需查證。
  • 億兆上下文:模型支持的上下文長度描述。

操作流程整理

  1. 模型選擇與準備
  • 獲取社區製作的 DeepSeek V4 Flash 0731 多模態版本。
  1. 結構修改(套層)
  • 在原始 DeepSeek V4 Flash 模型前端套入 Qwen 3.5 35B 的多模態模塊 MoonViT
  1. 運行與路由
  • 當輸入為圖片時,數據路由至視覺編碼器/解碼器(MoonViT)處理。
  • 當輸入為文字時,走原有 DeepSeek V4 Flash 邏輯。
  1. 部署運行
  • 將約 168G 的模型部署於兩台 DGX B100 上(或理論上的 Mac 環境)。
  1. 驗證效果
  • 進行基準測試,確認達到 6.5 的效果。
  • 確認對原始模型能力損耗極小。

值得注意的限制或風險

  • 非官方版本:該模型為社區製作,非 DeepSeek 官方發布,穩定性與長期維護需自行評估。
  • 硬體門檻:雖然參數為 305B,但仍需兩台 DGX B100 才能運行,對普通用戶而言硬體成本不低。
  • 測試局限性:講者提到 Mac 上理論可跑但未實際測試,實際兼容性存在不確定性。
  • 技術複雜度:涉及模型結構的直接修改與模塊移植,比後期通過 Agent/Skills 合成更為複雜。

逐字稿辨識疑點

  • 「Deepseek V4 Flash 0731」:逐字稿中多次出現此名稱,需查證是否為準確的模型版本號或代碼。
  • 「千问3.535B」:聽似「Qwen 3.5 35B」,需查證是否為阿里通義千問系列模型及其參數規模。
  • 「MoonViT」:需查證此為視覺編碼器的準確名稱。
  • 「6.5的一個效果」:基準測試中提到的數值「6.5」,需查證具體指代的指標(如 MMLU、HumanEval 或其他基準分數)。
  • 「JM5.2」:講者提及「JM5.2给它加上多模态的一个效果」,需查證此模型或技術名稱是否為聽寫錯誤。
  • 「亿兆上下文」:需查證是否為「億萬」或特定上下文長度的準確描述。

可延伸追問

  • DeepSeek V4 Flash 0731 多模態版的具體開源地址或下載來源為何?
  • 「MoonViT」模塊的具體技術架構與 Qwen 3.5 35B 的關係為何?
  • 基準測試中「6.5」具體對應哪一項評估指標?與官方版本相比差距為何?
  • 在 Mac 上運行該模型具體需要什麼樣的硬體配置(如記憶體大小)?
  • 相比於 Skills/Agent 後期合成方案,直接修改模型結構在推理速度與準確率上有何具體優劣?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習