WEBVTT
Kind: captions
Language: zh-Hans

00:00:00.000 --> 00:00:02.000
大家好 我是为什么叫QQ

00:00:02.000 --> 00:00:04.600
你以为1T开放权重模型的看点

00:00:04.600 --> 00:00:06.333
只剩下参数有多大？

00:00:06.333 --> 00:00:09.700
7月15日 前OpenAI CTO Mira Murati

00:00:09.700 --> 00:00:11.333
创办的Thinking Machines

00:00:11.333 --> 00:00:13.333
发布了首个模型Inkling

00:00:13.333 --> 00:00:16.400
（Nathan Lambert在X上把它简称为Thinky）

00:00:16.400 --> 00:00:18.300
975B总参数

00:00:18.300 --> 00:00:21.900
41 B 激活 原生接收文本 图像和音频输入

00:00:21.900 --> 00:00:25.600
官方自己先泼了一盆冷水：它不是当前最强模型

00:00:25.600 --> 00:00:27.766
但Hugging Face首席开源官

00:00:27.766 --> 00:00:30.533
Lys andre Debut只替换了两个底层实现

00:00:30.533 --> 00:00:34.500
在一次测试里 就把推理吞吐量提高了约15%

00:00:34.500 --> 00:00:37.333
所以Inkling真正值得看的 不是它有没有夺冠

00:00:37.333 --> 00:00:41.033
而是开放权重模型正在变得多容易优化

00:00:41.033 --> 00:00:42.333
多容易改造

00:00:42.333 --> 00:00:46.033
这几天 如果你经常刷推特或者国外的技术社区

00:00:46.033 --> 00:00:48.366
你一定会看到Inkling被疯狂刷屏

00:00:48.366 --> 00:00:51.466
顶级风投Menlo Ventures的合伙人Deedy Das

00:00:51.466 --> 00:00:54.833
把它评价为"中国以外最好的开放权重模型"；

00:00:54.833 --> 00:00:56.733
Nathan Lambert则称其为

00:00:56.733 --> 00:00:59.566
目前最强的美国开放权重模型

00:00:59.566 --> 00:01:01.133
但这都是综合判断

00:01:01.133 --> 00:01:03.800
不是统一排行榜给出的官方冠军

00:01:03.800 --> 00:01:05.966
而在发布当天的Design Arena

00:01:05.966 --> 00:01:07.966
的Agentic Web App Arena上

00:01:07.966 --> 00:01:11.400
Inkling以1257 Elo排名第9

00:01:11.400 --> 00:01:14.766
是其中排名最高的美国开放权重模型

00:01:14.766 --> 00:01:18.033
并与Claude Opus 4.6处于同一分数区间

00:01:18.033 --> 00:01:21.000
为什么整个AI圈 从底层内核开发者

00:01:21.000 --> 00:01:23.366
到上层应用平台 再到风投资本

00:01:23.366 --> 00:01:26.466
都在为这个并非"最强"的模型疯狂打Call？

00:01:26.466 --> 00:01:28.200
它到底解决了什么痛点？

00:01:28.200 --> 00:01:30.366
我们先来摸一下Inkling的基本盘

00:01:30.366 --> 00:01:31.933
它是Thinking Machines

00:01:31.933 --> 00:01:34.100
这家公司发布的第一个模型

00:01:34.100 --> 00:01:35.366
这家公司什么来头？

00:01:35.366 --> 00:01:39.133
CEO就是之前在OpenAI呼风唤雨的Mira Murati

00:01:39.133 --> 00:01:42.233
Inkling是混合专家架构的Transformer模型

00:01:42.233 --> 00:01:44.733
总参数量高达9750亿

00:01:44.733 --> 00:01:48.900
接近1T 但每次推理激活的参数只有410亿

00:01:48.900 --> 00:01:51.666
它吃下了45万亿个token的数据

00:01:51.666 --> 00:01:54.233
原生支持文本 图像和音频的输入

00:01:54.233 --> 00:01:56.466
最关键的是 Inkling开放了权重

00:01:56.466 --> 00:01:59.033
模型页标注Apache-2.0

00:01:59.033 --> 00:02:01.800
允许研究 微调和一般商业集成

00:02:01.800 --> 00:02:05.333
但使用者仍需遵守官方的可接受使用政策

00:02:05.333 --> 00:02:08.533
听起来是很强 但老实说 现在1T级别的

00:02:08.533 --> 00:02:10.300
模型也不算什么稀罕物了

00:02:10.300 --> 00:02:12.400
它凭什么让工程师们这么兴奋？

00:02:12.400 --> 00:02:13.966
为了搞清楚这个问题

00:02:13.966 --> 00:02:16.966
我们得从三个完全不同的视角来拆解它

00:02:16.966 --> 00:02:19.033
第一 地缘与格局的视角：

00:02:19.033 --> 00:02:21.266
开放权重模型的生态博弈

00:02:21.266 --> 00:02:23.600
如果你仔细看外网的评论

00:02:23.600 --> 00:02:25.400
会发现一个很有意思的现象

00:02:25.400 --> 00:02:27.166
大家在夸Inkling的时候

00:02:27.166 --> 00:02:29.800
总喜欢拿它和中国模型做对比

00:02:29.800 --> 00:02:30.766
为什么？

00:02:30.766 --> 00:02:34.333
因为在过去这大半年里 中国的开放权重模型

00:02:34.333 --> 00:02:37.600
尤其是Kimi的系列 还有智谱的GLM系列

00:02:37.600 --> 00:02:39.900
在各种榜单上表现非常抢眼

00:02:39.900 --> 00:02:42.733
从Nathan Lambert和Deedy Das的评价看

00:02:42.733 --> 00:02:46.100
Inkling模型至少让美国开放权重阵营多了

00:02:46.100 --> 00:02:49.266
一款有竞争力的大型原生多模态模型

00:02:49.266 --> 00:02:50.533
在Tinker平台上

00:02:50.533 --> 00:02:53.633
有真实用户 比如Mantic AI就做过测试

00:02:53.633 --> 00:02:56.200
在他们未公开方法的预测评测中

00:02:56.200 --> 00:02:58.266
Inkling超过了Kimi K2.6

00:02:58.266 --> 00:03:00.066
输出token约为后者一半

00:03:00.066 --> 00:03:02.400
虽然这只是客户的自有评测

00:03:02.400 --> 00:03:04.266
但也侧面反映了Inkling

00:03:04.266 --> 00:03:06.166
在某些特定任务上的潜力

00:03:06.166 --> 00:03:07.733
这背后反映的是什么？

00:03:07.733 --> 00:03:11.100
是整个AI基础设施竞争格局的变化

00:03:11.100 --> 00:03:14.166
以前 大模型的竞争主要在美国和中国之间

00:03:14.166 --> 00:03:17.133
现在 Thinking Machines这样的新兴创业公司

00:03:17.133 --> 00:03:19.100
通过开放权重的方式

00:03:19.100 --> 00:03:21.766
直接参与到全球AI生态的建设中

00:03:21.766 --> 00:03:25.000
我的判断是 开放权重不仅是技术选择

00:03:25.000 --> 00:03:27.166
也带有明显的生态战略考虑：

00:03:27.166 --> 00:03:30.400
让更多开发者围绕Inkling部署 微调和优化

00:03:30.400 --> 00:03:32.666
能够快速扩大模型的使用生态

00:03:32.666 --> 00:03:35.933
第二 工程视角的震撼：优化的"乐高化"

00:03:35.933 --> 00:03:38.700
这是我作为程序员觉得最兴奋的一点

00:03:38.700 --> 00:03:42.466
Hugging Face首席开源官Lys andre发了一条推文

00:03:42.466 --> 00:03:44.633
揭秘了他们是怎么优化Inkling的

00:03:44.633 --> 00:03:46.066
他们做了两件事

00:03:46.066 --> 00:03:49.066
第一 把模型里原来的Causal Con v1D替换

00:03:49.066 --> 00:03:51.700
成了一个叫causal- conv 1d的开源内核

00:03:51.700 --> 00:03:55.666
就改了一行代码 每秒处理的token数增加了4%

00:03:55.666 --> 00:03:57.666
第二 把注意力机制的实现

00:03:57.666 --> 00:04:01.133
换成了Flash Attention- 4 又是一行代码

00:04:01.133 --> 00:04:04.066
每秒处理的token数又提升了11%

00:04:04.066 --> 00:04:07.233
在Hugging Face首席开源官Lysandre的测试中

00:04:07.233 --> 00:04:11.633
两次底层实现替换让推理吞吐量合计提升约15%！

00:04:11.633 --> 00:04:15.066
而且 他们甚至还没开始碰最复杂的MOE层

00:04:15.066 --> 00:04:17.833
这说明了什么？说明现在的AI工程

00:04:17.833 --> 00:04:20.000
正在变得像搭乐高积木一样

00:04:20.000 --> 00:04:23.966
内核开发者专门去卷底层算子 把速度做到极致；

00:04:23.966 --> 00:04:27.066
模型开发者只需要像改配置文件一样

00:04:27.066 --> 00:04:28.633
把最好的内核插进去

00:04:28.633 --> 00:04:30.133
这种模块化的解耦

00:04:30.133 --> 00:04:33.933
才是推动AI基础设施狂飙突进的真正动力

00:04:33.933 --> 00:04:37.400
意味着模型开发者不一定要亲自编写CUDA内核

00:04:37.400 --> 00:04:39.900
也能快速试用社区里的优化实现

00:04:39.900 --> 00:04:42.400
当然 接入之后仍然要验证兼容性

00:04:42.400 --> 00:04:44.900
数值正确性和真实负载表现

00:04:44.900 --> 00:04:47.166
这就像是AI工程的"民主化"

00:04:47.166 --> 00:04:49.833
以前 只有大厂有能力去优化这些东西

00:04:49.833 --> 00:04:52.533
现在 任何有能力的工程师都

00:04:52.533 --> 00:04:56.500
可以通过组合这些开源内核 来构建高效的AI系统

00:04:56.500 --> 00:04:59.966
第三 落地与效率：可控思考的降维打击

00:04:59.966 --> 00:05:03.233
我们知道 现在的模型越来越聪明 但也越来越贵

00:05:03.233 --> 00:05:06.466
很多时候 我们不需要模型去解什么黎曼猜想

00:05:06.466 --> 00:05:09.933
我们只需要它帮我写个正则 或者整理个表格

00:05:09.933 --> 00:05:12.700
Inkling引入了一个非常硬核的机制

00:05:12.700 --> 00:05:14.866
叫做Controllable Thinking Effort

00:05:14.866 --> 00:05:16.833
也就是"可控思考努力"

00:05:16.833 --> 00:05:20.300
你可以把它理解为给模型装了一个油门踏板

00:05:20.300 --> 00:05:23.866
你可以把努力等级从0.2踩到0.99

00:05:23.866 --> 00:05:26.966
在Terminal Bench 2.1的官方测试曲线上

00:05:26.966 --> 00:05:29.800
Inkling用约三分之一的平均生成token

00:05:29.800 --> 00:05:32.400
达到与Nemotron 3 Ultra相同的分数

00:05:32.400 --> 00:05:35.666
这说明它在该测试中的输出token效率更高

00:05:35.666 --> 00:05:38.500
在同一模型 相同部署和任务条件下

00:05:38.500 --> 00:05:40.400
更少的生成token通常

00:05:40.400 --> 00:05:42.733
有助于缩短生成阶段的延迟

00:05:42.733 --> 00:05:44.966
也可能降低按token计费的费用；

00:05:44.966 --> 00:05:46.966
但跨模型不能只靠token数

00:05:46.966 --> 00:05:49.000
比较真实成本和并发能力

00:05:49.000 --> 00:05:52.366
这个机制的妙处在于 它给了用户选择的自由

00:05:52.366 --> 00:05:54.100
你可以根据你的业务需求

00:05:54.100 --> 00:05:56.266
动态调整模型的推理成本

00:05:56.266 --> 00:05:59.800
简单的任务可以用较低的努力等级快速出结果

00:05:59.800 --> 00:06:01.766
复杂的任务可以调高努力

00:06:01.766 --> 00:06:03.933
等级让模型花更多时间思考

00:06:03.933 --> 00:06:06.600
具体数值仍然要根据业务评测决定

00:06:06.600 --> 00:06:09.666
当然 可控思考并非开放权重模型独有

00:06:09.666 --> 00:06:12.600
OpenAI API也已经提供了类似的功能

00:06:12.600 --> 00:06:14.600
但Inkling真正不同的地方

00:06:14.600 --> 00:06:17.066
是用户不仅能调节推理强度

00:06:17.066 --> 00:06:20.166
还能拿到权重 继续微调和自行部署

00:06:20.166 --> 00:06:21.733
看到这里 你可能会想：

00:06:21.733 --> 00:06:25.900
好吧，它很省钱 它很容易优化 但它在各大榜单上

00:06:25.900 --> 00:06:27.666
并不是所有科目都是第一啊？

00:06:27.666 --> 00:06:30.766
比如视觉能力MMMU Pro的测试

00:06:30.766 --> 00:06:35.466
官方数据约73.5% 还比不上Kimi K2.6的79%

00:06:35.466 --> 00:06:38.166
但这里有个很离谱的地方 很多人理解错了

00:06:38.166 --> 00:06:41.533
大家都被各大厂商的Benchmark跑分给PUA了

00:06:41.533 --> 00:06:45.400
以为大模型比拼的只是谁的分数高 谁的参数多

00:06:45.400 --> 00:06:47.866
但Thinking Machines的团队非常清醒

00:06:47.866 --> 00:06:49.933
他们在官方博客里明确承认：

00:06:49.933 --> 00:06:52.100
Inkling不是今天最强的模型

00:06:52.100 --> 00:06:55.766
那他们追求的是什么？是"平衡"和"可定制性"

00:06:55.766 --> 00:06:57.233
在官方的演示里

00:06:57.233 --> 00:07:00.400
他们让Inkling做了一件非常赛博朋克的事情：

00:07:00.400 --> 00:07:01.466
自我微调

00:07:01.466 --> 00:07:04.566
官方展示了一个受控的自我微调闭环：

00:07:04.566 --> 00:07:06.033
在人类给定目标

00:07:06.033 --> 00:07:08.700
（比如"训练成不使用字母e的模型"）

00:07:08.700 --> 00:07:10.966
并提供OpenCode与Tinker权限后

00:07:10.966 --> 00:07:12.833
Inkling自己编写训练任务

00:07:12.833 --> 00:07:15.900
运行微调 评估结果并切换到新权重

00:07:15.900 --> 00:07:17.966
这才是真正的认知反转

00:07:17.966 --> 00:07:20.633
一个能在接入工具后承担Agentic任务

00:07:20.633 --> 00:07:22.700
并在官方演示的工具环境

00:07:22.700 --> 00:07:25.033
中完成自我微调闭环的模型

00:07:25.033 --> 00:07:28.900
远比一个只会做多选题的做题家模型要可怕得多

00:07:28.900 --> 00:07:32.166
说明大模型的评估标准本身就在发生变化

00:07:32.166 --> 00:07:35.100
以前 我们用Benchmark来评估模型

00:07:35.100 --> 00:07:36.866
因为那是最客观的方式

00:07:36.866 --> 00:07:38.933
但现在 我们需要评估的是

00:07:38.933 --> 00:07:41.200
模型在真实场景中的表现

00:07:41.200 --> 00:07:43.866
是它的可定制性 是它的工程化程度

00:07:43.866 --> 00:07:45.566
Inkling在OpenCode

00:07:45.566 --> 00:07:48.933
Tinker等工具支持下完成自我微调闭环的演示

00:07:48.933 --> 00:07:50.933
就是这种新评估标准的体现

00:07:50.933 --> 00:07:54.200
这给我们普通开发者和工程师带来了什么启示？

00:07:54.200 --> 00:07:56.366
我认为 AI基础设施的

00:07:56.366 --> 00:07:58.533
乐高化时代已经全面到来了

00:07:58.533 --> 00:08:00.433
以前 搞大模型是炼丹

00:08:00.433 --> 00:08:04.233
是个玄学 你需要一堆博士在机房里调整参数

00:08:04.233 --> 00:08:07.666
但现在 从多模态输入表示到推理内核

00:08:07.666 --> 00:08:10.633
越来越多环节正在被标准化和模块化

00:08:10.633 --> 00:08:14.000
未来的核心竞争力 在于你能不能熟练地使用

00:08:14.000 --> 00:08:16.666
开源社区提供的这些高质量"零件"

00:08:16.666 --> 00:08:19.233
你需要掌握的是像Tinker这样的平台

00:08:19.233 --> 00:08:23.433
学会怎么用业务数据去微调像Inkling这样平衡的基座模型

00:08:23.433 --> 00:08:26.033
把它变成你特定业务场景下的专家

00:08:26.033 --> 00:08:30.166
算力确实决定了模型的下限 但优秀的工程实践

00:08:30.166 --> 00:08:33.866
绝对能决定它的上限 这对创业者来说尤其重要

00:08:33.866 --> 00:08:35.566
以前 想要做一个AI产品

00:08:35.566 --> 00:08:37.566
你需要有大量的计算资源

00:08:37.566 --> 00:08:39.866
需要有一支强大的ML团队

00:08:39.866 --> 00:08:42.366
现在 开发者可以利用Tinker等平台

00:08:42.366 --> 00:08:44.866
用业务数据继续微调基座模型

00:08:44.866 --> 00:08:47.233
但真正落地仍然需要数据治理

00:08:47.233 --> 00:08:49.133
评测 部署和安全体系

00:08:49.133 --> 00:08:51.900
开放权重降低的是模型定制门槛

00:08:51.900 --> 00:08:54.400
并不会消除AI产品的工程成本

00:08:54.400 --> 00:08:56.566
Inkling的发布 只是一个开始

00:08:56.566 --> 00:08:59.500
它证明了1万亿参数的开放权重模型

00:08:59.500 --> 00:09:02.866
在经过良好的工程优化后 可以被更高效地利用

00:09:02.866 --> 00:09:05.200
虽然Inkling已提供NV FP4

00:09:05.200 --> 00:09:08.166
量化权重和多种推理框架支持

00:09:08.166 --> 00:09:10.333
可以部署在高端多卡服务器上

00:09:10.333 --> 00:09:12.333
或者通过第三方API使用

00:09:12.333 --> 00:09:16.433
距离普通企业服务器轻松本地运行仍有明显门槛

00:09:16.433 --> 00:09:18.300
但这种趋势是不可逆的

00:09:18.300 --> 00:09:20.366
未来 我们会看到更多原生支持

00:09:20.366 --> 00:09:23.333
音视频输入的多模态模型开放权重

00:09:23.333 --> 00:09:26.400
而这些模型 将不再是简单的聊天机器人

00:09:26.400 --> 00:09:29.700
它们在接入浏览器 代码执行器等工具后

00:09:29.700 --> 00:09:33.066
可以承担Agentic Web开发和长流程编码任务

00:09:33.066 --> 00:09:35.833
更接近能完成复杂任务的数字协作者

00:09:35.833 --> 00:09:37.633
开源与闭源的商业竞争

00:09:37.633 --> 00:09:40.566
西方开源与东方开源的技术角逐

00:09:40.566 --> 00:09:42.933
才刚刚进入最精彩的下半场

00:09:42.933 --> 00:09:45.200
我甚至大胆预测 未来的AI应用

00:09:45.200 --> 00:09:48.733
不会再是"大模型 + 简单提示词"这种模式

00:09:48.733 --> 00:09:52.600
而是会变成"小型定制化模型+复杂的工程系统"

00:09:52.600 --> 00:09:55.100
更多公司可能会维护定制模型

00:09:55.100 --> 00:09:57.466
基于像Inkling这样的权重基座

00:09:57.466 --> 00:09:59.333
通过微调和优化得到的

00:09:59.333 --> 00:10:02.700
这样做的好处是 你既能享受开源社区的成果

00:10:02.700 --> 00:10:05.900
又能在自托管和完善数据治理的前提下

00:10:05.900 --> 00:10:07.566
更好控制敏感数据

00:10:07.566 --> 00:10:08.966
总结一下今天的内容：

00:10:08.966 --> 00:10:11.800
Inkling的震撼 不在于它跑分有多高

00:10:11.800 --> 00:10:14.566
而在于它向我们展示了AI工程化

00:10:14.566 --> 00:10:16.733
模块化和极致效率的未来

00:10:16.733 --> 00:10:18.900
一个1万亿参数的模型

00:10:18.900 --> 00:10:22.966
通过两次底层实现的替换 吞吐量提升约15%

00:10:22.966 --> 00:10:26.166
一个模型能在受控环境下完成微调闭环

00:10:26.166 --> 00:10:29.666
一个开放权重模型能在Agentic Web App排行榜

00:10:29.666 --> 00:10:33.633
上和闭源的Claude Opus 4.6处于同一分数区间

00:10:33.633 --> 00:10:35.000
这些都不是偶然

00:10:35.000 --> 00:10:38.200
而是AI工程发展到一定阶段的必然结果

00:10:38.200 --> 00:10:40.866
那么 你觉得Inkling这种主打工程

00:10:40.866 --> 00:10:44.233
效率和可定制性的开放权重模型

00:10:44.233 --> 00:10:46.700
能否真正撼动目前国内大模型

00:10:46.700 --> 00:10:49.100
比如Kimi和GLM的强势地位呢？

00:10:49.100 --> 00:10:51.700
把你的看法打在公屏上 我们一起讨论

00:10:51.700 --> 00:10:54.066
如果你觉得这期视频对你有启发

00:10:54.066 --> 00:10:57.900
别忘了点赞投币收藏 一键三连是对我最大的支持

00:10:57.900 --> 00:10:59.966
感谢观看 我是为什么叫QQ

00:10:59.966 --> 00:11:01.166
我们下期再见！

