20260717-06 | 中国开源模型的强劲对手来了? 拆解Inkling:美国AI的开源反击
來源:Youtube | 建立:2026-07-17T14:06:35 | HTML:2026-07-17T14:08:42
開啟原始影片 note.md transcript.txt transcript.vtt

影片筆記:中国开源模型的强劲对手来了? 拆解Inkling:美国AI的开源反击

YouTube 影片框會固定在左上方;點擊右側逐字稿時間戳可跳到對應時間。

一句話總結

Thinking Machines 公司發布的首個開放權重模型 Inkling,透過「可控思考努力」機制與工程模組化趨勢,在成本與效能間取得平衡,並展現 Agentic 自我微調能力,被視為美國開放權重陣營對抗中國模型(如 Kimi、GLM)的重要戰略佈局。

核心重點

地緣與格局競爭:Inkling 作為美國開放權重陣營的代表,與中國模型(Kimi、GLM)形成競爭與互補。儘管中國模型表現搶眼,Inkling 被評價為「中國以外最好的開放權重模型」及「目前最強的美國開放權重模型」,推動全球 AI 生態多樣化。

工程優化與模組化:Hugging Face 團隊僅透過替換兩行底層代碼(Causal Con v1DFlash Attention- 4),即實現約 15% 的推理吞吐量提升。這展現了 AI 工程「樂高化」與模組化的趨勢,降低優化門檻。

效率與落地能力

未來趨勢預測:AI 基礎設施正走向標準化與模組化。未來應用模式將從「大模型 + 簡單提示詞」轉變為「小型定制模型 + 複雜工程系統」,企業將更傾向維護基於開放權重基座的定制模型以控制敏感數據。

詳細大綱

一、 Inkling 基本盤與市場反響

二、 三大核心視角解析

#### 1. 地緣與格局:開放權重模型的生態博弈

#### 2. 工程視角:優化的「樂高化」

#### 3. 落地與效率:可控思考的降維打擊

三、 未來趨勢與啟示

工具 / 模型 / 名詞整理

操作流程整理

Inkling 模型發布與評估

工程優化流程(Hugging Face 案例)

可控思考努力應用流程

自我微調閉環演示流程

值得注意的限制或風險

逐字稿辨識疑點

可延伸追問

Inkling 的「可控思考努力」機制在實際商業應用中,如何精確量化成本與效能的邊際效益?

Hugging Face 的模組化優化案例是否可複製到其他 MoE 架構模型?其兼容性驗證標準為何?

面對中國模型(Kimi、GLM)的競爭,美國開放權重陣營在生態建設上是否有具體的聯合策略?

Inkling 在「自我微調」閉環中,如何確保訓練數據的安全性與隱私保護?

企業在導入 Inkling 等開放權重模型時,應如何評估並平衡「高端多卡服務器」的硬體投入與 API 調用成本?

逐字稿時間軸

右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。

00:00:00.000 → 00:00:02.000
大家好 我是为什么叫QQ
00:00:02.000 → 00:00:04.600
你以为1T开放权重模型的看点
00:00:04.600 → 00:00:06.333
只剩下参数有多大?
00:00:06.333 → 00:00:09.700
7月15日 前OpenAI CTO Mira Murati
00:00:09.700 → 00:00:11.333
创办的Thinking Machines
00:00:11.333 → 00:00:13.333
发布了首个模型Inkling
00:00:13.333 → 00:00:16.400
(Nathan Lambert在X上把它简称为Thinky)
00:00:18.300 → 00:00:21.900
41 B 激活 原生接收文本 图像和音频输入
00:00:21.900 → 00:00:25.600
官方自己先泼了一盆冷水:它不是当前最强模型
00:00:25.600 → 00:00:27.766
但Hugging Face首席开源官
00:00:27.766 → 00:00:30.533
Lys andre Debut只替换了两个底层实现
00:00:30.533 → 00:00:34.500
在一次测试里 就把推理吞吐量提高了约15%
00:00:34.500 → 00:00:37.333
所以Inkling真正值得看的 不是它有没有夺冠
00:00:37.333 → 00:00:41.033
而是开放权重模型正在变得多容易优化
00:00:42.333 → 00:00:46.033
这几天 如果你经常刷推特或者国外的技术社区
00:00:46.033 → 00:00:48.366
你一定会看到Inkling被疯狂刷屏
00:00:48.366 → 00:00:51.466
顶级风投Menlo Ventures的合伙人Deedy Das
00:00:51.466 → 00:00:54.833
把它评价为"中国以外最好的开放权重模型";
00:00:54.833 → 00:00:56.733
Nathan Lambert则称其为
00:00:56.733 → 00:00:59.566
目前最强的美国开放权重模型
00:00:59.566 → 00:01:01.133
但这都是综合判断
00:01:01.133 → 00:01:03.800
不是统一排行榜给出的官方冠军
00:01:03.800 → 00:01:05.966
而在发布当天的Design Arena
00:01:05.966 → 00:01:07.966
的Agentic Web App Arena上
00:01:07.966 → 00:01:11.400
Inkling以1257 Elo排名第9
00:01:11.400 → 00:01:14.766
是其中排名最高的美国开放权重模型
00:01:14.766 → 00:01:18.033
并与Claude Opus 4.6处于同一分数区间
00:01:18.033 → 00:01:21.000
为什么整个AI圈 从底层内核开发者
00:01:21.000 → 00:01:23.366
到上层应用平台 再到风投资本
00:01:23.366 → 00:01:26.466
都在为这个并非"最强"的模型疯狂打Call?
00:01:26.466 → 00:01:28.200
它到底解决了什么痛点?
00:01:28.200 → 00:01:30.366
我们先来摸一下Inkling的基本盘
00:01:30.366 → 00:01:31.933
它是Thinking Machines
00:01:31.933 → 00:01:34.100
这家公司发布的第一个模型
00:01:34.100 → 00:01:35.366
这家公司什么来头?
00:01:35.366 → 00:01:39.133
CEO就是之前在OpenAI呼风唤雨的Mira Murati
00:01:39.133 → 00:01:42.233
Inkling是混合专家架构的Transformer模型
00:01:42.233 → 00:01:44.733
总参数量高达9750亿
00:01:44.733 → 00:01:48.900
接近1T 但每次推理激活的参数只有410亿
00:01:48.900 → 00:01:51.666
它吃下了45万亿个token的数据
00:01:51.666 → 00:01:54.233
原生支持文本 图像和音频的输入
00:01:54.233 → 00:01:56.466
最关键的是 Inkling开放了权重
00:01:56.466 → 00:01:59.033
模型页标注Apache-2.0
00:01:59.033 → 00:02:01.800
允许研究 微调和一般商业集成
00:02:01.800 → 00:02:05.333
但使用者仍需遵守官方的可接受使用政策
00:02:05.333 → 00:02:08.533
听起来是很强 但老实说 现在1T级别的
00:02:08.533 → 00:02:10.300
模型也不算什么稀罕物了
00:02:10.300 → 00:02:12.400
它凭什么让工程师们这么兴奋?
00:02:12.400 → 00:02:13.966
为了搞清楚这个问题
00:02:13.966 → 00:02:16.966
我们得从三个完全不同的视角来拆解它
00:02:16.966 → 00:02:19.033
第一 地缘与格局的视角:
00:02:19.033 → 00:02:21.266
开放权重模型的生态博弈
00:02:21.266 → 00:02:23.600
如果你仔细看外网的评论
00:02:23.600 → 00:02:25.400
会发现一个很有意思的现象
00:02:25.400 → 00:02:27.166
大家在夸Inkling的时候
00:02:27.166 → 00:02:29.800
总喜欢拿它和中国模型做对比
00:02:30.766 → 00:02:34.333
因为在过去这大半年里 中国的开放权重模型
00:02:34.333 → 00:02:37.600
尤其是Kimi的系列 还有智谱的GLM系列
00:02:37.600 → 00:02:39.900
在各种榜单上表现非常抢眼
00:02:39.900 → 00:02:42.733
从Nathan Lambert和Deedy Das的评价看
00:02:42.733 → 00:02:46.100
Inkling模型至少让美国开放权重阵营多了
00:02:46.100 → 00:02:49.266
一款有竞争力的大型原生多模态模型
00:02:49.266 → 00:02:50.533
在Tinker平台上
00:02:50.533 → 00:02:53.633
有真实用户 比如Mantic AI就做过测试
00:02:53.633 → 00:02:56.200
在他们未公开方法的预测评测中
00:02:56.200 → 00:02:58.266
Inkling超过了Kimi K2.6
00:02:58.266 → 00:03:00.066
输出token约为后者一半
00:03:00.066 → 00:03:02.400
虽然这只是客户的自有评测
00:03:02.400 → 00:03:04.266
但也侧面反映了Inkling
00:03:04.266 → 00:03:06.166
在某些特定任务上的潜力
00:03:06.166 → 00:03:07.733
这背后反映的是什么?
00:03:07.733 → 00:03:11.100
是整个AI基础设施竞争格局的变化
00:03:11.100 → 00:03:14.166
以前 大模型的竞争主要在美国和中国之间
00:03:14.166 → 00:03:17.133
现在 Thinking Machines这样的新兴创业公司
00:03:17.133 → 00:03:19.100
通过开放权重的方式
00:03:19.100 → 00:03:21.766
直接参与到全球AI生态的建设中
00:03:21.766 → 00:03:25.000
我的判断是 开放权重不仅是技术选择
00:03:25.000 → 00:03:27.166
也带有明显的生态战略考虑:
00:03:27.166 → 00:03:30.400
让更多开发者围绕Inkling部署 微调和优化
00:03:30.400 → 00:03:32.666
能够快速扩大模型的使用生态
00:03:32.666 → 00:03:35.933
第二 工程视角的震撼:优化的"乐高化"
00:03:35.933 → 00:03:38.700
这是我作为程序员觉得最兴奋的一点
00:03:38.700 → 00:03:42.466
Hugging Face首席开源官Lys andre发了一条推文
00:03:42.466 → 00:03:44.633
揭秘了他们是怎么优化Inkling的
00:03:44.633 → 00:03:46.066
他们做了两件事
00:03:46.066 → 00:03:49.066
第一 把模型里原来的Causal Con v1D替换
00:03:49.066 → 00:03:51.700
成了一个叫causal- conv 1d的开源内核
00:03:51.700 → 00:03:55.666
就改了一行代码 每秒处理的token数增加了4%
00:03:55.666 → 00:03:57.666
第二 把注意力机制的实现
00:03:57.666 → 00:04:01.133
换成了Flash Attention- 4 又是一行代码
00:04:01.133 → 00:04:04.066
每秒处理的token数又提升了11%
00:04:04.066 → 00:04:07.233
在Hugging Face首席开源官Lysandre的测试中
00:04:07.233 → 00:04:11.633
两次底层实现替换让推理吞吐量合计提升约15%!
00:04:11.633 → 00:04:15.066
而且 他们甚至还没开始碰最复杂的MOE层
00:04:15.066 → 00:04:17.833
这说明了什么?说明现在的AI工程
00:04:17.833 → 00:04:20.000
正在变得像搭乐高积木一样
00:04:20.000 → 00:04:23.966
内核开发者专门去卷底层算子 把速度做到极致;
00:04:23.966 → 00:04:27.066
模型开发者只需要像改配置文件一样
00:04:27.066 → 00:04:28.633
把最好的内核插进去
00:04:28.633 → 00:04:30.133
这种模块化的解耦
00:04:30.133 → 00:04:33.933
才是推动AI基础设施狂飙突进的真正动力
00:04:33.933 → 00:04:37.400
意味着模型开发者不一定要亲自编写CUDA内核
00:04:37.400 → 00:04:39.900
也能快速试用社区里的优化实现
00:04:39.900 → 00:04:42.400
当然 接入之后仍然要验证兼容性
00:04:42.400 → 00:04:44.900
数值正确性和真实负载表现
00:04:44.900 → 00:04:47.166
这就像是AI工程的"民主化"
00:04:47.166 → 00:04:49.833
以前 只有大厂有能力去优化这些东西
00:04:49.833 → 00:04:52.533
现在 任何有能力的工程师都
00:04:52.533 → 00:04:56.500
可以通过组合这些开源内核 来构建高效的AI系统
00:04:56.500 → 00:04:59.966
第三 落地与效率:可控思考的降维打击
00:04:59.966 → 00:05:03.233
我们知道 现在的模型越来越聪明 但也越来越贵
00:05:03.233 → 00:05:06.466
很多时候 我们不需要模型去解什么黎曼猜想
00:05:06.466 → 00:05:09.933
我们只需要它帮我写个正则 或者整理个表格
00:05:09.933 → 00:05:12.700
Inkling引入了一个非常硬核的机制
00:05:12.700 → 00:05:14.866
叫做Controllable Thinking Effort
00:05:14.866 → 00:05:16.833
也就是"可控思考努力"
00:05:16.833 → 00:05:20.300
你可以把它理解为给模型装了一个油门踏板
00:05:20.300 → 00:05:23.866
你可以把努力等级从0.2踩到0.99
00:05:23.866 → 00:05:26.966
在Terminal Bench 2.1的官方测试曲线上
00:05:26.966 → 00:05:29.800
Inkling用约三分之一的平均生成token
00:05:29.800 → 00:05:32.400
达到与Nemotron 3 Ultra相同的分数
00:05:32.400 → 00:05:35.666
这说明它在该测试中的输出token效率更高
00:05:35.666 → 00:05:38.500
在同一模型 相同部署和任务条件下
00:05:38.500 → 00:05:40.400
更少的生成token通常
00:05:40.400 → 00:05:42.733
有助于缩短生成阶段的延迟
00:05:42.733 → 00:05:44.966
也可能降低按token计费的费用;
00:05:44.966 → 00:05:46.966
但跨模型不能只靠token数
00:05:46.966 → 00:05:49.000
比较真实成本和并发能力
00:05:49.000 → 00:05:52.366
这个机制的妙处在于 它给了用户选择的自由
00:05:52.366 → 00:05:54.100
你可以根据你的业务需求
00:05:54.100 → 00:05:56.266
动态调整模型的推理成本
00:05:56.266 → 00:05:59.800
简单的任务可以用较低的努力等级快速出结果
00:05:59.800 → 00:06:01.766
复杂的任务可以调高努力
00:06:01.766 → 00:06:03.933
等级让模型花更多时间思考
00:06:03.933 → 00:06:06.600
具体数值仍然要根据业务评测决定
00:06:06.600 → 00:06:09.666
当然 可控思考并非开放权重模型独有
00:06:09.666 → 00:06:12.600
OpenAI API也已经提供了类似的功能
00:06:12.600 → 00:06:14.600
但Inkling真正不同的地方
00:06:14.600 → 00:06:17.066
是用户不仅能调节推理强度
00:06:17.066 → 00:06:20.166
还能拿到权重 继续微调和自行部署
00:06:20.166 → 00:06:21.733
看到这里 你可能会想:
00:06:21.733 → 00:06:25.900
好吧,它很省钱 它很容易优化 但它在各大榜单上
00:06:25.900 → 00:06:27.666
并不是所有科目都是第一啊?
00:06:27.666 → 00:06:30.766
比如视觉能力MMMU Pro的测试
00:06:30.766 → 00:06:35.466
官方数据约73.5% 还比不上Kimi K2.6的79%
00:06:35.466 → 00:06:38.166
但这里有个很离谱的地方 很多人理解错了
00:06:38.166 → 00:06:41.533
大家都被各大厂商的Benchmark跑分给PUA了
00:06:41.533 → 00:06:45.400
以为大模型比拼的只是谁的分数高 谁的参数多
00:06:45.400 → 00:06:47.866
但Thinking Machines的团队非常清醒
00:06:47.866 → 00:06:49.933
他们在官方博客里明确承认:
00:06:49.933 → 00:06:52.100
Inkling不是今天最强的模型
00:06:52.100 → 00:06:55.766
那他们追求的是什么?是"平衡"和"可定制性"
00:06:55.766 → 00:06:57.233
在官方的演示里
00:06:57.233 → 00:07:00.400
他们让Inkling做了一件非常赛博朋克的事情:
00:07:01.466 → 00:07:04.566
官方展示了一个受控的自我微调闭环:
00:07:04.566 → 00:07:06.033
在人类给定目标
00:07:06.033 → 00:07:08.700
(比如"训练成不使用字母e的模型")
00:07:08.700 → 00:07:10.966
并提供OpenCode与Tinker权限后
00:07:10.966 → 00:07:12.833
Inkling自己编写训练任务
00:07:12.833 → 00:07:15.900
运行微调 评估结果并切换到新权重
00:07:15.900 → 00:07:17.966
这才是真正的认知反转
00:07:17.966 → 00:07:20.633
一个能在接入工具后承担Agentic任务
00:07:20.633 → 00:07:22.700
并在官方演示的工具环境
00:07:22.700 → 00:07:25.033
中完成自我微调闭环的模型
00:07:25.033 → 00:07:28.900
远比一个只会做多选题的做题家模型要可怕得多
00:07:28.900 → 00:07:32.166
说明大模型的评估标准本身就在发生变化
00:07:32.166 → 00:07:35.100
以前 我们用Benchmark来评估模型
00:07:35.100 → 00:07:36.866
因为那是最客观的方式
00:07:36.866 → 00:07:38.933
但现在 我们需要评估的是
00:07:38.933 → 00:07:41.200
模型在真实场景中的表现
00:07:41.200 → 00:07:43.866
是它的可定制性 是它的工程化程度
00:07:43.866 → 00:07:45.566
Inkling在OpenCode
00:07:45.566 → 00:07:48.933
Tinker等工具支持下完成自我微调闭环的演示
00:07:48.933 → 00:07:50.933
就是这种新评估标准的体现
00:07:50.933 → 00:07:54.200
这给我们普通开发者和工程师带来了什么启示?
00:07:54.200 → 00:07:56.366
我认为 AI基础设施的
00:07:56.366 → 00:07:58.533
乐高化时代已经全面到来了
00:07:58.533 → 00:08:00.433
以前 搞大模型是炼丹
00:08:00.433 → 00:08:04.233
是个玄学 你需要一堆博士在机房里调整参数
00:08:04.233 → 00:08:07.666
但现在 从多模态输入表示到推理内核
00:08:07.666 → 00:08:10.633
越来越多环节正在被标准化和模块化
00:08:10.633 → 00:08:14.000
未来的核心竞争力 在于你能不能熟练地使用
00:08:14.000 → 00:08:16.666
开源社区提供的这些高质量"零件"
00:08:16.666 → 00:08:19.233
你需要掌握的是像Tinker这样的平台
00:08:19.233 → 00:08:23.433
学会怎么用业务数据去微调像Inkling这样平衡的基座模型
00:08:23.433 → 00:08:26.033
把它变成你特定业务场景下的专家
00:08:26.033 → 00:08:30.166
算力确实决定了模型的下限 但优秀的工程实践
00:08:30.166 → 00:08:33.866
绝对能决定它的上限 这对创业者来说尤其重要
00:08:33.866 → 00:08:35.566
以前 想要做一个AI产品
00:08:35.566 → 00:08:37.566
你需要有大量的计算资源
00:08:37.566 → 00:08:39.866
需要有一支强大的ML团队
00:08:39.866 → 00:08:42.366
现在 开发者可以利用Tinker等平台
00:08:42.366 → 00:08:44.866
用业务数据继续微调基座模型
00:08:44.866 → 00:08:47.233
但真正落地仍然需要数据治理
00:08:47.233 → 00:08:49.133
评测 部署和安全体系
00:08:49.133 → 00:08:51.900
开放权重降低的是模型定制门槛
00:08:51.900 → 00:08:54.400
并不会消除AI产品的工程成本
00:08:54.400 → 00:08:56.566
Inkling的发布 只是一个开始
00:08:56.566 → 00:08:59.500
它证明了1万亿参数的开放权重模型
00:08:59.500 → 00:09:02.866
在经过良好的工程优化后 可以被更高效地利用
00:09:02.866 → 00:09:05.200
虽然Inkling已提供NV FP4
00:09:05.200 → 00:09:08.166
量化权重和多种推理框架支持
00:09:08.166 → 00:09:10.333
可以部署在高端多卡服务器上
00:09:10.333 → 00:09:12.333
或者通过第三方API使用
00:09:12.333 → 00:09:16.433
距离普通企业服务器轻松本地运行仍有明显门槛
00:09:16.433 → 00:09:18.300
但这种趋势是不可逆的
00:09:18.300 → 00:09:20.366
未来 我们会看到更多原生支持
00:09:20.366 → 00:09:23.333
音视频输入的多模态模型开放权重
00:09:23.333 → 00:09:26.400
而这些模型 将不再是简单的聊天机器人
00:09:26.400 → 00:09:29.700
它们在接入浏览器 代码执行器等工具后
00:09:29.700 → 00:09:33.066
可以承担Agentic Web开发和长流程编码任务
00:09:33.066 → 00:09:35.833
更接近能完成复杂任务的数字协作者
00:09:35.833 → 00:09:37.633
开源与闭源的商业竞争
00:09:37.633 → 00:09:40.566
西方开源与东方开源的技术角逐
00:09:40.566 → 00:09:42.933
才刚刚进入最精彩的下半场
00:09:42.933 → 00:09:45.200
我甚至大胆预测 未来的AI应用
00:09:45.200 → 00:09:48.733
不会再是"大模型 + 简单提示词"这种模式
00:09:48.733 → 00:09:52.600
而是会变成"小型定制化模型+复杂的工程系统"
00:09:52.600 → 00:09:55.100
更多公司可能会维护定制模型
00:09:55.100 → 00:09:57.466
基于像Inkling这样的权重基座
00:09:57.466 → 00:09:59.333
通过微调和优化得到的
00:09:59.333 → 00:10:02.700
这样做的好处是 你既能享受开源社区的成果
00:10:02.700 → 00:10:05.900
又能在自托管和完善数据治理的前提下
00:10:05.900 → 00:10:07.566
更好控制敏感数据
00:10:07.566 → 00:10:08.966
总结一下今天的内容:
00:10:08.966 → 00:10:11.800
Inkling的震撼 不在于它跑分有多高
00:10:11.800 → 00:10:14.566
而在于它向我们展示了AI工程化
00:10:14.566 → 00:10:16.733
模块化和极致效率的未来
00:10:16.733 → 00:10:18.900
一个1万亿参数的模型
00:10:18.900 → 00:10:22.966
通过两次底层实现的替换 吞吐量提升约15%
00:10:22.966 → 00:10:26.166
一个模型能在受控环境下完成微调闭环
00:10:26.166 → 00:10:29.666
一个开放权重模型能在Agentic Web App排行榜
00:10:29.666 → 00:10:33.633
上和闭源的Claude Opus 4.6处于同一分数区间
00:10:33.633 → 00:10:35.000
这些都不是偶然
00:10:35.000 → 00:10:38.200
而是AI工程发展到一定阶段的必然结果
00:10:38.200 → 00:10:40.866
那么 你觉得Inkling这种主打工程
00:10:40.866 → 00:10:44.233
效率和可定制性的开放权重模型
00:10:44.233 → 00:10:46.700
能否真正撼动目前国内大模型
00:10:46.700 → 00:10:49.100
比如Kimi和GLM的强势地位呢?
00:10:49.100 → 00:10:51.700
把你的看法打在公屏上 我们一起讨论
00:10:51.700 → 00:10:54.066
如果你觉得这期视频对你有启发
00:10:54.066 → 00:10:57.900
别忘了点赞投币收藏 一键三连是对我最大的支持
00:10:57.900 → 00:10:59.966
感谢观看 我是为什么叫QQ
00:10:59.966 → 00:11:01.166
我们下期再见!