大家好 我是为什么叫QQ 你以为1T开放权重模型的看点 只剩下参数有多大? 7月15日 前OpenAI CTO Mira Murati 创办的Thinking Machines 发布了首个模型Inkling (Nathan Lambert在X上把它简称为Thinky) 975B总参数 41 B 激活 原生接收文本 图像和音频输入 官方自己先泼了一盆冷水:它不是当前最强模型 但Hugging Face首席开源官 Lys andre Debut只替换了两个底层实现 在一次测试里 就把推理吞吐量提高了约15% 所以Inkling真正值得看的 不是它有没有夺冠 而是开放权重模型正在变得多容易优化 多容易改造 这几天 如果你经常刷推特或者国外的技术社区 你一定会看到Inkling被疯狂刷屏 顶级风投Menlo Ventures的合伙人Deedy Das 把它评价为"中国以外最好的开放权重模型"; Nathan Lambert则称其为 目前最强的美国开放权重模型 但这都是综合判断 不是统一排行榜给出的官方冠军 而在发布当天的Design Arena 的Agentic Web App Arena上 Inkling以1257 Elo排名第9 是其中排名最高的美国开放权重模型 并与Claude Opus 4.6处于同一分数区间 为什么整个AI圈 从底层内核开发者 到上层应用平台 再到风投资本 都在为这个并非"最强"的模型疯狂打Call? 它到底解决了什么痛点? 我们先来摸一下Inkling的基本盘 它是Thinking Machines 这家公司发布的第一个模型 这家公司什么来头? CEO就是之前在OpenAI呼风唤雨的Mira Murati Inkling是混合专家架构的Transformer模型 总参数量高达9750亿 接近1T 但每次推理激活的参数只有410亿 它吃下了45万亿个token的数据 原生支持文本 图像和音频的输入 最关键的是 Inkling开放了权重 模型页标注Apache-2.0 允许研究 微调和一般商业集成 但使用者仍需遵守官方的可接受使用政策 听起来是很强 但老实说 现在1T级别的 模型也不算什么稀罕物了 它凭什么让工程师们这么兴奋? 为了搞清楚这个问题 我们得从三个完全不同的视角来拆解它 第一 地缘与格局的视角: 开放权重模型的生态博弈 如果你仔细看外网的评论 会发现一个很有意思的现象 大家在夸Inkling的时候 总喜欢拿它和中国模型做对比 为什么? 因为在过去这大半年里 中国的开放权重模型 尤其是Kimi的系列 还有智谱的GLM系列 在各种榜单上表现非常抢眼 从Nathan Lambert和Deedy Das的评价看 Inkling模型至少让美国开放权重阵营多了 一款有竞争力的大型原生多模态模型 在Tinker平台上 有真实用户 比如Mantic AI就做过测试 在他们未公开方法的预测评测中 Inkling超过了Kimi K2.6 输出token约为后者一半 虽然这只是客户的自有评测 但也侧面反映了Inkling 在某些特定任务上的潜力 这背后反映的是什么? 是整个AI基础设施竞争格局的变化 以前 大模型的竞争主要在美国和中国之间 现在 Thinking Machines这样的新兴创业公司 通过开放权重的方式 直接参与到全球AI生态的建设中 我的判断是 开放权重不仅是技术选择 也带有明显的生态战略考虑: 让更多开发者围绕Inkling部署 微调和优化 能够快速扩大模型的使用生态 第二 工程视角的震撼:优化的"乐高化" 这是我作为程序员觉得最兴奋的一点 Hugging Face首席开源官Lys andre发了一条推文 揭秘了他们是怎么优化Inkling的 他们做了两件事 第一 把模型里原来的Causal Con v1D替换 成了一个叫causal- conv 1d的开源内核 就改了一行代码 每秒处理的token数增加了4% 第二 把注意力机制的实现 换成了Flash Attention- 4 又是一行代码 每秒处理的token数又提升了11% 在Hugging Face首席开源官Lysandre的测试中 两次底层实现替换让推理吞吐量合计提升约15%! 而且 他们甚至还没开始碰最复杂的MOE层 这说明了什么?说明现在的AI工程 正在变得像搭乐高积木一样 内核开发者专门去卷底层算子 把速度做到极致; 模型开发者只需要像改配置文件一样 把最好的内核插进去 这种模块化的解耦 才是推动AI基础设施狂飙突进的真正动力 意味着模型开发者不一定要亲自编写CUDA内核 也能快速试用社区里的优化实现 当然 接入之后仍然要验证兼容性 数值正确性和真实负载表现 这就像是AI工程的"民主化" 以前 只有大厂有能力去优化这些东西 现在 任何有能力的工程师都 可以通过组合这些开源内核 来构建高效的AI系统 第三 落地与效率:可控思考的降维打击 我们知道 现在的模型越来越聪明 但也越来越贵 很多时候 我们不需要模型去解什么黎曼猜想 我们只需要它帮我写个正则 或者整理个表格 Inkling引入了一个非常硬核的机制 叫做Controllable Thinking Effort 也就是"可控思考努力" 你可以把它理解为给模型装了一个油门踏板 你可以把努力等级从0.2踩到0.99 在Terminal Bench 2.1的官方测试曲线上 Inkling用约三分之一的平均生成token 达到与Nemotron 3 Ultra相同的分数 这说明它在该测试中的输出token效率更高 在同一模型 相同部署和任务条件下 更少的生成token通常 有助于缩短生成阶段的延迟 也可能降低按token计费的费用; 但跨模型不能只靠token数 比较真实成本和并发能力 这个机制的妙处在于 它给了用户选择的自由 你可以根据你的业务需求 动态调整模型的推理成本 简单的任务可以用较低的努力等级快速出结果 复杂的任务可以调高努力 等级让模型花更多时间思考 具体数值仍然要根据业务评测决定 当然 可控思考并非开放权重模型独有 OpenAI API也已经提供了类似的功能 但Inkling真正不同的地方 是用户不仅能调节推理强度 还能拿到权重 继续微调和自行部署 看到这里 你可能会想: 好吧,它很省钱 它很容易优化 但它在各大榜单上 并不是所有科目都是第一啊? 比如视觉能力MMMU Pro的测试 官方数据约73.5% 还比不上Kimi K2.6的79% 但这里有个很离谱的地方 很多人理解错了 大家都被各大厂商的Benchmark跑分给PUA了 以为大模型比拼的只是谁的分数高 谁的参数多 但Thinking Machines的团队非常清醒 他们在官方博客里明确承认: Inkling不是今天最强的模型 那他们追求的是什么?是"平衡"和"可定制性" 在官方的演示里 他们让Inkling做了一件非常赛博朋克的事情: 自我微调 官方展示了一个受控的自我微调闭环: 在人类给定目标 (比如"训练成不使用字母e的模型") 并提供OpenCode与Tinker权限后 Inkling自己编写训练任务 运行微调 评估结果并切换到新权重 这才是真正的认知反转 一个能在接入工具后承担Agentic任务 并在官方演示的工具环境 中完成自我微调闭环的模型 远比一个只会做多选题的做题家模型要可怕得多 说明大模型的评估标准本身就在发生变化 以前 我们用Benchmark来评估模型 因为那是最客观的方式 但现在 我们需要评估的是 模型在真实场景中的表现 是它的可定制性 是它的工程化程度 Inkling在OpenCode Tinker等工具支持下完成自我微调闭环的演示 就是这种新评估标准的体现 这给我们普通开发者和工程师带来了什么启示? 我认为 AI基础设施的 乐高化时代已经全面到来了 以前 搞大模型是炼丹 是个玄学 你需要一堆博士在机房里调整参数 但现在 从多模态输入表示到推理内核 越来越多环节正在被标准化和模块化 未来的核心竞争力 在于你能不能熟练地使用 开源社区提供的这些高质量"零件" 你需要掌握的是像Tinker这样的平台 学会怎么用业务数据去微调像Inkling这样平衡的基座模型 把它变成你特定业务场景下的专家 算力确实决定了模型的下限 但优秀的工程实践 绝对能决定它的上限 这对创业者来说尤其重要 以前 想要做一个AI产品 你需要有大量的计算资源 需要有一支强大的ML团队 现在 开发者可以利用Tinker等平台 用业务数据继续微调基座模型 但真正落地仍然需要数据治理 评测 部署和安全体系 开放权重降低的是模型定制门槛 并不会消除AI产品的工程成本 Inkling的发布 只是一个开始 它证明了1万亿参数的开放权重模型 在经过良好的工程优化后 可以被更高效地利用 虽然Inkling已提供NV FP4 量化权重和多种推理框架支持 可以部署在高端多卡服务器上 或者通过第三方API使用 距离普通企业服务器轻松本地运行仍有明显门槛 但这种趋势是不可逆的 未来 我们会看到更多原生支持 音视频输入的多模态模型开放权重 而这些模型 将不再是简单的聊天机器人 它们在接入浏览器 代码执行器等工具后 可以承担Agentic Web开发和长流程编码任务 更接近能完成复杂任务的数字协作者 开源与闭源的商业竞争 西方开源与东方开源的技术角逐 才刚刚进入最精彩的下半场 我甚至大胆预测 未来的AI应用 不会再是"大模型 + 简单提示词"这种模式 而是会变成"小型定制化模型+复杂的工程系统" 更多公司可能会维护定制模型 基于像Inkling这样的权重基座 通过微调和优化得到的 这样做的好处是 你既能享受开源社区的成果 又能在自托管和完善数据治理的前提下 更好控制敏感数据 总结一下今天的内容: Inkling的震撼 不在于它跑分有多高 而在于它向我们展示了AI工程化 模块化和极致效率的未来 一个1万亿参数的模型 通过两次底层实现的替换 吞吐量提升约15% 一个模型能在受控环境下完成微调闭环 一个开放权重模型能在Agentic Web App排行榜 上和闭源的Claude Opus 4.6处于同一分数区间 这些都不是偶然 而是AI工程发展到一定阶段的必然结果 那么 你觉得Inkling这种主打工程 效率和可定制性的开放权重模型 能否真正撼动目前国内大模型 比如Kimi和GLM的强势地位呢? 把你的看法打在公屏上 我们一起讨论 如果你觉得这期视频对你有启发 别忘了点赞投币收藏 一键三连是对我最大的支持 感谢观看 我是为什么叫QQ 我们下期再见!