昨天晚上呢 月之暗面把Kimi K3呢正式开放了 那这个模型呢 干了两件非常非常有冲击力的事情 第一呢 它把全球开源模型的参数记录 直接翻了一个倍 K3模型的参数呢是2.8万亿 什么概念呢 在之前的开源阵营里面 最大的是DeepSeek 只有1.6万亿 那么K3的大小呢 差不多是它的两倍 第二点 在一项 衡量真实知识工作的评测里面呢 它排到了全球第三 第一名和第二名呢 分别是Claude Fable 5和GPT-5.6 Sol 而且要注意的是Claude Opus 4.8 被它挤到了后面一名 开源模型呢 第一次站到了 闭源次旗舰模型的前面 那么这期视频呢 我们就来详细地了解一下Kimi K3 它到底强在哪 价格又有多狠 先来看一下时间线 其实在7月15号 Kimi的开放平台的一个促销页面 已经提前泄露了 大家就知道可能有新的模型要上了 那么在十六号 也就是昨天的晚上 Kimi K3呢正式上线 分别在Kimi的APP 以及Kimi Code里面都可以使用了 现在只要进入网站APP 包括如果你是Kimi Code的会员 都可以正式使用Kimi K3了 这个时间点呢 也非常的微妙 正好卡在 上海的世界人工智能大会前面 而且呢 月之暗面也正在谈新的一轮融资 估值呢大约是315亿美元 Kimi K3这个成绩单是给谁看的 就不用我多说了 然后来看一下规格 2.8万亿这个参数呢 肯定是非常吸引眼球的 但是我觉得比大更值得 看的是它怎么样把这么大的模型 给它跑起来 看官方放的这张结构图呢 我们也可以看到有两个新的东西 一个叫KDA,Kimi Delta Attention 混合线性注意力 简单解释就是 传统注意力的计算量呢 会随着上下文长度平方级上涨 越长呢就越贵 那么K3的做法是呢 是每四层里面 三层用便宜的线性注意力 然后一层用完整的全注意力 这里省下来的算力换成一个东西 100万Token的上下文 之前Kimi K2的上下文长度呢 只有256K直接翻了4倍 另外一个新的东西叫Attention Residuals 让深层网络把浅层的注意力信息呢 直接接力上来 官方说这套组合 让整体的训练效率 做到了Kimi K2的2.5倍 然后就是混合专家系统这块 做的也非常非常的激进 整个模型呢有896个专家 每次推理呢只激活16个 也就是说虽然总参数量是2.8万亿 但是真正干活的每次呢 只是里面很小的一部分 再来看一下成绩单 我挑三个重点的在视频里面说一下 第一个呢 是刚才视频开头提到的GDPval 它测的呢不是做题 是44个职业里面真实的工作任务 那么K3呢是拿了1,687分 全球第三名 第二个呢 是GPQA Diamond 研究生级别的科学题 它的得分呢是93.5% 是目前所有开源模型里面 得分最高的 第三个呢 我觉得是最实在的BrowseComp 在网上检索问题的答案 得分呢是91.2% 也是当时公开成绩里面最高的 那么这一项呢 很明显是吃到了100万上下文的红利 当然测评呢也只能说明一半 另一半呢我们还要真实上手去测试 这里呢我测试了两个案例 第一个测试呢 是让它根据官方的报道 以及我自己整理的文件 让它直接帮我生成一份Kimi K3 不低于12页的一个PPT幻灯片 并且直接以网页的形式展现 那么这个呢 就是它一次性完成的任务 可以先从第一屏看一下 Kimi K3开源模型 第一次摸到了闭源模型 次旗舰的门槛 这是等于是PPT的封面 然后它最主要的几个参数 它的配色 它的布局 还有这些数据的提取哈 全部是Kimi K3呢自动去完成的 我觉得这个版面的布局 以及参数的提取 配色其实都做的非常好 而且内容呢非常的详尽 非常的丰富 还有关于它的这个架构拆解 这种图表设计 也全部是它一次性完成的 目前看下来没有找到很明显的错误 基本上 可以达到一个直接使用的水平了 而且是没有创建任何skill的前提下 只是给它发了一个简单的报告 以及一个prompt 让他生成PPT啊 就完成了 这能力我觉得还是不错的 然后我在测试过程当中呢 发现一个比较明显的问题 就是不知道是现在使用的人比较多 还是什么的哈 就是我发送了这样一条prompt过去 它整个完成这个任务的耗时 时间非常的长 至少花费了十几分钟 那这个任务 如果以往是用GPT或者用Claude去完成 我觉得这时间 肯定是在10分钟以内的 因为任务并不是特别的难 然后它的内容也不是很多 用Kimi K3呢 生成任务的时间呢 是超出了我的预期的 然后第二个任务呢 是我让它基于我前面两期视频 我是创建了一个体感游戏 用谷歌的模型 它可以监控我们人体的关节部位 首先我是做了一个体感监视器 这个在上期视频已经讲过了 包括它的项目 我已经开源到GitHub上面去了 后面呢 我又用GPT-5.6 Sol添加了几个体感游戏 比如有体感穿墙 星球互联 还有这个切水果的游戏 以及双人对打的游戏啊 这个是之前评测Claude Fable 5 以及GPT-5.6 Sol生成的 然后今天呢 我是想用这个Kimi K3 去做一个体感消消乐的游戏 那其实像这套框架哈 在我原来项目里面它它已经生成了 也就是它的模型啊 它的底层逻辑啊 框架都有了 只是让它在这个基础上 去增加一个体感消消乐的游戏 那么今天用Kimi K3呢 出现了两个问题 第一个问题呢 就是刚才我提到的它的耗时呢 非常非常的久 运行了差不多十几二十分钟 都没有完成 然后第二个问题呢 就是我目前开通的是 Kimi的第二个等级的套餐 也就是一个月是99块钱 那么是可以在Kimi Code里面 去使用这个Kimi K3的模型 如果你开通的是第一个等级的套餐 目前在Kimi Code里面 是使用不了这个K3的模型的 完事呢我在测试第二个任务的 时候可以看到 它给我罗列的TODO里面 有这么多步骤 我觉得这个步骤 是设计得有点过于冗余的 然后在做第二个任务的时候 仅仅只是完成了第一条TODO 它五个小时的用量限制 就已经达到了 然后 并且呢周用量也达到了20%的使用 也就是说 我开通99块钱一个月的会员 仅仅只是完成了一个多的任务 第二个任务还没有完成 有可能是因为这个模型太大 然后现在用的人太多 所以它整体的一个使用量限制 比较少 包括我开通的这个第二等级的会员 啊它并不支持100万的上下文 只有256K那么 你必须是开通这个200块钱一个月的 啊 才可以享受100万的上下文 长度给我的感觉 还是不知道因为算力 还是什么其他原因啊 诚意不是特别的够 接下来呢 说一下价格 这个可能是对使用者 开发者杀伤力最大的部分 输入呢是3美元每100万TOKEN 输出呢是15美元 如果是缓存命中的话 输入只要3毛 这一块呢 一直是Kimi做的比较好的地方 OK 那么强的地方呢 已经说完了 接下来呢 来泼两盆冷水 第一盆呢 全球最大开源模型的这个说法呢 它现在还只是一个期货模型 能用是真的 但是呢权重还没有开放 官方是承诺在7月27号之前 放出完整的权重和技术报告 第二盆呢 就算是权重开放了 我们自己本地电脑呢 也是跑不动的 2.8万亿参数呢 就算你有1.5TB内存的Mac Studio集群 跑起来都够呛 这是一个数据中心级别的模型 所以开源对于个人的意义呢 更多是让第三方平台 能便宜的把它跑起来 而不是说把它下载到本地自己去跑