朋友们我真的没有碰瓷Codex的意思 但是在视频理解这个多模态场景 很可能你用的Coding Agent 一直都是残血 那谁不是残血 所有搭配了Kimi Code的多模态模型 都不是残血 我说的是所有模型 我知道Kimi刚发的K2.7很强 但本期视频不是模型测评 请跟我把注意力都放在Kimi Code上 我要分享一个新的发现 在多模态领域 它到底是补齐了什么样的能力 以及它可能带来的一个重大商机 视频很长 但内容很好理解 点个收藏 我们继续 事情是这样子的 最近 不是Kimi推出了Kimi Code这个工具吗 它可以看作 是对原先Kimi CLI的一次重构和升级 而且官方在浓墨重笔的强调 它的视频理解能力 最近不是Anthropic的Fable5也出了 随即Kimi K2.7 Code的这个模型也发布了 那我就想着我也试试吧 拿它来和Fable5比一比 看看谁厉害 我看到一位推友发的 用higgsfield里的Fable5做的游戏的demo 于是呢我就录了个屏 把这个视频丢给了Kimi Code 我的提示词就几个字读取这个demo 完整复刻它 它居然就做出来了 不能说完全一样 但完全能玩 我不信邪啊 我又找了一个Fable5实现的 中国功夫的粒子动画的Demo 我的提示词是让它1:1的复刻 它不仅实现了 甚至还把我录屏时 不小心录进去的视频播放控件 也复刻了 我后来还测试了很多Demo 全部都复刻出来了 可是官方在发布Kimi Code的时候 他就在强调视频能力的 但那个时候K2.7还没发布啊 难道说这个能力 关键在于Kimi Code这个工具本身 那么带着这个疑问 我就开始分析Kimi Code的代码 以及主流的Coding Agent 我想看看到底有什么区别 欸还真让我猜中了 我调查了所有主流Agent里 只有Kimi Code 它的这一套链路 明确的把视频放进了上下文 放进了Agent循环中 所以它在执行任务的过程中 始终都会有视频的信息 那我们用ClaudeCode或者是Codex OpenCode 它们当下的版本 都只支持到了图片这一层 一旦这类工具读取了视频 他们都会用抽帧的方式 来读许多张图 来实现视频理解 在很多时候 这个确实也够用了 比如说你复刻一个网页游戏 通过几张图(关键帧) 你就能理解出整个游戏 或者是前端界面的交互逻辑 但是我要说 抽帧理解视频其实是残血的 因为Kimi Code的代码告诉我 视频它不是多张图 我恍然大悟啊 我仔细分析了Kimi在 《Kimi K2.5: Visual Agentic Intelligence》这篇论文的描述 我得知了 它不是简单的把视频拆成多张图的 它是把连续的几帧 当做一个时空块来编码 也就是说 模型看到的不是孤立的截图 而是这些截图之间的变化关系 这个就很关键 因为视频里的动作转场节奏 速度因果关系 它都不在一张图里 而在图和图之间 那抽帧的方案 你看到只是一个状态 但视频的上下文看到的是整个的过程 这就是为什么说 如果你使用的是Claude Code这种 只是通过抽帧方式的Coding Agent 用它来使用K2.7 那这个视频任务里 就会少掉一部分时间维度的信息 因为你把视频拆成帧了 帧和帧之间的变化关系就会失真 就会丢失 那时间这个信息就这么重要吗 通过多张图 难道不能推理出前后的逻辑吗 于是我又做了一个实验 我有一位很喜欢的财经类博主 他前年发布了一段对SpaceX IPO的解读 哇那段桥的故事 无论是叙事逻辑还是动画展示 都堪称是经典 那我用这段做了一个小的测试 我考验了Kimi Code和Codex 能不能通过理解视频 再通过HyperFrame这种视频制作工具 完整的把这个故事讲出来 但是我要先叠个厚厚的甲 声明一下 我只是为了测试Harness的能力边界 所以才用了这段做测试 同时 我也完全不赞同用多模态模型 蒸馏其他视频博主的剪辑 和叙事手法 而且 我更想通过这个视频提醒各位博主 视频里的叙事和剪辑技巧 被AI实现正在成为可能 实验的结果是这样子 我给了Codex两次机会 第一次给它视频片段 让它去实现 我还开了最高档的思考 可他完成的效果很差 我怀疑 他是不是还没法从截图中找到逻辑 第二次我给他提供了完整的 根据时间戳对齐的字幕文件 帮他来理解上下文 可他依然是把一段 充分利用摄像机运镜的效 果硬生生是给做成了PPT 那整个视觉的呈现效果也差了很多 但是Kimi Code的版本就不一样了 让人十分的意外 它不仅更好的对齐了原始的音频 还模拟出了摄像机运镜的效果 哇那整个表达是十分有逻辑的 当然了 和原视频还是有很大距离的 我建议大家可以去找一下原视频 但是如果把原始视频和成品 都交给Kimi Code 再让它一次读入两个视频 并且对不足的方向进行精修 再迭代个几轮 我相信结果会越来越好 而且同时读两个视频的方式 只有它能支持 这个实验让我是有些惊讶 但是也在意料之中 因为脱离了软件开发场景 缺少了帧与帧之间的时间关系 Codex是很难拿出惊艳的 成果 我知道 Codex的上下文是在服务端管理的 所以我们并不清楚他读过的图片 是不是始终以原始的形态 留在上下文里 比如说base64 编码就是一种原始形态 但我十分确定的是 视频类的内容是肯定没有的 所以Codex未来会不会在这个能力上 对齐Kimi Code呢 这就是我标题里提出的问题 我希望他会啊 我是200刀的订阅 我特别希望他也能理解视频 另外在做了这个测试之后 我又拿了一些AE动画在做测试 结果和之前一样 它 不但完整的复刻了动画的视觉效果 连动画的节奏 转场的时机都复刻出来了 注意 这不是普通的低频率抽帧的方案 能稳定做到的只有Kimi Code的这条 链路上时间这个维度的信息 才能被保留的更多 好那我想说的商机到底是什么 咱们假设 如果在符合道德和版权的约束下 我们把一批经过授权 或者开源的视频作品 通过视频理解的方式 来蒸馏成一个 剪辑和叙事经验的知识库 如果你接到一个剪辑任务时 你先用Agent呢 在这个知识库里 检索类似的案例的经验 再结合脚本 来核查提取出叙事动画的方案 最后再通过HyperFrame这样的框架 来快速实现动画 哇那以后 博主是不是只需要构思内容本身了 而所有的表达全部都可以交给Agent 你们说这个库如果能做成 会不会成为一个商机呢 反正我现在已经把Kimi Code 集成到了我的牛马Agent的体系里了 我已经开始用这种能力 去做可行性的验证了 OK商机说到这里 咱们回到现实 我对Kimi Code的代码库 又做了进一步的研究 我发现其实还有很多值得说的内容 比如说它支持其他模型的接入 甚至是 如果你稍微对代码做一些修改的话 本地部署的Qwen3.6 27B 也能实现视频常驻 上下文的这种玩法 那本地多模态模型现在也可以满血 我还发现啊 他甚至对音频类型也留了接口 顺着他的思路 我稍微对他的代码 做了一点点的小改动 我甚至实现了能用本地的模型 分析带音轨的视频 另外我还发现 原本在网页版才能用的Agent Swarm 现在在Kimi Code里就直接就支持 了 比如就拿我们刚才这个场景举例 我给Kimi Code两个视频让它分析 这个时候 可能就用掉了40%的上下文了 但接下来的任务 我就可以启动Agent Swarm来实现 主Agent呢 再也不用触发Compact 所以总的来说 很多更有价值的信息 其实都在它的代码里 官方宣传真不到位啊 一个第一方还是开源的Harness 其实真的值得我们投入更多注意力 那在写这篇稿子的时候 我还有个发现 让我稍微有点失落 把视频放入上下文 其实是在1月的Kimi CLI版本时 就支持了 而我这半年却毫无意识 这就是我正在反省的点 也是想在结尾和大家共勉的 模型厂的Harness 它从来就不只是一个壳 它是模型能力的放大器 也是技术路线的风向标 就拿我刚刚解锁的 Kimi K2.7 Code 的高速版本来说吧 它是可以提高6倍速度 3倍价格 但这不是重点 它不是提速那么简单 它很可能意味着 那些生产流程已经跑通了的用户 对更高速的 把TOKEN转化成成果这件事 有了一种刚需 而这件事 模型厂商最先感知到了 所以他们就推出了这个服务 那这就是一个风向标 现在 第三方工具都在忙着兼容各家的API 忙着实现各种功能 跟上需求 而模型厂自己的Harness 已经把注意力 放在了扩大模型能力的边界上了 我们总是在等模型变强 却常常忽略 其实工具 才是那个让模型能力 真正被看到的窗口 而那个所谓的商机咱 往深了说 也不只是做几个视频剪辑 Agent的那么简单 真正的机会在于 谁最先理解模型厂的技术路线 谁最先在新能力上跑通整个工作流 谁就能在新一轮的模型和工具的迭代里 最早拿到红利 希望今天的视频能启发到大家 咱们必须得动起来了 好了以上就是本期的全部内容了 谢谢大家