WEBVTT

00:00:00.100 --> 00:00:01.500
各位朋友早上好

00:00:01.600 --> 00:00:03.933
今天咱们就来看看本周AI界

00:00:03.933 --> 00:00:06.200
几件暗流涌动的军备竞赛

00:00:06.333 --> 00:00:09.200
从Openai秘密研发的超级新模型

00:00:09.300 --> 00:00:12.133
到阿里悄悄上架的Qwen新势力

00:00:12.333 --> 00:00:13.833
信息量直接拉满

00:00:13.833 --> 00:00:15.900
先看画面这份业内研报

00:00:16.133 --> 00:00:19.300
里面指明Gemini3.5Flash表现平平

00:00:19.600 --> 00:00:22.033
而Openai正研发规模超越

00:00:22.033 --> 00:00:24.000
Estrela的全新预训练模型

00:00:24.033 --> 00:00:24.900
与此同时

00:00:25.066 --> 00:00:26.933
阿里团队在Almerina

00:00:26.933 --> 00:00:29.333
秘密测试代号Kiana的模型

00:00:29.600 --> 00:00:32.033
其3D渲染能力让人惊艳

00:00:32.033 --> 00:00:34.733
此外图像生成领域有重磅进展

00:00:35.033 --> 00:00:37.300
带Openai since day水印的

00:00:37.300 --> 00:00:39.100
蒙娜丽莎已现身竞技场

00:00:39.100 --> 00:00:41.100
马斯克旗下的Grok image

00:00:41.100 --> 00:00:43.300
2.0也已经正式发布

00:00:43.500 --> 00:00:46.433
目前在文生图榜单高居第二

00:00:46.700 --> 00:00:48.900
综合表现同样不容小觑

00:00:49.066 --> 00:00:50.033
遗憾的是

00:00:50.333 --> 00:00:52.300
谷歌原本计划推出的

00:00:52.300 --> 00:00:56.633
120B超大体量模型Gemma V4 1,200亿

00:00:56.833 --> 00:00:59.600
近期爆出该项目已经被取消

00:00:59.633 --> 00:01:01.066
看完这轮大盘概览

00:01:01.066 --> 00:01:03.633
咱们先来深挖Openai的重磅核弹

00:01:04.066 --> 00:01:06.466
知名爆料人Chris在推特指出

00:01:06.700 --> 00:01:09.300
GPT5.5绝不是Openai今年

00:01:09.300 --> 00:01:11.100
最后一次大规模预训练

00:01:11.100 --> 00:01:12.433
爆料里特别强调

00:01:12.533 --> 00:01:15.333
虽然GPT6本身已经足够震撼

00:01:15.400 --> 00:01:18.666
但Openai在年底前还会掏出代号为

00:01:18.933 --> 00:01:20.066
bug的超级模型

00:01:20.200 --> 00:01:23.000
预训练规模将直接创下历史新高

00:01:23.000 --> 00:01:25.133
推文里甚至极其夸张的声称

00:01:25.333 --> 00:01:27.666
bug这款新模型的恐怖性能

00:01:27.800 --> 00:01:29.733
绝对会让之前的fable

00:01:29.933 --> 00:01:31.666
显得像个原始玩具

00:01:32.133 --> 00:01:33.233
不过对于它的发布

00:01:33.233 --> 00:01:35.633
时间线与代号对应关系

00:01:35.700 --> 00:01:37.033
行业内目前依然

00:01:37.033 --> 00:01:38.700
存在不少争论与疑虑

00:01:38.700 --> 00:01:39.866
比如知名博主

00:01:39.866 --> 00:01:41.833
tokengrammaring就公开反驳

00:01:42.266 --> 00:01:45.233
指出SEMI analysis在整理这份报告时

00:01:45.300 --> 00:01:47.433
把7月初的dog信息和

00:01:47.433 --> 00:01:49.666
后续的Astra给彻底搞混了

00:01:49.666 --> 00:01:50.466
在他看来

00:01:50.466 --> 00:01:53.066
dog早在Astra之前就已经

00:01:53.066 --> 00:01:54.866
在内部报告中出现过

00:01:55.200 --> 00:01:57.233
因此它极大概率只是

00:01:57.300 --> 00:02:00.300
Asha早期研发阶段的一个内部代号

00:02:00.400 --> 00:02:03.000
而不是什么全新的后续迭代产品

00:02:03.000 --> 00:02:06.433
毕竟Openai内部取代号向来都很随意

00:02:06.600 --> 00:02:08.433
此前就曾用过像

00:02:08.433 --> 00:02:10.900
Milthree Milfour这种混乱名称

00:02:11.000 --> 00:02:12.933
最后才统一叫Asha

00:02:13.233 --> 00:02:16.000
这也让外界很难做出精准判断

00:02:16.000 --> 00:02:16.733
所以说

00:02:16.733 --> 00:02:19.233
咱们目前依然无法百分百确定

00:02:19.466 --> 00:02:21.400
dog到底代表着一个全新

00:02:21.400 --> 00:02:23.233
的超大模型预训练流

00:02:23.400 --> 00:02:25.400
还是只属于同一批预

00:02:25.400 --> 00:02:27.466
训练中的不同阶段检查点

00:02:27.700 --> 00:02:29.033
依旧充满神秘感

00:02:29.033 --> 00:02:31.100
而如果把视线转向谷歌

00:02:31.300 --> 00:02:33.533
研报给出的结论就更残酷了

00:02:33.700 --> 00:02:36.100
文章直接断言Gemini 3 Pro

00:02:36.100 --> 00:02:38.300
已经是谷歌技术的高峰

00:02:38.700 --> 00:02:40.933
近期deep mind高层的变动更

00:02:40.933 --> 00:02:42.433
是加剧了内部焦虑

00:02:42.433 --> 00:02:43.800
报告甚至预测

00:02:43.933 --> 00:02:48.200
接下来的Gemini3.5Pro实力仅相当于Opus4.5

00:02:48.333 --> 00:02:50.500
甚至不如GLM5.2

00:02:50.600 --> 00:02:53.133
面对Anthropic与Openai的死斗

00:02:53.133 --> 00:02:53.933
很难招架

00:02:53.933 --> 00:02:56.100
不过其中最为引人注意的

00:02:56.133 --> 00:02:57.600
仍然是这份研报

00:02:57.600 --> 00:02:59.500
尾部给出的重磅结论

00:02:59.800 --> 00:03:01.866
Openai已经彻底克服了

00:03:01.866 --> 00:03:03.200
预训练的技术障碍

00:03:03.500 --> 00:03:05.000
规模更为庞大的大g

00:03:05.100 --> 00:03:06.800
模型正在全力推进

00:03:07.100 --> 00:03:10.066
极可能在今年年底前彻底颠覆行业

00:03:10.066 --> 00:03:12.300
聊完海外巨头的暗流涌动

00:03:12.400 --> 00:03:14.433
咱们把视角转回国内

00:03:14.833 --> 00:03:18.433
阿里团队最近在LLM Arena的code

00:03:18.433 --> 00:03:21.000
Arena上悄悄上线了一款代号

00:03:21.000 --> 00:03:23.833
为piano的全新检查点模型

00:03:23.833 --> 00:03:25.933
不少开发者第一时间拿它

00:03:25.933 --> 00:03:28.333
跑起了硬核物理弹道测试

00:03:28.733 --> 00:03:31.500
将提亚娜与Claude OPPO S5以及

00:03:31.500 --> 00:03:34.700
GPT5.6放在同等提示词下

00:03:34.733 --> 00:03:38.000
进行3D前端代码生成的大比拼

00:03:38.033 --> 00:03:40.600
而从最终实测运行效果来看

00:03:40.733 --> 00:03:43.300
提亚娜用threejs生成的

00:03:43.300 --> 00:03:45.300
弩炮模拟动画可以说是

00:03:45.600 --> 00:03:46.500
极其逼真

00:03:46.666 --> 00:03:48.833
不仅整体结构非常完整

00:03:49.066 --> 00:03:50.800
拉弦和发射的物理

00:03:50.800 --> 00:03:52.633
交互更是丝滑顺畅

00:03:52.700 --> 00:03:53.466
在我看来

00:03:53.466 --> 00:03:55.000
这款神秘新模型

00:03:55.300 --> 00:03:58.400
在前端网页开发与复杂逻辑呈现上

00:03:58.466 --> 00:04:01.000
展现出的综合素质完全不

00:04:01.000 --> 00:04:03.266
逊色于目前市场上任何

00:04:03.266 --> 00:04:05.600
顶尖的第一梯队旗舰模型

00:04:05.600 --> 00:04:08.066
如果大家也想亲自体验它的实力

00:04:08.400 --> 00:04:10.700
可以去l美Arena的下拉菜单

00:04:10.700 --> 00:04:13.100
里选择Beta mode盲测模式

00:04:13.466 --> 00:04:15.266
随后进入code Arena

00:04:15.333 --> 00:04:16.866
输入你想要的prompt

00:04:16.866 --> 00:04:18.900
在提交具体需求之后

00:04:19.000 --> 00:04:21.200
系统会有两个完全匿名的

00:04:21.200 --> 00:04:23.600
模型同时在后台生成网页

00:04:23.900 --> 00:04:25.866
用户需要通过对比双边

00:04:25.866 --> 00:04:28.233
生成的结果进行盲测投票

00:04:28.400 --> 00:04:30.300
投票结束后就会揭晓

00:04:30.300 --> 00:04:32.400
代码到底属于哪两款模型

00:04:32.400 --> 00:04:34.266
不过由于抽取是随机的

00:04:34.266 --> 00:04:37.100
想碰上Kiana得运气好或多刷几次

00:04:37.500 --> 00:04:39.833
下面咱们就来看几个它生成

00:04:39.833 --> 00:04:42.233
的代表性高难度实战案例

00:04:42.233 --> 00:04:44.866
咱们先来看这个极其惊艳的案例

00:04:45.233 --> 00:04:48.200
提示词要求生成一个名为AIRO

00:04:48.200 --> 00:04:50.933
one的360度互动耳机展示页面

00:04:51.066 --> 00:04:53.433
Tianna生成的UI显得极其精致

00:04:53.666 --> 00:04:55.533
黑金高级感直接拉满

00:04:55.533 --> 00:04:56.533
更绝的是

00:04:56.600 --> 00:04:58.700
这个页面不仅支持用鼠标

00:04:58.700 --> 00:05:01.333
全向拖拽旋转和自由缩放

00:05:01.700 --> 00:05:03.700
点击耳机上的touch control

00:05:03.833 --> 00:05:04.633
DISC按钮

00:05:04.933 --> 00:05:07.033
还会及时弹出极其精准

00:05:07.033 --> 00:05:09.066
的技术参数标签与提示

00:05:09.400 --> 00:05:10.633
完成度非常高

00:05:10.633 --> 00:05:13.133
而最让人惊叹的则是页面

00:05:13.133 --> 00:05:15.633
底部的动态配色切换功能

00:05:16.000 --> 00:05:17.733
当点击不同颜色按钮

00:05:17.900 --> 00:05:19.866
3D耳机的表面材质与

00:05:19.866 --> 00:05:21.700
光照渲染会实时改变

00:05:21.900 --> 00:05:24.433
这种threejs代码实现水平

00:05:24.600 --> 00:05:26.900
简直远远超越了大多数对手

00:05:26.900 --> 00:05:28.366
看完了单独展示

00:05:28.500 --> 00:05:29.666
咱们再来看一组

00:05:29.666 --> 00:05:31.533
直观的四方横向对比

00:05:32.066 --> 00:05:33.533
在同等提示词下

00:05:33.533 --> 00:05:35.166
生成蒸汽朋克飞艇

00:05:35.433 --> 00:05:38.300
四个画面分别由Claude OPS 5米x

00:05:38.700 --> 00:05:40.633
Tiana Claude Fabo5嗨

00:05:40.733 --> 00:05:42.900
以及昆仑3.8Max渲染

00:05:42.900 --> 00:05:44.300
大家仔细看右上角

00:05:44.300 --> 00:05:46.433
Tiana生成的这艘飞艇

00:05:46.833 --> 00:05:48.366
无论是气囊的网格

00:05:48.566 --> 00:05:50.133
复杂的金属管道

00:05:50.133 --> 00:05:52.666
还是悬挂吊舱的细节丰富度

00:05:52.700 --> 00:05:54.533
都明显碾压了左下角

00:05:54.533 --> 00:05:56.666
FIB五h生成的简化模型

00:05:56.666 --> 00:05:59.333
虽然左上角Opus5在材质与

00:05:59.333 --> 00:06:01.500
细节纹理上略微胜出一点点

00:06:01.733 --> 00:06:04.266
但Kiara展示出的设计合理性

00:06:04.300 --> 00:06:06.900
还有超强的复杂代码构建能力

00:06:07.033 --> 00:06:08.700
已经完全能跟顶尖的

00:06:08.700 --> 00:06:10.466
Opus模型正面交锋了

00:06:10.666 --> 00:06:12.766
结合刚才这一系列惊人表现

00:06:12.900 --> 00:06:14.300
业内普遍推测

00:06:14.366 --> 00:06:16.266
这个代号QIANA的模型

00:06:16.366 --> 00:06:18.733
极可能就是阿里即将发布的

00:06:18.866 --> 00:06:22.033
QWEN4.0或Qwen三点九大更新的

00:06:22.233 --> 00:06:24.533
前哨检查点太值得期待了

00:06:24.533 --> 00:06:26.133
咱们再看这组黄昏

00:06:26.133 --> 00:06:28.466
庄园3D场景的对抗

00:06:28.566 --> 00:06:30.466
由克亚娜与老牌

00:06:30.466 --> 00:06:33.533
葵文3.8Max shy展开直接PK

00:06:34.066 --> 00:06:36.633
这次给到的高难度渲染要求是

00:06:36.633 --> 00:06:39.433
生成一个极致拟真的黄昏乡村庄园

00:06:39.433 --> 00:06:40.933
大家可以清晰的看到

00:06:40.966 --> 00:06:43.633
Tianna生成的庄园简直太惊艳了

00:06:43.700 --> 00:06:46.133
不仅精细的还原了小巧的

00:06:46.133 --> 00:06:48.633
彩灯串与温馨的屋顶光影

00:06:48.766 --> 00:06:50.333
周围还布局了层次

00:06:50.333 --> 00:06:51.933
丰富的花坛和森林

00:06:52.466 --> 00:06:54.300
光影渲染的整体质感

00:06:54.333 --> 00:06:56.233
远远超越了下方的老版本

00:06:56.233 --> 00:06:58.366
可以说是彻底坐实了它作为

00:06:58.366 --> 00:07:00.366
下一代大模型的绝对实力

00:07:00.366 --> 00:07:01.833
聊完了代码与3D

00:07:01.900 --> 00:07:03.366
咱们再把视线转向

00:07:03.366 --> 00:07:05.133
另一个卷到飞起的赛道

00:07:05.266 --> 00:07:06.300
图像生成

00:07:06.733 --> 00:07:09.166
最近在Lrmina竞技场里

00:07:09.166 --> 00:07:11.466
也突然低调上线了一个代号叫

00:07:11.466 --> 00:07:13.900
蒙娜丽莎一的全新图像大模型

00:07:14.133 --> 00:07:15.633
表现同样非常惹眼

00:07:15.633 --> 00:07:17.566
而要说最锤的铁证

00:07:17.700 --> 00:07:20.633
就是用Openai官方的验证工具去

00:07:20.633 --> 00:07:23.366
检测蒙娜丽莎一跑出来的图片

00:07:23.700 --> 00:07:26.266
系统居然直接识别出了Openai

00:07:26.266 --> 00:07:29.133
自家专属的seed ID隐形水印

00:07:29.366 --> 00:07:31.300
这下可以说是当场破案了

00:07:31.300 --> 00:07:33.466
这就意味着Openai在图像

00:07:33.466 --> 00:07:35.566
生成领域也要掏出底牌了

00:07:35.766 --> 00:07:38.233
无论接下来叫ChatGPT image

00:07:38.233 --> 00:07:40.533
2.5还是直接升到3.0

00:07:40.700 --> 00:07:42.566
画质与控图能力都将

00:07:42.566 --> 00:07:44.733
迎来脱胎换骨般的质飞跃

00:07:44.733 --> 00:07:47.633
不过就在各大厂商猛砸算力的时候

00:07:47.833 --> 00:07:50.166
谷歌这边却传来了一条坏消息

00:07:50.533 --> 00:07:52.833
此前被开源社区寄予厚望的

00:07:52.833 --> 00:07:56.066
超大开源模型Gemma V41,200亿

00:07:56.133 --> 00:07:59.133
最新爆料显示已被官方彻底砍掉

00:07:59.133 --> 00:08:01.333
根据泄露的后台界面显示

00:08:01.500 --> 00:08:05.233
这款原本拥有1,230亿参数以及

00:08:05.533 --> 00:08:09.100
262k超百万级上下文窗口的开源旗舰

00:08:09.100 --> 00:08:12.300
大模型已经被标记为了取消状态

00:08:12.466 --> 00:08:14.766
确定不会再面向公众发布了

00:08:14.766 --> 00:08:17.700
这也侧面印证了谷歌在开源与闭源

00:08:17.700 --> 00:08:20.366
战略之间正在经历剧烈的阵痛调整

00:08:20.700 --> 00:08:22.266
他们很可能是想把

00:08:22.266 --> 00:08:23.966
全部计算资源集中起来

00:08:23.966 --> 00:08:26.433
全力冲刺下一代闭源Gemini

00:08:26.700 --> 00:08:27.366
不得不说

00:08:27.366 --> 00:08:28.666
真挺令人唏嘘的

00:08:28.666 --> 00:08:30.500
而除了Openai与谷歌

00:08:30.566 --> 00:08:33.100
马斯克的Grok也不甘示弱

00:08:33.233 --> 00:08:34.233
咱们一起来看看

00:08:34.233 --> 00:08:36.100
这些精美的生成范例

00:08:36.633 --> 00:08:38.033
无论是波普风海报

00:08:38.166 --> 00:08:39.500
细腻纺织纹理

00:08:39.666 --> 00:08:41.466
还是素描步骤拆解

00:08:41.733 --> 00:08:44.166
Grok image 2.0在文字渲染和

00:08:44.166 --> 00:08:46.433
审美排版上都极其出色

00:08:46.433 --> 00:08:47.266
按照惯例

00:08:47.333 --> 00:08:49.633
看完软件层的神仙打架

00:08:49.666 --> 00:08:52.333
咱们在结尾再来看一个极其

00:08:52.333 --> 00:08:55.100
硬核的具身智能硬件项目

00:08:55.366 --> 00:08:58.166
东京大学最新展示了一款名为

00:08:58.566 --> 00:09:01.500
Dragon的空中变形飞行机器人

00:09:01.566 --> 00:09:03.966
它最令人惊叹的地方就是彻底

00:09:03.966 --> 00:09:06.966
打破了传统无人机固定的形态限制

00:09:07.266 --> 00:09:09.166
能在空中完成极度

00:09:09.166 --> 00:09:11.166
复杂的自由变体运动

00:09:11.266 --> 00:09:12.266
大家仔细看

00:09:12.466 --> 00:09:14.900
Dirogan机器人在空中飞行时

00:09:14.900 --> 00:09:16.933
能精准改变关节构形

00:09:17.133 --> 00:09:19.300
甚至能用身体灵活抓取

00:09:19.333 --> 00:09:21.333
并包裹移动悬挂物体

00:09:21.666 --> 00:09:23.833
在结合了AI控制算法后

00:09:23.866 --> 00:09:26.266
它生动展示了具身智能在

00:09:26.266 --> 00:09:28.233
复杂空间下的无限潜力

00:09:28.300 --> 00:09:30.933
从底层大模型到具身智能

00:09:31.066 --> 00:09:33.766
AI的进化爆发正全面到来

00:09:34.033 --> 00:09:35.166
感谢你看到这里

00:09:35.166 --> 00:09:36.666
这里是大雷早上好

00:09:36.666 --> 00:09:37.533
关注频道

00:09:37.533 --> 00:09:38.633
咱们下期见
