# 影片筆記:OpenAI凌晨发布GPT-Live:能打断、能同传,把我唬住了!#chatgpt #openai ## 一句話總結 影片對比測試了「豆包」與新發布的「Glock」系列模型(疑為 Grok 或特定內部模型),重點評估其語音延遲、方言同傳、邏輯推理及代碼審查能力,並指出新模型雖在技術上有所進步,但存在語音「恐怖谷效應」及代碼質量問題,整體表現被評價為偏向寫代碼而非陪聊,最終測試結果令人失望。 ## 核心重點 * **模型對比結論**: * **豆包**:優勢在於中文本地化及生態整合順手。 * **新模型(Glock系列)**:優勢在於跨領域推理及長文本表達能力,但整體表現被認為「有點拉」,測試後失去興趣。 * **語音功能表現**: * 存在語音延遲與信號不穩定問題。 * 具備普通話轉四川話、河南話的同聲傳譯功能。 * 語音雖有進步,但存在「恐怖谷效應」,音調詭異,令人起雞皮疙瘩,被形容為「跟偉人對話的感覺」。 * **技術與代碼審查(Glock 4.5)**: * 模型定位偏向寫代碼,非陪聊。 * 發現代碼 Bug: 1. 移动端導航在 <800 像素時隱藏且無替代方案。 2. Color Mix 寫法缺乏降級方案。 3. 過度依賴 Google Funds(疑為 Google Fonts)導致加載問題。 * 評價模型像「會做近海展示(疑為前端展示)的前端實習生」。 * **邏輯與角色扮演測試**: * 測試反駁人格(桌子形狀辯論)、情緒表達(喜怒哀樂)及播音員模擬。 ## 詳細大綱 ### 1. 開場與模型對比 * 提出問題:豆包與新模型誰更厲害? * 回答:難一刀切,取決於場景。 * 對比分析: * 豆包:中文本地化好,生態整合順手。 * 新模型:跨領域推理強,常文表達(疑為長文表達)能力佳。 ### 2. 語音功能與信號測試 * 觀察到語音延遲與信號不穩定。 * 模擬真人語氣與咳嗽聲效進行測試。 * 確認模型身份(AI vs 真人)。 ### 3. 語言轉換與方言測試 * 實測普通話轉四川話及河南話。 * 調整語音音量與清晰度。 ### 4. 邏輯推理與角色扮演 * **反駁人格測試**:進行桌子形狀辯論。 * **情緒表達測試**:測試喜怒哀樂情緒。 * **播音員模擬**:模擬中央人民廣播播音員。 ### 5. 技術實測:Glock 4.5 代碼審查 * 模型定位:偏向寫代碼,非陪聊。 * **發現的 Bug**: 1. 移动端導航在 <800 像素時隱藏且無替代方案。 2. Color Mix 寫法缺乏降級方案。 3. 過度依賴 Google Funds 導致加載問題。 * **評價**:像會做近海展示的前端實習生。 ### 6. 語音恐怖谷效應與總結 * 小行星歌謠哼唱測試。 * **語音評價**:比上一代好,但存在「恐怖谷效應」,音調詭異,令人起 GB 疙瘩(疑為雞皮疙瘩)。 * **最終結論**:測試表現不佳,失去興趣。 ## 工具 / 模型 / 名詞整理 * **豆包**:影片中被對比的主要模型/產品,優勢為中文本地化與生態整合。 * **Glock**:新發布的語音對話模型系列名稱(文中多次出現,疑為辨識錯誤)。 * **Glock 4.5**:具體提及的新模型版本號。 * **網頁端**:訪問模型的介面。 * **手機端**:訪問模型的介面。 * **Google Funds**:代碼審查中提到的依賴庫(疑為 Google Fonts)。 * **Color Mix**:CSS 寫法名稱。 * **中央人民廣播**:模擬播音員時提到的廣播站名稱。 * **小行星**:歌謠名稱(Twinkle Twinkle Little Star 的中文譯名)。 * **GB 疙瘩**:原文描述語音帶來的生理反應,疑為「雞皮疙瘩」。 * **近海展示**:原文評價代碼能力時使用的詞彙,疑為「前端展示」。 * **常文表達**:原文描述新模型優勢,疑為「長文表達」。 ## 操作流程整理 1. **初始對比**:使用者提問比較豆包與新模型(Glock系列)的能力。 2. **語音基礎測試**: * 測試語音延遲與信號穩定性。 * 模擬真人語氣(如咳嗽聲)以測試真實感。 * 確認對方為 AI 還是真人。 3. **方言同傳測試**: * 輸入普通話,要求轉換為四川話或河南話。 * 調整語音音量與清晰度以確保聽感。 4. **邏輯與情緒測試**: * 進行反駁人格測試(例如辯論桌子形狀)。 * 測試模型表達喜怒哀樂情緒的能力。 * 模擬中央人民廣播播音員語氣。 5. **代碼審查測試(針對 Glock 4.5)**: * 要求模型生成或審查代碼。 * 檢查移动端導航在 <800 像素時的隱藏邏輯。 * 檢查 Color Mix 寫法是否有降級方案。 * 檢查是否過度依賴 Google Funds 導致加載問題。 6. **語音質感測試**: * 要求哼唱小行星歌謠。 * 評估語音是否自然,是否存在「恐怖谷效應」。 7. **總結評價**: * 綜合技術表現與語音質感,得出模型偏向寫代碼、陪聊能力弱的結論。 ## 值得注意的限制或風險 * **語音延遲與信號問題**:新模型在語音對話中存在延遲及信號不穩定的風險。 * **語音恐怖谷效應**:新模型語音雖有進步,但音調詭異,可能引起用戶不適(起雞皮疙瘩)。 * **代碼質量風險**:生成的代碼存在功能性 Bug(如導航隱藏無替代方案、缺乏降級方案)及性能問題(過度依賴外部資源)。 * **定位偏差**:模型被評價為偏向寫代碼,若用戶期望的是陪聊或通用對話,體驗可能不佳。 ## 逐字稿辨識疑點 * **Glock / Glock 4.5**:逐字稿中多次出現「Glock」及「Glock 4.5」,通常語音模型命名為「Grok」或類似名稱,此處需查證是否為聽寫錯誤或特定內部代號。 * **Google Funds**:在代碼審查段落中,原文為「完全依賴 Google Funds」,通常前端開發依賴的是「Google Fonts」,此處疑為聽寫錯誤。 * **常文表達**:原文為「常文表達」,疑為「長文表達」或「長文本表達」之聽寫錯誤。 * **近海展示**:在評價代碼時,原文為「很會做近海展示」,疑為「前端展示」或類似詞彙之聽寫錯誤。 * **GB 疙瘩**:原文為「一度起 GB 疙瘩」,疑為「雞皮疙瘩」之聽寫錯誤。 * **任文其詳**:原文為「任文其詳」,疑為「詳細說明」或類似詞彙之聽寫錯誤。 * **閃**:原文為「我過不了閃」,語意不明,疑為聽寫錯誤。 * **周延**:在問「誰」時,回答「周延」,疑為人名或特定梗,需查證是否為聽寫錯誤(如「Google」或其他)。 * **快文快的**:原文為「快文快的」,語意不明,疑為聽寫錯誤。 * **中文学家**:原文為「中文学家你最喜欢谁」,疑為「中文模型」或類似詞彙之聽寫錯誤。 * **断封**:影片結尾自稱「我是断封」,疑為作者名稱或聽寫錯誤。 ## 可延伸追問 * 「Glock」系列模型是否為 OpenAI 或第三方開發的特定產品?其正式名稱為何? * 「Google Funds」在前端開發中是否為特定庫的別稱,還是確認為「Google Fonts」的誤聽? * 針對「恐怖谷效應」,是否有技術手段可以調整音調以減少用戶的不適感? * 豆包與 Glock 模型在生態整合方面的具體差異為何?