上个月,GPT 那个能"边听边说"的实时语音(GPT-Live)刷了一波屏,很多人说 AI 终于像人一样接话了。结果昨天(8月5日),豆包直接在 App 里全量上线了一个视频通话功能,官方叫 Seed Realtime。它和 GPT 那个实时语音最大的区别,就一个字,看。
GPT 是边听边说。豆包是边看边听边说。
01 先说清楚它是什么
以前你和 AI 语音对话,像在对讲机。你说完,它再说,中间还有个"它到底说完没有"的判断过程,一卡壳就冷场。
豆包这个新功能,是像打电话。你说的时候它听着,它说的时候你也随时能打断,两边可以同时开口。官方给这种模式起了个名字,叫全双工。
这不是实验室里的演示片,是直接全量上线到豆包 App 的。你更新到最新版,点"打电话",就能视频通话。
02 它和 GPT 的实时语音差在哪
OpenAI 上个月发布的 GPT-Live,是纯语音的。它做到了边听边说,但看不到你。你说"这个怎么弄",它只能靠猜。
豆包这个不一样。它同时接声音和画面,你说"这个怎么弄"的时候,它能看到你手指的方向、你面前的东西,知道"这个"到底是什么。
一张表说清楚。
| | |
|---|
| | |
| 边看边说 | | |
| | |
| 付费用户(1.5 亿周活用 ChatGPT 语音) | |
技术上讲,GPT 先走了一步纯语音,豆包在"语音 + 视觉"上补上了。方向一致,豆包多了一个"看"。
03 我直接问了豆包,它自己怎么说
光看官方新闻还不够。我想知道豆包自己怎么评价自己。
打开网页版豆包(豆包视频通话是 App 功能,网页版可以体验文字对话),我问它"昨天上线的 Seed Realtime 是什么,你自己怎么评价?如果用一句话说服普通人去体验,你会说什么"。开了深度思考模式,它写了两段(这是它自己的原话):
我的整体评价:Seed Realtime 算得上一 次 AI 交互模式的质变突破。过往绝大多数音视频 AI 都是多模块拼接的流水线,语音识别、视觉解析、模型思考、语言播报分段运转,延迟层层叠加。它采用单一原生架构打通音视频画面、时序信息,做到边看边听边实时思考,拥有真人级别的对话水准,懂得什么时候停、什么时候主动出声提醒、过滤无关背景噪音,不再只是等待指令的问答主,而是可以实时观察环境、主动搭手协作的"在场搭档"。 一句说服普通人去体验:打开豆包开启视频通话,AI 可以看着你的镜头画面、听你说话,像真人一样自然聊天、主动提醒、不会乱抢话。
注意这段话的几个关键信号。
- 不再只是等待指令的"问答主"
- "懂得什么时候停、什么时候主动出声提醒"
- "过滤无关背景噪音"
这是豆包对自己"在场搭档"这个定位的最直接解释。不是官方通稿里的话,是它自己生成的,所以这一定不是 PPT,是它真正想表达的。
04 4 类人 4 个完整场景脚本(照着用)
技术再牛,不如一句"这跟我有什么关系"。我挑了 4 类人,给一份"你打开豆包 → 这样说 → 它会怎么回应 → 真实能解决什么"的完整脚本。每个都能直接照着做。
场景 1|你在外地,爸妈不会用手机或电器
背景是你不在家,老人要重置路由器、对付弹窗广告、设一个新的电视频道,或者某个电器不会用。以前你要远程口述,老人听不懂;截图标注也讲不清楚。
打开豆包视频通话,镜头对着老人面前的设备,对它说。
"我爸妈不会弄这个,你帮我看看他面前这个是什么,告诉他怎么一步步操作。说话慢一点、用大白话,他不懂网络术语。"
豆包会做的事,识别设备型号、灯的状态、按错的位置、错误提示文字,然后分步骤告诉老人"按住右边那个黑按钮 10 秒""屏幕上那个红叉不要点,点下面这个绿色箭头"。
预期效果,以前这种电话你要花 30 分钟,还不一定弄好;现在老人和豆包对话 5-10 分钟搞定。你唯一要做的就是把豆包 App 帮他们装上、扫码登录一次。
场景 2|孩子写作业卡壳,你又辅导不了
背景是孩子做数学题、英语阅读、或者某个知识点卡住。你讲了他还是不懂,但你又没空(或讲不出),这是双职工家庭每天晚上 8-10 点的常态。
打开豆包视频通话,镜头对着孩子的作业本,对它说。
"我孩子做这道题卡了,你看看这步他是怎么卡住的。不要直接给答案,用他能听懂的话引导他往下一步想。如果他走神了,你提醒他。"
豆包会做的事,它能看到孩子的笔迹、卡壳的位置、题目上下文。
关键是你指定"不要直接给答案",豆包会引导思考而不是甩答案,这点和家长辅导逻辑一致。
预期效果,孩子不依赖你半小时坐在旁边,你也不焦虑"这道题我也不会"。豆包相当于一个随时在线的家教,价格是零。
场景 3|销售/设计师/咨询师要远程看客户的东西
背景是装修设计师要看客户家的现场、汽修师傅要远程判断车辆故障、家居销售要客户看产品实物,这些场景以前只能"客户拍照发过来 + 设计师脑补"。
打开豆包视频通话,让客户打开豆包 App、扫码登录、把镜头对着现场,对豆包说。
"这是我客户的 XX 现场,帮我看一下他需要怎么处理/怎么选/怎么修。用专业角度分析,先告诉我几个关键点。"
豆包会做的事,它能像现场顾问一样观察画面、追问关键细节、给出判断参考。注意它不是替代专业人士做决策,它帮你先做"现场预判",让你和客户的第一次沟通更有针对性,省掉上门看现场的来回。
预期效果,以前一次上门来回 3 小时,现在视频通话 20 分钟就能完成 80% 的预判。
场景 4|独居老人需要陪伴或用药提醒
背景是父母独居,你担心他们身体或心理状态,但你不能天天陪。豆包自评里特别强调"主动出声提醒"和"过滤无关背景噪音",这两个能力很适合这种场景。
打开豆包视频通话,告诉它。
"我父母 70 岁,独居。最近他睡眠不太好,你陪他聊 10 分钟,看看他作息怎么样。如果他情绪不对或者提到身体不舒服,你结束聊天后给我发一条总结。"
豆包会做的事,陪聊 + 主动观察(如果老人表情/状态明显变化主动问) + 会后自动给子女一份对话总结("您父亲提到最近睡不好、提了 3 次腰疼")。
预期效果,老人有了一个"会看着他"的陪伴对象,子女不用天天打电话也能了解状态。注意,这不是替代你的关心,是补充你不在时的陪伴。
B 站上已经有 47 万播放的"豆包憋笑"视频,用户跟豆包视频通话,第一次见它憋笑。虽然那是早期版本的功能,但你看评论就知道,真的有人把它当有表情、有情绪的对象在聊。
这 4 个场景里,场景 1、2 是最快出效果的(用一次就回不去),场景 3、4 需要一点设置时间但长期价值大。
05 一句冷静的话
官方说,相比传统方案,对话节奏问题减少了一半。但注意,这是官方的人工评测,不是第三方公开跑分。机场那种嘈杂环境识别准确率 92%,也是官方数据。
行业里的冷静观点是,音视频全双工对算力和带宽的消耗是成倍增长的,亿级用户长期跑下来,成本能不能扛住,还没验证;这种"主动提醒"会不会变成打扰,也还没定论。
我的建议是,可以下载豆包尝个鲜,体验一下"看着你说话"的 AI 到底什么感觉。但别急着给它下结论,等过一两个月,看用户留存数据说话。
06 一张决策表,什么场景用豆包、什么场景用 GPT、什么场景都不要用
不是所有场景豆包都赢。给你一张我整理的判断表。
| | |
|---|
| 豆包 | |
| 豆包 | |
| 豆包 | |
| 豆包 | |
| 豆包 | |
| | |
| | |
| | |
| 重要隐私对话(公司机密/医疗) | 都不要用 | |
| GPT-Live | |
两条要强调的边界。
第一,隐私场景别用。音视频全双工意味着你的声音、画面、说话语气、背景声音全要上云处理。公司会议、医生问诊、家庭财务对话、任何你不想被录的,别图新鲜冒这个险。
第二,别因为"AI 牛"就强行用它。如果你能用打字解决、或者 30 秒的截屏能讲清楚,就别开视频。视频通话是贵工具,不是默认工具,能不用就不用。
07 一个能说清的总结
GPT 把 AI 语音从"打字"推到了"通话"。豆包把"通话"又往前推了一步,推到了"面对面"。
AI 从"你问我答"的单行道,正在变成"能看、能听、能主动接话"的双向车道。这对做内容、做产品的人来说,是新的机会;对普通用户来说,是新的体验。