也许每个人在尝试与 AI 沟通时,都有类似的体验,总感觉哪里不够顺畅。
特别是当通过语音与 AI 对话时,那种差异尤为明显。
现在的 AI 语音交互,更像是在进行回合制游戏,你说话它停下,它回应你时你又得安静倾听。
无法自然地暂停或插话,AI 也无法准确区分你在对它说话,还是在和旁边的人交谈。
这种交互上的不足,让 AI 的应用局限在答题机和代码工具的特定领域。
就在上个月,OpenAI 发布了 GPT-Live,实现了边说边听的功能,获得不少关注。
但不少人觉得这算不上的什么创新,因为早在今年 4 月,豆包的语音通话模式就已经具备类似功能了。
前两天,豆包进一步升级了自己的视频通话能力,引入了原生音视频多模态全双工大模型 SeedRealtime,声称可以提高音视频理解能力,增强抗干扰和打断识别功能。
所谓的全模态全双工交互模型,核心就是解决前面提到的这些问题,打破回合制对话的限制。
听起来很有潜力,于是我们也挑选了几个实际场景进行了测试。
毕竟技术再先进,最终还是要看实用性和便捷性,以及在关键时刻能否提供有效帮助。
先从一个基础功能开始,看看新版豆包视频通话是否还停留在回合制阶段。
不得不说,新版豆包的表现确实进步明显。
以前进行视频通话时,它就像一个单线程的程序,要么在听,要么在说,无法同时处理两种任务。
但现在不同了,即使在持续讲话时,只要检测到你说话的声音,它会立即暂停对话,并根据你的新问题调整回应内容。
从测试视频中也能看出,它对人类语言的提问和断句理解更到位了。
过去可能因为短暂的停顿或中断,AI 无法判断你是否在完成一个句子,从而提前给出答案。
但现在,它基本能够准确判断对话的连贯性,交流过程更像与真人面对面交谈。
不仅如此,新版豆包的抗干扰能力也有显著提升。
以前它容易因为周围环境中的杂音而误判指令,但现在通过声纹识别技术,能够更精准地与你进行一对一对话。
还有测试显示,新版豆包的视频识别速度非常快。
比如在玩一个选择武将的小游戏时,即使我们的滑动速度很快,豆包的识别依然精准无误。
在编辑部的测试中,即使有多人同时参与对话,豆包也能轻松应对。
它能实时捕捉每个人的发言,准确区分对话对象和内容。
连同事小声的嘀咕“怎么冲刺”,都被豆包敏锐地捕捉到并标记。
接下来我们加大了测试难度,让豆包扮演装机指导的角色。
结果它仅用一眼扫视,就能掌握测试平台的安装进度。
更令人惊喜的是,豆包不仅能在安装过程中提供指导,还能在出现误操作时主动提醒。
它甚至能像人一样观察手部动作,在安装内存条时提前警示方向和力度问题。
豆包在处理这种复杂任务时展现了出色的记忆力和全程跟踪能力。
当我们以为安装显卡大功告成时,它竟然发现显卡的供电线未接。
就连最容易被忽略的主板 CPU 供电线,也没有逃过它的注意。
整个过程显示,豆包足以应对这种需要多步骤的任务。
并且,我们测试时全程开启视频










网友评论