AI时代语音输入崛起,如何调和语音交互成本差异成竞争关键?

AI时代语音输入崛起,如何调和语音交互成本差异成竞争关键?

【AI破屏而出,「AI器物志」开启观察】

智能手机统治了过去十几年的数字生态,它是注意力的黑洞,是最私密的随身之物。但手机设计逻辑止于屏幕,而AI需要持续感知物理世界。当AI成为基础能力,它迟早要从屏幕里破壳而出,这是一个漫长的探索和演化过程。「AI器物志」栏目由此而来,爱范儿将和大家一起持续观察AI如何改变硬件设计、重塑人机交互以及以怎样的形态进入日常生活。这是「AI器物志」的第19篇文章。

【AI定位转变,语音输入需求催生产品】

过去两年,AI定位从少数人的专业工具转变成日常生活的基础能力,人们习惯随时随地向AI发出指令。不过,以PC时代键鼠交互为主的人机交互方式逐渐暴露出短板,「手动打字」需组织思绪、保持逻辑才能让AI理解。而手机时代的「语音输入」几乎没有这样的桎梏,它允许人们一边输出一边思考,更接近思维原本发生的方式,且不需要稳定桌面环境、持续低头和优秀文字表达能力,对普通人来说更接近「真正的自然交互」。这种广泛需求催生出一批围绕语音入口展开的产品,如Plaud将录音、转写和总结包装成完整工作流;Typeless删除语气词、进行格式清洗后「帮你成文」;光帆Lightwear等可穿戴设备试图整合出全场景的完整AI使用流。

【语音交互方案多样,各有优劣】

门槛最低的语音交互方案是一副TWS耳机加手机上的AI,能组成24小时在线的虚拟副手。耳机和手机系统、第三方app有现成的语音转写等功能,不需要专用硬件就能传达命令给AI模型,且速度、兼容性和跨设备能力优于大多数专用AI硬件。然而,其瓶颈在于麦克风对环境人声的处理,如AirPods在多人环境会采集周围声音,而国产品牌TWS耳机采用更激进的人声隔离策略,提高了电话和AI语音的准确率。这意味着在AI成为主流使用场景时,耳机好坏的评价标准正在改变,耳机麦克风正从通话配件变成AI控制器。

语音指挥的第二条路线是智能眼镜。唯一成功的智能眼镜是以语音、拍照和开放式音频为核心的基础款,因为眼镜显示系统会牺牲重量、续航和成本,还需培养全新用户习惯,而「看见什么问什么,AI讲给你听」已足够构成AI卖点。但智能眼镜存在问题,其「无感」多存在于宣传片里,会制造社交压力,且麦克风阵列、通话降噪和扬声器效果不一定比TWS耳机好,还与品牌客户端和云端模型深度绑定,用户缺乏自由度,如Meta Ray - Ban智能眼镜强制连接Meta AI,不能唤醒其他智能助手,很难成为主流产品。

第三条路线是为语音输入AI制造独立硬件入口。如OpenAI与Work Louder联名的Codex Micro,设置了用于语音输入的push - to - talk(PTT)按键,这象征着语音输入开始获得稳定物理位置,承认了其高频属性。PTT/TNT更进一步设想是摆脱屏幕,OpenAI正在规划无屏便携设备,若如此,无异于承认了Humane AI Pin的道路,且OpenAI的徽章可能更实用。

【无声语音交互探索,方向逐渐清晰】

面对AI语音交互的尴尬和识别失真问题,研究者有了奇思妙想。如「超声波舌部动作识别」设备通过探头读取舌头运动解码为语言;一些研究尝试把传感器装进眼镜或头显,通过面部细微运动识别无声指令,苹果收购的Q.ai就是研究这个方向。这些装置虽距消费级产品远,存在识别范围、准确率和佩戴体验等限制,但方向清晰,未来语音交互可能演化为对人类发声动作等的直接识别。

【语音输入优势与成本问题】

语音输入在AI时代获得超越键盘的声望,是因为人类不擅长用视觉信号发送信息,发出声音传递信息效率更高。用语音指挥AI虽看似低效,但消弭了AI的工具感,更接近人类本源的协作方式。然而,「语音交互」便利的隐性成本在上升。传统STT工具只转换声音为文字,而Typeless等「文本清洗」工具额外调用模型整理改写口语,叠加了token消耗。多模态模型进入「原生音频」阶段后,token消耗量是纯文本的10倍或更高,虽与高清图片和视频处理相比成本不算离谱,但在长时间实时对话中,用户难控制信息长度,导致AI语音交互越自然,计算过程越复杂,消费成本越高。这几乎成为AI厂商的「阳谋」,未来AI业务竞争关键在于谁能以更低延迟、更少冗算和更透明的计费,调和不同模态业务的成本差异,让人们愿意一直和AI对话。