阿里旗下智能体编程平台Qoder近日推出国内首个实时语音交互智能体Qoder Voice,标志着AI助手从被动响应向主动协作迈出关键一步。该产品通过全双工语音交互技术,实现用户与智能体之间实时、双向的语音对话,用户无需手动操作即可通过语音指令完成复杂任务,真正实现"动口不动手"的交互体验。
区别于传统语音助手"一问一答"的单向模式,Qoder Voice搭载的Qwen-Audio-3.0-Realtime语音模型具备主动对话能力。该模型在Artificial Analysis全球语音交互评测中以84.1%的综合指数登顶榜首,其核心技术突破在于实现语音输入与输出的实时同步。当用户提出需求时,智能体不仅能立即响应,还能在对话过程中主动追问细节、提供建议方案,甚至根据用户反馈动态调整执行策略。
在实际使用场景中,用户通过Qoder Quest界面唤醒语音助手后,悬浮窗将全程伴随操作界面。例如在编程场景下,开发者说出"优化这段代码的内存占用",智能体会立即分析代码结构,提出三种优化方案并解释差异;当用户选择方案二并补充"需要保留原有注释"时,系统会实时修改并展示最终代码。这种交互方式使任务执行效率提升40%以上,特别适用于复杂需求的多轮沟通场景。
技术实现层面,该系统采用分层架构设计:语音识别层实现毫秒级响应,语义理解层支持上下文关联推理,任务执行层具备多工具调用能力。在测试环境中,系统对中断指令的响应延迟控制在200毫秒以内,多轮对话的上下文保持准确率达92%。目前支持中英文双语交互,后续将开放更多语言版本。
商业应用方面,Qoder Voice已率先在国际版上线,个人订阅用户可享3天免费试用,企业版提供定制化开发服务。根据IDC最新报告,Qoder在中国AI编程市场占有率达47.6%,服务客户包括中国一汽、中信证券等头部企业,全球用户规模突破500万。此次语音交互功能的升级,将进一步巩固其在智能体开发领域的领先地位。
产品团队透露,Qoder CN中文版将于近期完成本地化适配,针对中文语境的语音识别准确率和语义理解能力进行专项优化。同时计划开放语音交互API接口,允许第三方开发者将该技术集成到自有应用中,构建更丰富的AI协作生态。



