十天前,我报名参加了 Murf AI 主办的“10 Days of Voice Agents — VoiceForBharat Edition”挑战。当时我手里只有一条基础 pipeline,脑子里也只有一个模糊的想法:做一个让人通过“说话”而不是“打字”来学习的东西。我没有完整架构,甚至没想好它最后会长什么样。我选的是“学习与读写”赛道,规则很简单:每天给助手加一个新能力。 十天之后,我得到了一个叫 EduBuddy 的东西。它是一个 AI 语音和文本学习伴侣:能给学生出练习题,能评估他们口语回答得怎么样,能记住对话者是谁,能主动打电话给学生练习,能判断什么时候该把对话转交给真人老师,还能把一道数学题直接交给专门为数学构建的专用 agent。 写这篇文章,一部分是为了记录我自己的构建过程,另一部分是因为我觉得真正值得讲的故事不是“看我做了个什么”,而是“一个语音 agent 到底是怎么一块一块拼起来的,以及它在哪个环节会散架”。如果你正在评估类似项目,或者正打算做类似的东西,下面这些内容可以让你看清它的内部结构。 为什么做这个?大多数学习工具都是文本优先:读材料、敲答案、读反馈。这套流程对很多人有效,但对那些更愿意说、而不愿意打字的学习者来说,是一道隐形门槛。尤其当屏幕和键盘让交互变得比对话更慢时,学习的流畅感就断了。 说话其实是一种更低摩擦的交互方式。当学习者能对着一个问题说出自己的想法、听到针对口语作答给出的评价、再得到一段语音反馈时,这个过程更像是在被辅导,而不是在填表。EduBuddy 想补的正是这个缺口。我这不是在宣称能改变识字率或针对某个群体,只是一个判断:语音能给某些学习者去掉文本加上的摩擦。 十天很短。最初的语音识别经常把我的话听错,外呼练习功能上线前我根本不确定对方能听到什么,数学 agent 和主流程之间的切换也充满了各种诡异的边界情况。但正因为这样,我才有机会看到:一个语音学习助手不是“语音识别+大模型”的简单拼接,而是一连串需要持续调试的对话设计。 如果你也想做一个类似的东西,我的建议是:别急着搭完整架构,先让一个最简单的对话流程跑通,然后每天像打卡一样加一块功能。EduBuddy 就是这么长出来的。算是一篇技术记录加个人复盘,不是产品发布稿。代码里有不少粗糙的地方,但语音学习这个方向,值得继续试下去。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.