边输入边开口的发声板
辅助沟通者输入到半句就能开始发声,未播出的词仍可修改,让合成语音跟上面对面对话。
使用发声板的人在面对面对话里,常常不是不知道要说什么,而是整句输入和合成语音播放都太慢,话题已经被别人带走。低延迟语音模型让设备能在一个词组稳定后就开口,例如用户输入“我想要”,声音已经说出前半句,屏幕上仍保留可继续修改的后半句。
用户通过触控、眼控或键盘选择词语,发声板把已确定的文字以自然停顿播出。尚未播出的尾部像正在编辑的消息一样可删改;用户把“喝水”改成“休息”时,前面已经说出的部分不重播,后续语音直接接成新句子。对方插话时,用户按住暂停键即可停声,马上组织下一句回应。
界面把一句话分成“已经说出”和“还可改写”两段,并用轻微的进度提示让用户知道声音走到哪里。常用短语可提前放入个人词库,语速、停顿和发音由用户本人设定。照护者或沟通伙伴只需看屏幕,就能知道对方还在组织表达,不必抢着替他说完。
第一版先服务文字输入与触控选择,重点打磨中途改词、暂停和继续发声。它不诊断语言障碍,也不替用户预测想说的话;核心是把合成语音从播放一段成品,变成能参与真实话轮的声音。
为什么是现在
8月19日,Nari Labs 公布了低于50毫秒响应的 Qwen3-TTS 开源实现,使短语级流式发声成为可直接验证的技术路径。S1 8月21日该实现进入 Hacker News,至8月22日仍有讨论,开发者开始检验它在实时语音与消费级设备上的可用性。S2
目标用户
主要面向能用键盘或触控拼句的 AAC 用户。尤其适合课堂讨论、工作会议和家庭争执等快速话轮。此时用户已经知道要表达什么,却常在整句完成前失去插话位置。照护者和沟通伙伴也需要看见对方仍在组织句子,避免代说或提前转移话题。
最小切入点
先做 iPad 横屏版,输入方式只保留键盘和触控词块。文本状态拆成已播放前缀、待播放队列和可编辑尾部。用户停顿或输入标点后,系统提交一个短语块。后端可部署 Nari Labs 开源的 Qwen3-TTS 实现,并流式返回音频。S1 播放层记录每个短语块的起止位置,只允许删除尚未送出的块。暂停、继续和清空队列可参考 AVSpeechSynthesizer 已有的控制语义。S3 首轮测试只验证改词、打断和续说,不加入预测、眼控或复杂词库。
以小博大
用 TestFlight 招募能打字的 AAC 用户,重点寻找经常参加课堂、会议或家庭讨论的人。演示素材直接对比整句播放与增量播放,让差异落在一次真实抢话场景中。测试邀请可投向 AAC 用户社群、辅助技术论坛和语言治疗师网络。每次测试只记录哪里提交过早、哪里仍然等太久,据此调整短语边界。
竞品与缝隙
怎么赚钱
按月订阅,费用覆盖云端低延迟语音与个人词库同步。学校和康复机构按设备席位年付,并保留离线基础语音,避免断网时完全失声。
反方视角
短语提交过早会把尚未确定的话直接说出口,而且声音无法真正收回。提交过晚又会退回整句等待,产品价值随之消失。把句子切成多个音频块,容易产生停顿、重音和音色衔接问题。网络抖动还可能让声音在半句中断,云端合成也带来隐私与持续算力费用。S1 暂停后改写尾部时,系统必须准确区分已播放和仅缓存的音频。任何错位都会造成漏词、重播或语义反转。正式使用前需要 AAC 用户反复测试,因为错误提醒或错误发声会迅速破坏信任。