边输入边开口的发声板

辅助沟通者输入到半句就能开始发声,未播出的词仍可修改,让合成语音跟上面对面对话。

使用发声板的人在面对面对话里,常常不是不知道要说什么,而是整句输入和合成语音播放都太慢,话题已经被别人带走。低延迟语音模型让设备能在一个词组稳定后就开口,例如用户输入“我想要”,声音已经说出前半句,屏幕上仍保留可继续修改的后半句。

用户通过触控、眼控或键盘选择词语,发声板把已确定的文字以自然停顿播出。尚未播出的尾部像正在编辑的消息一样可删改;用户把“喝水”改成“休息”时,前面已经说出的部分不重播,后续语音直接接成新句子。对方插话时,用户按住暂停键即可停声,马上组织下一句回应。

界面把一句话分成“已经说出”和“还可改写”两段,并用轻微的进度提示让用户知道声音走到哪里。常用短语可提前放入个人词库,语速、停顿和发音由用户本人设定。照护者或沟通伙伴只需看屏幕,就能知道对方还在组织表达,不必抢着替他说完。

第一版先服务文字输入与触控选择,重点打磨中途改词、暂停和继续发声。它不诊断语言障碍,也不替用户预测想说的话;核心是把合成语音从播放一段成品,变成能参与真实话轮的声音。

为什么是现在

8月19日,Nari Labs 公布了低于50毫秒响应的 Qwen3-TTS 开源实现,使短语级流式发声成为可直接验证的技术路径。S1 8月21日该实现进入 Hacker News,至8月22日仍有讨论,开发者开始检验它在实时语音与消费级设备上的可用性。S2

目标用户

主要面向能用键盘或触控拼句的 AAC 用户。尤其适合课堂讨论、工作会议和家庭争执等快速话轮。此时用户已经知道要表达什么,却常在整句完成前失去插话位置。照护者和沟通伙伴也需要看见对方仍在组织句子,避免代说或提前转移话题。

最小切入点

先做 iPad 横屏版,输入方式只保留键盘和触控词块。文本状态拆成已播放前缀、待播放队列和可编辑尾部。用户停顿或输入标点后,系统提交一个短语块。后端可部署 Nari Labs 开源的 Qwen3-TTS 实现,并流式返回音频。S1 播放层记录每个短语块的起止位置,只允许删除尚未送出的块。暂停、继续和清空队列可参考 AVSpeechSynthesizer 已有的控制语义。S3 首轮测试只验证改词、打断和续说,不加入预测、眼控或复杂词库。

以小博大

用 TestFlight 招募能打字的 AAC 用户,重点寻找经常参加课堂、会议或家庭讨论的人。演示素材直接对比整句播放与增量播放,让差异落在一次真实抢话场景中。测试邀请可投向 AAC 用户社群、辅助技术论坛和语言治疗师网络。每次测试只记录哪里提交过早、哪里仍然等太久,据此调整短语边界。

竞品与缝隙

Proloquo4TextGoogle
Proloquo4Text 已覆盖文字型 AAC 的核心流程,包括单屏输入、常用短语、词语预测、播放、暂停和边打边说。S4 它还能按光标位置决定朗读起点,并用高亮跟随已播放文字。S4 用户未必会为“更快开口”单独迁移,因为成熟产品已经处理大量日常细节。公开说明没有确认更细的状态模型:已说出的前缀锁定,未说出的尾部仍可改写。它也未说明改词后,后续音频能否不重播前文并自然续接。新产品的缝隙不是普通的边打边说,而是把提交边界、音频位置和可编辑范围明确绑定。若这项差异在真实对话中不够明显,独立产品很难胜过已有词库、离线能力和个性化声音。

怎么赚钱

按月订阅,费用覆盖云端低延迟语音与个人词库同步。学校和康复机构按设备席位年付,并保留离线基础语音,避免断网时完全失声。

反方视角

短语提交过早会把尚未确定的话直接说出口,而且声音无法真正收回。提交过晚又会退回整句等待,产品价值随之消失。把句子切成多个音频块,容易产生停顿、重音和音色衔接问题。网络抖动还可能让声音在半句中断,云端合成也带来隐私与持续算力费用。S1 暂停后改写尾部时,系统必须准确区分已播放和仅缓存的音频。任何错位都会造成漏词、重播或语义反转。正式使用前需要 AAC 用户反复测试,因为错误提醒或错误发声会迅速破坏信任。

依据与来源

共引用 4 条可核验来源
讨论快照· Hacker News
低于50毫秒响应的文本转语音模型
热度
97 分
评论
24 条
抓取时名次
第 12 位
发帖时间
快照时间
截至 抓取
查看 Hacker News 讨论阅读原文
来源核对
S4

Proloquo4Text 提供文字转语音、播放、暂停、边打边说、常用短语、词语预测、朗读高亮和离线沟通。其版本说明还写明可从光标位置开始朗读。

Telegram 频道