先确认再发声的手语眼镜

与不懂手语的人交谈时,眼镜先让用户确认模糊词句,再用其选定的声音说出来。

使用手语的人在商店、医院或陌生人面前交流时,常得依赖对方猜测,或临时掏出手机逐字输入。用户戴上眼镜后,镜头识别已训练的手势,手机或随身扬声器负责把确认后的内容说出来。用户可提前存入常用短句,并为它们选择自己的录音或偏好的声音。

识别到姓名、地点或手势不够清楚时,系统不会直接替用户发声。镜片上会出现两三个候选词,用户轻点头确认,或轻摇头取消。对方听到的是已经确认的句子,用户也能在眼前看到系统准备说什么。

一次对话结束后,默认不保存完整视频和对话内容。用户若主动收藏某句表达,才会把这句话加入个人短语库,用于下次更快确认。常用词库还可按场合切换,例如点餐、问路或挂号。

首版可从用户预设的高频短句和清晰的固定手势开始,重点把低置信度表达留给本人确认。它不替代手语翻译员,却能让短对话少一次中断。

为什么是现在

8月4日,Hand Wave 位于 Product Hunt 新品流第8位,手语转语音眼镜开始进入产品发现渠道。S1 同类方案被带到用户面前时,误识别后替人发声的问题也随之变得具体。

目标用户

主要用户是日常使用手语,又常要面对不懂手语者的人。最合适的场景是点餐、问路、挂号和柜台咨询。此时对话短、等待压力高,临时逐字输入会打断交流。用户需要的不是替自己自由发挥,而是在发声前保留最后确认权。

最小切入点

先把词库限制在点餐、问路和挂号短句。每句绑定清晰固定手势,不尝试连续手语翻译。MediaPipe Gesture Recognizer 可处理视频流,并加载自定义手势模型。S2 模型输出手部关键点和候选类别,再结合当前场景词库排序。低分结果只在镜片显示两个或三个候选。头部确认读取眼镜姿态传感器,无此能力的硬件暂不适配。确认后调用 Android TextToSpeech,或播放用户录好的音频。S3 视频帧只留在内存,确认或取消后立即释放。

以小博大

第一批用户应从聋人创作者、手语教师和无障碍测评者中寻找。用真实的点餐、挂号和问路视频展示候选与取消,不剪掉误识别。发布可下载的场景短语包,并持续公开错误样例和修正结果。获客内容应围绕“系统何时闭嘴”,而不是炫耀全句翻译。

竞品与缝隙

Sign-SpeakGoogle
Sign-Speak 已有专有手语识别和虚拟人技术。S4 现有产品覆盖 ASL 视频自动加字幕。SignLive 则把现场语音转成 ASL。S4 它主要服务内容制作、会议和直播,入口多在视频上传或音响系统。S4 本方案瞄准的是面对面短对话。用户可以边看对方边签,不必把手机举在两人中间。更关键的是,系统不能把低置信度结果直接当成用户原话。镜片候选、点头确认、取消和个人短语优先级,构成不同的控制层。本产品不宜与其比完整翻译能力。首要任务是守住已训练短语、低延迟和本人授权发声。若对方开放成熟的可穿戴接口,这道缝隙会迅速缩小。

怎么赚钱

按月订阅手机端识别与发声服务,眼镜由用户自备。提供短期试用,之后按账户收费,不按句数计费。

反方视角

误识别一旦被扬声器说出,可能替用户表达错误意图。姓名、地点和相近手形尤其容易引发尴尬或实际损失。真实手语还涉及动作路径、面部表情和身体位置。只看手部的模型很快会碰到能力上限。眼镜视角也会遇到双手出框、遮挡和光线变化。若每句都弹候选,交流速度又会退回手动输入。继续投入前,应先证明常用短句能低延迟识别。还要验证用户愿意长期佩戴并反复确认。

依据与来源

共引用 4 条可核验来源
发布快照· Product Hunt
通过智能眼镜将手语转换成语音
Feed 日期
快照时间
截至 抓取
在 Product Hunt 查看 "Hand Wave"
来源核对
Telegram 频道