先确认再发声的手语眼镜
与不懂手语的人交谈时,眼镜先让用户确认模糊词句,再用其选定的声音说出来。
使用手语的人在商店、医院或陌生人面前交流时,常得依赖对方猜测,或临时掏出手机逐字输入。用户戴上眼镜后,镜头识别已训练的手势,手机或随身扬声器负责把确认后的内容说出来。用户可提前存入常用短句,并为它们选择自己的录音或偏好的声音。
识别到姓名、地点或手势不够清楚时,系统不会直接替用户发声。镜片上会出现两三个候选词,用户轻点头确认,或轻摇头取消。对方听到的是已经确认的句子,用户也能在眼前看到系统准备说什么。
一次对话结束后,默认不保存完整视频和对话内容。用户若主动收藏某句表达,才会把这句话加入个人短语库,用于下次更快确认。常用词库还可按场合切换,例如点餐、问路或挂号。
首版可从用户预设的高频短句和清晰的固定手势开始,重点把低置信度表达留给本人确认。它不替代手语翻译员,却能让短对话少一次中断。
为什么是现在
8月4日,Hand Wave 位于 Product Hunt 新品流第8位,手语转语音眼镜开始进入产品发现渠道。S1 同类方案被带到用户面前时,误识别后替人发声的问题也随之变得具体。
目标用户
主要用户是日常使用手语,又常要面对不懂手语者的人。最合适的场景是点餐、问路、挂号和柜台咨询。此时对话短、等待压力高,临时逐字输入会打断交流。用户需要的不是替自己自由发挥,而是在发声前保留最后确认权。
最小切入点
先把词库限制在点餐、问路和挂号短句。每句绑定清晰固定手势,不尝试连续手语翻译。MediaPipe Gesture Recognizer 可处理视频流,并加载自定义手势模型。S2 模型输出手部关键点和候选类别,再结合当前场景词库排序。低分结果只在镜片显示两个或三个候选。头部确认读取眼镜姿态传感器,无此能力的硬件暂不适配。确认后调用 Android TextToSpeech,或播放用户录好的音频。S3 视频帧只留在内存,确认或取消后立即释放。
以小博大
第一批用户应从聋人创作者、手语教师和无障碍测评者中寻找。用真实的点餐、挂号和问路视频展示候选与取消,不剪掉误识别。发布可下载的场景短语包,并持续公开错误样例和修正结果。获客内容应围绕“系统何时闭嘴”,而不是炫耀全句翻译。
竞品与缝隙
怎么赚钱
按月订阅手机端识别与发声服务,眼镜由用户自备。提供短期试用,之后按账户收费,不按句数计费。
反方视角
误识别一旦被扬声器说出,可能替用户表达错误意图。姓名、地点和相近手形尤其容易引发尴尬或实际损失。真实手语还涉及动作路径、面部表情和身体位置。只看手部的模型很快会碰到能力上限。眼镜视角也会遇到双手出框、遮挡和光线变化。若每句都弹候选,交流速度又会退回手动输入。继续投入前,应先证明常用短句能低延迟识别。还要验证用户愿意长期佩戴并反复确认。