唇语识别 · 百句默读预测
从口型到句子,先仿真,再走向真人视频验证。
阅读提纲 4 个章节
解决什么问题
不出声也能识别:只看口型,把默读的句子还原出来。任务设定是闭集 101 句,输入是摄像头或上传的视频,输出是句子。2026 年 5 月开始做。
我做了什么
先不碰真人数据。用 TalkingHead 的 3D 唇动仿真生成口型序列,验证模型能不能从口型学到句子,通了之后才转向真人视频。做了两个预测入口,摄像头实时与上传视频,配了 Windows 与 Linux 的打包脚本,让它能在别的机器上跑起来。代码约 3,800 行:Python 做模型与推理,网页做预测界面,Shell 做打包。
结果
可行性验证过了,现在跑在云服务器上,本机只留副本。
没做到的,和这一页不写的
泛化没解决:现成的唇语数据太少,数据集规模不够,换一个人就不准。这一页不写准确率,因为档案里没有留下正式的测试报告。起始的 2026 年 5 月来自口述回忆;档案里的 2018 年只是文件修改时间,不是起点。
这一节由 AI 按站主的访谈原话整理成文,等站主过目。
约 3,807 行代码;20,001 个文件;主要是 py、html、sh;来源:本地目录 lipreader