跳到正文
可行性验证,云端运行主线 · 研究研二下:研究与工程并行

唇语识别 · 百句默读预测

从口型到句子,先仿真,再走向真人视频验证。

阅读提纲 4 个章节

解决什么问题

不出声也能识别:只看口型,把默读的句子还原出来。任务设定是闭集 101 句,输入是摄像头或上传的视频,输出是句子。2026 年 5 月开始做。

我做了什么

先不碰真人数据。用 TalkingHead 的 3D 唇动仿真生成口型序列,验证模型能不能从口型学到句子,通了之后才转向真人视频。做了两个预测入口,摄像头实时与上传视频,配了 Windows 与 Linux 的打包脚本,让它能在别的机器上跑起来。代码约 3,800 行:Python 做模型与推理,网页做预测界面,Shell 做打包。

结果

可行性验证过了,现在跑在云服务器上,本机只留副本。

没做到的,和这一页不写的

泛化没解决:现成的唇语数据太少,数据集规模不够,换一个人就不准。这一页不写准确率,因为档案里没有留下正式的测试报告。起始的 2026 年 5 月来自口述回忆;档案里的 2018 年只是文件修改时间,不是起点。

这一节由 AI 按站主的访谈原话整理成文,等站主过目。

约 3,807 行代码;20,001 个文件;主要是 py、html、sh;来源:本地目录 lipreader