跳到正文
本科期间,已结束本科:从网络工程到知识图谱

智慧司法实验室:自然语言处理与知识图谱

第一次接触深度学习,两年里把模型谱系走了一遍。

解决什么问题

司法文书是高度结构化又高度啰嗦的一类文本:案由、当事人、判项、引用法条之间有明确的关系,但都埋在自然语言里。实验室的方向是把这些关系抽出来,组织成知识图谱,让案例之间可检索、可比对。

我做了什么

大二(2021 年 7 月)进入程戈教授的智慧司法实验室,作为成员参与自然语言处理与知识图谱方向的学习和研究,一直到 2023 年 6 月本科毕业。

这两年主要是把深度学习的模型谱系走了一遍:从 word2vec 的词向量开始,到 CNN、RNN、LSTM 这些神经网络的运用,再到 transformer。最后那一步在当时看只是又一个模型,现在回头看,是后面所有大模型工作的入口。

结果

这段经历没有留下可以公开的代码或论文,它的产出是把我从“会写程序”推到“知道模型为什么这样设计”。直接的延续有两条:本科毕设做的知识图谱可视化系统,用的就是这里的方向;研究生阶段做大模型安全,起点也是在这里第一次读懂 transformer。

没做到的,和这一页不写的

实验室阶段我是成员不是主导者,具体承担了哪些模块、贡献占多少,档案里没有留下可核验的材料,所以这一页不写。想了解细节可以直接问我,我能说清楚每一段在做什么,但不会在这里给一个无从核验的说法。

这一节据站主简历整理;原始代码未留存,细节未经核验。

来源:本地目录 作者简历(2026-09-16 提供)