跳到正文
无结论,已搁置主线 · 研究研一:课程与上手期

傅里叶函数用于大模型损失函数的探索

半年实验,换过几次损失函数形式,最后没能把因果说清楚。

阅读提纲 4 个章节

解决什么问题

课题组当时在琢磨一个问题:傅里叶函数能不能用到大模型的损失函数里。直觉是损失曲面上的信息在频域里也许更好刻画,换一种形式也许能让训练信号更有用。我负责的是把这个想法变成能跑的实验——想法本身不难说,难的是让它在真实模型上跑出可比较的结果。

我做了什么

2025 年 3 月开始,到 9 月停下,围绕 Qwen2.5-Math-7B 和 Qwen3-8B 做了一批实验。中间换过几次损失函数的形式,每一次都要重新配训练、重新对齐评测口径。输出攒到 724 个文件、6,351 行 Python,还有 71 份 markdown 记录。

结果

没有结论。 指标确实动过,但我始终没能把“这个变化是不是损失函数带来的”这件事说清楚——变量控制不够干净,能解释结果的因素不止一个,而单靠已有的实验设计分不开。最后改动停在 2025 年 9 月 29 日,之后就搁置了。

把它放进主线,不是因为它做成了,而是因为它是研一那一年我投入最久、留痕最完整的一件事,也是我第一次撞上“跑通了不等于说清了”这堵墙。后来做越狱防御的实验设计时格外在意对照组怎么设、口径怎么统一,起点就是这半年。

没做到的,和这一页不写的

最关键的缺口是消融:没有一组干净的对照能把损失函数的贡献单独摘出来。没有仓库链接,因为实验代码没整理到可以公开的程度;也不放任何指标数字,因为在因果没说清之前,单独拎出一个数字只会误导。文件数、行数是按留存目录统计出来的;实验代码这次没有回头复读,上面写的过程没有经过复现。

想追问的话,可以问我换过哪几种形式、每次为什么换、以及现在回头看应该怎么重新设计这个实验。

这一节由 AI 按站主的访谈原话整理成文,等站主过目。

约 6,351 行代码;724 个文件;主要是 py;来源:本地目录 fourier-llm-loss