说是Day1实际上学了一段时间了,不过断断续续的,由于比赛需要给自己定了DDL,这里的记录也是直接搬的飞书日志hhh,接下来冲刺吧,就以当下为Day1!

2026/2/4

突击了一下梯度下降算法,高数下没学过导致看的蒙蒙的,全靠问ai在蒸啊,照着教材示例写了个通过梯度下降求多元函数极小值的程序,说是写,全是补全的,到最后的收货也就是看懂了代码思路而已……(学习真不能开ai代码补全啊,你补完了我学什么啊)

img

简析梯度下降:

首先说明梯度 ,其为多元函数所有偏导数的一个集合,或者说可以说是多维向量/数组。

进而,通过计算梯度预判函数变化趋势,对应变量减去对应偏导数以让整体逐渐逼近最小值

令我PTSD的是竟然还需要调节学习率,即代码中的lr(learning rate) ,是减去的偏导数要乘的倍数,可理解为每次学习的“步长”

学习率如果过大可能发散(什么超调艹)

过小的话如果学习次数还小的话可能来不及收敛就结束了,哪怕增大学习次数让它收敛,也浪费算力。

所以说要调啊艹(怎么这辈子跟调参脱不开了md)

希望有方法能够进行类似于系统辨识的方式减轻调参的牢(这种纯建模难道不能直接求出理想的学习率吗,表示怀疑),后续学习希望能学到