Login
From:
科学空间|Scientific Spaces
(Uncensored)
subscribe
流形上的最速下降:3. Muon + Stiefel
https://spaces.ac.cn/archives/11221
links
backlinks
Roast topics
Find topics
Find it!
上回说到,当我们把优化对象从向量参数转移到矩阵参数,并选用更适合矩阵的谱范数约束后,Muon优化器便自然而然地出现了。进一步地,我们考虑了给参数加上正交约束后的最速下降方向,这其中又分方阵和非方...