找到 448 条结果

沿秩维度归一化LoRA下投影矩阵,零额外参数即可加速收敛、提升性能与稳定性

Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu 2026-09-01
LoRA 优化动力学 参数高效微调 大语言模型 预条件子

让LLM在测试时通过迭代反馈积累经验,无需训练即可持续提升

Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan 2026-08-21
反馈学习 大语言模型 测试时计算 自我改进

RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样

Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang 2026-08-17
RLVR 大语言模型 强化学习 持续学习 指令跟随

用LLM性别分类加标签感知翻译模型的混合流水线,把英译罗性别准确率提升40个百分点以上

Ioana Grigore, Sergiu Nisioi 2026-08-14
LoRA微调 低资源语言 大语言模型 性别偏见 机器翻译

过滤在线蒸馏中既不依赖输入又高影响的虚假教师信号

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li 2026-08-06
在线策略蒸馏 大语言模型 梯度信噪比 知识蒸馏 视觉语言模型