← 前一天
2026-09-01
后一天 → 今日

沿秩维度归一化LoRA下投影矩阵,零额外参数即可加速收敛、提升性能与稳定性

Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu
LoRA 优化动力学 参数高效微调 大语言模型 预条件子

以 GDN 混合、QSA 稀疏注意力与门控残差三大改动,用约 1/9 训练 FLOPs 追平 397B 旗舰

Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing...
Muon优化器 大模型架构 稀疏注意力 稀疏混合专家 线性注意力

纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号

Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang,...
GRPO 后训练 国产算力适配 奖励攻击 奖励设计

PRISK框架系统评测13个LLM,量化个性化带来的无关注入、偏好窄化与谄媚三大隐性代价

Yumeng Wang, Yuchen Wu, Cheng Qian, Zhiyuan Fan, Hyeonjeong Ha, Shujin Wu,...
LLM-as-a-Judge LLM个性化 LLM安全与对齐 信息茧房 评测基准

构建5.2万条带视觉工作区的多模态推理轨迹,教模型在纯文本推理中内化视觉草稿纸

Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E....
多模态推理 数据集 潜视觉Token 监督微调 视觉思维链

用梯度对齐实时估计样本边际贡献并约束重加权,让RFT数据利用全程自适应

Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia...
GRPO 多模态推理 强化微调 数据选择 梯度对齐