复用训练中弱模型作为纠正信号,通过混合logit训练持续增强强模型
Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou,...
2026-02-10
后训练
大语言模型
数学推理
监督微调
知识蒸馏
通过精确建模模态间隙几何结构,用无配对文本替代昂贵图文数据训练MLLM
Xiaomin Yu, Yi Xin, Wenjie Zhang, Chonghan Liu, Hanzhen Zhao, Xiaoxing Hu,...
2026-02-10
多模态学习
大语言模型
对比学习
表示对齐
计算机视觉
引入T2T编辑机制突破扩散语言模型速度-质量权衡瓶颈
Tiwei Bie, Maosong Cao, Xiang Cao, Bingsen Chen, Fuyuan Chen, Kun Chen, Lun...
2026-02-10
大语言模型
并行解码
强化学习
扩散语言模型
推理加速
提出以管线为中心的视角,将材料发现全流程从被动预测推进到闭环自主智能体系统
Huan Zhang, Yizhan Li, Wenhao Huang, Ziyu Hou, Yu Song, Xuye Liu, Farshid...
2026-02-10
AI4Science
大语言模型
智能体
材料科学
综述
373条人工构建查询+人类搜索轨迹,评估搜索智能体深度与广度能力
Yutao Zhu, Xingshuo Zhang, Maosen Zhang, Jiajie Jin, Liancheng Zhang,...
2026-02-10
人机搜索行为
信息检索
大语言模型
搜索智能体
评测基准
用低秩二值分解将LLM压缩至1比特以下,单卡H100仅需13小时压缩70B模型
Hyochan Chong, Dongkyu Kim, Changdong Kim, Minseop Choi
2026-02-10
低秩分解
后训练量化
大语言模型
模型压缩
模型量化
将化学推理从离散语言转移到连续潜在空间,实现更快更准的分子推理
Xinwu Ye, Yicheng Mao, Jia Zhang, Yimeng Liu, Li Hao, Fang Wu, Zhiwei Li,...
2026-02-10
分子优化
化学推理
大语言模型
强化学习
潜在空间推理
提出L0-L4分层数据管理框架,系统化优化LLM全生命周期训练数据
Yudong Wang, Zixuan Fu, Hengyu Zhao, Chen Zhao, Chuyue Zhou, Xinle Lin,...
2026-02-10
分层框架
大语言模型
数据管理
数据质量
预训练
通过动态调整PPO裁剪阈值灵活控制RL训练中的策略熵
Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao
2026-02-10
GRPO
RLVR
大语言模型
强化学习
策略熵
将LLM自发重复问题的现象从缺陷重新定义为认知锚点,通过概率框架和注意力分析证明其提升推理准确性。
Zhuoyuan Hao, Zhuo Li, Wu Li, Fangming Liu, Min Zhang, Jing Li
2026-02-10
大语言模型
思维链
推理
注意力机制
测试时计算
FlexMoRE通过引入低秩适配器作为专家,在保持性能的同时将参数量减少至原来的三分之一
Annemette Brok Pirchert, Jacob Nielsen, Mogens Henrik From, Lukas Galke...
2026-02-10
低秩适配
参数高效
大语言模型
混合专家
联邦学习
通过Focal加权缓解群相对RLVR在中等组大小下的分布锐化问题,无需额外计算
Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii,...
2026-02-09
GRPO
RLVR
分布锐化
大语言模型
强化学习
百川医疗大模型通过三阶段训练统一对话问诊与可靠诊断,在多个基准上超越GPT-5.2
Baichuan-M3 Team, Chengfeng Dou, Fan Yang, Fei Li, Jiyuan Jia, Qiang Ju,...
2026-02-09
临床决策支持
医疗AI
大语言模型
幻觉抑制
强化学习
通过周期性矩阵符号操作恢复权重稳定秩,防止LLM训练中的梯度爆炸
Lianhai Ren, Yucheng Ding, Xiao Liu, Qianxiao Li, Peng Cheng, Yeyun Gong
2026-02-09
优化器
大语言模型
梯度爆炸
稳定秩
训练稳定性
解耦逻辑优化任务与物理参数分布,实现矩阵优化器在分布式训练中的高效部署
Liangyu Wang, Siqi Zhang, Junjie Wang, Yiming Dong, Bo Zheng, Zihan Qiu,...
2026-02-09
优化器
分布式训练
大语言模型
矩阵优化
负载均衡
ProGRPO通过置信度重加权解决RLVR训练中的熵崩溃问题
Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets
2026-02-09
GRPO
大语言模型
强化学习
探索-利用权衡
推理优化
用强化学习优化迭代式推理的摘要时机、内容和续接策略,同时提升准确率与效率
Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang...
2026-02-09
大语言模型
强化学习
推理效率
迭代推理
长链推理
首个系统评估移动GUI代理记忆能力的基准,揭示现有代理存在4-10倍能力差距
Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Qinyi Luo, Shunye Tang, Yuxiang...
2026-02-09
GUI代理
基准测试
大语言模型
移动自动化
记忆能力
原子级专家+笛卡尔积路由+专家中心调度,10.9倍加速MoE推理
Jingze Shi, Zhangyang Peng, Yizhang Zhu, Yifan Wu, Guang Liu, Yuyu Luo
2026-02-09
MoE
大语言模型
推理加速
模型架构
混合专家模型
利用微调中的权重更新信号优化大推理模型的3-bit量化
Nan Zhang, Eugene Kwek, Yusen Zhang, Muyu Pan, Suhang Wang, Prasenjit Mitra,...
2026-02-09
后训练量化
大语言模型
推理模型
模型压缩
模型量化