通过合成课程问题与求解器协同进化,实现测试时自适应推理提升
Chengyi Yang, Zhishang Xiang, Yunbo Tang, Zongpei Teng, Chengsong Huang, Fei...
2026-02-02
GRPO
大语言模型
强化学习
数学推理
测试时训练
提出测试维护评估基准TAM-Eval,揭示LLM在测试生成/修复/更新上的能力局限
Elena Bruches, Vadim Alperovich, Dari Baturova, Roman Derunets, Daniil...
2026-02-02
单元测试
基准评测
大语言模型
测试维护
软件工程
通过AI反馈的逐动作过程奖励训练多智能体,解决信用分配和样本效率问题
Ed Li, Junyu Ren, Cat Yan
2026-02-02
AI反馈
多智能体系统
大语言模型
强化学习
过程奖励
将隐式推理重新定义为潜在空间规划,实现动态终止和可解释性
Jiecong Wang, Hao Peng, Chunyang Liu
2026-02-02
大语言模型
强化学习
思维链
规划
隐式推理
知识蒸馏可将训练数据记忆减少50%以上,同时提升模型泛化能力
Jaydeep Borkar, Karan Chadha, Niloofar Mireshghallah, Yuchen Zhang,...
2026-02-02
大语言模型
数据记忆
模型压缩
知识蒸馏
隐私保护
提出 TAPPA 框架,从时序连续性角度统一解释 LLM 中多样化的注意力模式。
Qingyue Yang, Jie Wang, Xing Li, Yinqi Bai, Xialiang Tong, Huiling Zhen,...
2026-02-02
RoPE
大语言模型
模型压缩
注意力机制
用下游信号训练任务设计器,间接引导自监督预训练更新方向
Shuqi Ke, Giulia Fanti
2026-02-02
下游反馈
任务构建
元学习
大语言模型
持续预训练
用 N-gram 嵌入替代 MoE 专家扩展,实现更优的稀疏缩放效率
Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui...
2026-01-30
Embedding Scaling
Mixture-of-Experts
N-gram Embedding
大语言模型
推理优化
自适应token压缩+MoE计算重分配,推理加速175%且性能提升
Zihao Huang, Jundong Zhou, Xingwei Qu, Qiyang Min, Ge Zhang
2026-01-30
token压缩
大语言模型
混合专家模型
自适应推理
计算效率
Qwen3-ASR系列:52语言ASR+LLM强制对齐,开源SOTA
Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang,...
2026-01-30
多语言模型
大语言模型
开源模型
强制对齐
语音识别
首个开源网络安全推理模型,8B参数媲美70B模型性能
Zhuoran Yang, Ed Li, Jianliang He, Aman Priyanshu, Baturay Saglam, Paul...
2026-01-30
GRPO
SFT
大语言模型
威胁情报
强化学习
用1800万模板将预训练文档转为指令-答案对,提升LLM预训练效率
Ajay Patel, Colin Raffel, Chris Callison-Burch
2026-01-30
合成数据
大语言模型
指令微调
数据增强
预训练
提出900题基准,评估智能体在多步信息检索中的穷举答案集合生成能力。
Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang...
2026-01-30
信息检索
基准测试
大语言模型
智能体评估
深度研究
用Kronecker积构造精确双随机残差矩阵,实现参数高效的流形约束超连接
Wuyang Zhou, Yuxuan Gu, Giorgos Iacovides, Danilo Mandic
2026-01-30
参数效率
大语言模型
张量分解
残差连接
神经网络架构
Softmax1替换标准注意力,token减少70%、准确率提升27%
Haozheng Luo, Zhuolin Jiang, Md Zahid Hasan, Yan Chen, Soumalya Sarkar
2026-01-30
大语言模型
模型压缩
注意力机制
链式思维
高效推理
研究音频指纹任务中分段长度的影响,发现0.5秒短分段性能最优,GPT-5-mini推荐最准确
Ziling Gong, Yunyan Ouyang, Iram Kamdar, Melody Ma, Hongjie Chen, Franck...
2026-01-30
大语言模型
深度学习
音频分段
音频指纹
音频检索
SDPO用模型自身反馈做自蒸馏,突破RL信用分配瓶颈
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco...
2026-01-29
信用分配
后训练
大语言模型
强化学习
自我蒸馏
通过关键状态动态分支实现精准资源分配,提升长时域智能体探索效率
Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen,...
2026-01-29
大语言模型
强化学习
探索策略
智能体
长时域决策
首个多语言仓库级上下文感知的ACR评估基准,揭示LLM代码评审新见解
Lei Zhang, Yongda Yu, Minghui Yu, Xinxin Guo, Zhengqi Zhuang, Guoping Rong,...
2026-01-29
仓库级上下文
代码评审
基准测试
多语言
大语言模型
在已饱和问题上通过失败前缀条件化恢复学习信号
Minwu Kim, Safal Shrestha, Keith Ross
2026-01-29
GRPO
RLVR
大语言模型
强化学习
推理模型