提出OEL框架,让语言模型从部署经验中持续自我改进
Tianzhu Ye, Li Dong, Qingxiu Dong, Xun Wu, Shaohan Huang, Furu Wei
2026-03-18
上下文蒸馏
在线学习
大语言模型
强化学习
持续学习
Meta发布首个支持1600+语言的MT系统,小模型性能超越70B大模型
Omnilingual MT Team, Belen Alastruey, Niyati Bafna, Andrea Caciolai, Kevin...
2026-03-18
低资源语言
多语言
大语言模型
机器翻译
评估基准
元认知驱动框架,提升跨学科创意新颖性
Priyanka Kargupta, Shuhaib Mehri, Dilek Hakkani-Tur, Jiawei Han
2026-03-18
元认知
创意生成
大语言模型
科学发现
跨学科研究
通过策略驱动的技能选择与分层奖励实现数学推理能力的持续进化
Yu Li, Rui Miao, Zhengling Qi, Tian Lan
2026-03-18
分层强化学习
大语言模型
强化学习
技能学习
数学推理
提出AttnRes用softmax注意力替代固定残差累加,解决PreNorm深度信息稀释问题
Kimi Team, Guangyu Chen, Yu Zhang, Jianlin Su, Weixin Xu, Siyuan Pan, Yaoyu...
2026-03-17
Transformer架构
大语言模型
残差连接
注意力机制
深度学习
MoDA:通过跨层深度KV注意力解决LLM深度扩展中的信息稀释问题
Lianghui Zhu, Yuxin Fang, Bencheng Liao, Shijie Wang, Tianheng Cheng, Zilong...
2026-03-17
Transformer架构
大语言模型
注意力机制
深度扩展
硬件优化
LLM展现类人动机结构:自报告动机可预测行为与表现
Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart
2026-03-17
LLM对齐
人机交互
动机心理学
大语言模型
行为分析
揭示LLM推理中'认识论不确定性外化'的关键作用及其信息论框架
Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dongsheng Li, Yuqing Yang
2026-03-17
不确定性
信息论
大语言模型
推理
自我修正
基于宝可梦的大规模AI决策基准,含对战与速通双赛道评估框架
Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung...
2026-03-17
不完全信息博弈
多智能体
大语言模型
强化学习
游戏AI
将细粒度专家设计从中间维度扩展到输出维度,突破现有MoE缩放律的性能瓶颈
Ning Liao, Xiaoxing Wang, Xiaohan Qin, Junchi Yan
2026-03-17
Mixture-of-Experts
Upcycling
大语言模型
细粒度设计
维度扩展
提出针对长期记忆检索的嵌入模型评估框架,涵盖4类记忆、22个数据集、193个检索任务
Xinping Zhao, Xinshuo Hu, Jiaxin Xu, Danyu Tang, Xin Zhang, Mengjia Zhou,...
2026-03-16
向量检索
基准测试
大语言模型
文本嵌入
记忆检索
通过持久记忆和自进化机制,让多智能体AI科学家从失败中学习并持续提升研究能力
Yougang Lyu, Xi Zhang, Xinhao Yi, Yuyue Zhao, Shuyu Guo, Wenxiang Hu, Jan...
2026-03-16
多智能体系统
大语言模型
科学发现
自进化智能体
记忆增强
提出关联创造力基准,通过知识图谱路径生成评估LLM的创意联想能力
Manya Wadhwa, Tiasa Singha Roy, Harvey Lederman, Junyi Jessy Li, Greg Durrett
2026-03-13
创造力评估
基准测试
大语言模型
推理能力
知识图谱
通过均值-残差分解隔离激活异常值,实现稳定高效的FP4训练
Hengjie Cao, Zhendong Huang, Mengyi Chen, Yifeng Yang, Fanqi Yu, Ruijun...
2026-03-13
FP4训练
低比特训练
大语言模型
模型量化
激活异常值
大模型预训练权重附近密布着多样化的任务专家
Yulu Gan, Phillip Isola
2026-03-13
大语言模型
损失景观分析
模型微调
随机优化
集成学习
MR-Search:元RL结合自我反思解决稀疏奖励下的智能体搜索
Teng Xiao, Yige Yuan, Hamish Ivison, Huaisheng Zhu, Faeze Brahman, Nathan...
2026-03-13
元学习
大语言模型
强化学习
智能体搜索
自我反思
聚合外部批评与组内对比两种NL反馈,以离策略脚手架引导RL探索,实现2.2倍样本效率提升
Lei Huang, Xiang Cheng, Chenxiao Zhao, Guobin Shen, Junjie Yang, Xiaocheng...
2026-03-12
GRPO
大语言模型
强化学习
探索效率
自然语言反馈
通过压缩LLM潜在响应生成输出空间嵌入,无需标注数据
Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas...
2026-03-12
信息检索
大语言模型
文本嵌入
自监督学习
表征学习
ICRL:纯RL框架实现LLM工具调用,无需SFT,渐进消除少样本提示
Yaoqi Ye, Yiran Zhao, Keyu Duan, Zeyu Zheng, Kenji Kawaguchi, Cihang Xie,...
2026-03-12
GRPO
上下文学习
多轮推理
大语言模型
工具使用
通过强化学习训练路由器,解决LoRA混合模型中路由权重塌陷问题
Ruizhong Qiu, Hanqing Zeng, Yinglong Xia, Yiwen Meng, Ren Chen, Jiarui Feng,...
2026-03-12
LoRA
参数高效微调
大语言模型
强化学习
混合专家