多答案RL训练模型单次前向推理生成多个候选答案及置信度
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
自蒸馏通过压制不确定性表达损害数学推理泛化
提出132个月CFO模拟器,揭示LLM智能体在长期资源分配任务上的严重不足
RLVR仅通过修改极少量关键token分布即可大幅提升推理性能
构建离线语料库与浏览器原语,低成本合成97K+深度研究轨迹
560B MoE模型在Lean4定理证明任务上达到开源SOTA
用语言描述注入3D空间知识,提升视觉编码器的空间理解能力
用token级log概率差识别RLVR稀疏更新方向,提升推理精度
提出BubbleRAG框架,通过气泡扩展启发式算法解决黑盒知识图谱中的召回率和精确率双重挑战
通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化
系统研究长视界工具使用代理的强化学习设计空间,提出STAR框架和规模感知的训练方法
通过动态里程碑规划和基于势能的强化学习,显著提升Web智能体的长期任务成功率
基于持续经验驱动执行的深度表格研究
👍 15提出DTR框架,通过闭环智能体决策处理非结构化表格的复杂多步推理任务
将经典RL的马尔可夫状态引入LLM后训练,突破能力天花板,实现指数级样本效率提升
提出MHPO框架,通过LFM和DHP组件实现稳定强化学习的梯度保真与危险感知控制
受神经科学互补学习系统启发,通过经验提取器与策略演员的协同进化实现高效经验驱动的智能体强化学习。
当AI穿越战争迷雾时
👍 32评估大语言模型在真实地缘政治危机中推理能力的时间锚定研究
评估LLM能否根据沟通场景选择性应用或抑制用户偏好
在线学习+不确定性引导探索使RLHF数据效率提升10-1000倍
通过agentic mid-training和验证推理提升长链推理,BrowseComp达88.2