通过token级思考截断与turn级动态重采样,让多轮智能体RL训练摆脱过思考困境。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个基于真实电子病历与医生验证的长程临床智能体基准,揭示当前LLM在自主临床任务上最高仅46%成功率。
COS-PLAY:决策智能体与技能库智能体协同进化,从无标注轨迹中自动发现可复用技能。
25,000+ 次实验揭示 LLM 智能体执行工作流却不会科学推理
首个评估智能体技能持续学习的基准,含20个真实任务和三级评估框架
首个端到端网页游戏生成智能体框架,含Game Skill与GameCoder-27B。
端到端语音模型集成推理与工具调用,任务完成率从34.88%提升至74.57%。
面向科学发现的基础演化式智能体框架,四基准全面领先基线。
提出AAR基准:1400道Wikipedia DAG谜题,拆解导航与工具调用瓶颈。
用 LLM 智能体在新型 AI 加速器上自动优化算子性能,无需专家先验知识
在纽约市导航多智能体仿真中,蓝队与红队通过KTO迭代对抗训练,揭示LLM可学会有选择的信任与欺骗,但仍高度脆弱。
TRACE:能力目标化智能体训练
👍 15自动识别智能体能力缺失并合成针对性训练环境的端到端系统
用滑窗推理+压缩摘要的动态上下文管理让8B模型刷新SWE-Bench记录
训练LLM在隐私对话中扮演双面间谍:用RL学会主动建模并误导攻击者信念。
用集体轨迹驱动智能体技能自动进化的多用户闭环框架。
揭示多轮LLM Agent RL中推理表面多样但输入无关的「模板坍缩」,并提出MI诊断与SNR过滤。
SEVerA:自演化智能体的可验证合成
👍 31首个把形式化约束与自演化LLM智能体结合的端到端验证合成框架
用Map-Shuffle-Reduce并行扫描解决prompt learning的上下文过载
Squeez用2B小模型对编码智能体的工具输出做任务条件剪枝,召回86%时压缩92%输入。
提出CVA架构,将价值激活显式化以解决LLM行为模拟的刚性与极化