通过双代理执行反馈循环自动生成难度可控的深度搜索问答数据
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
四阶段智能体框架自动生成高质量学术反驳
提出原位自进化范式,通过工具动态合成与优化,使智能体在无监督开放环境中自主提升能力。
无限终端:为终端智能体扩展强化学习环境
👍 19通过程序化生成终端任务环境,用简单PPO显著提升LLM终端能力
沙箱中的大语言模型:激发通用智能体能力
👍 87通过代码沙箱环境激发LLM的通用智能体能力,实现跨领域性能提升
大语言模型时代的自动内核生成综述
👍 19系统综述LLM和智能体驱动GPU内核自动生成的方法、数据与基准
通过前向记忆传播与逆向反思校准的双过程架构,将不确定性转化为主动控制信号
提出HTC框架,通过轨迹级特征实现AI Agent置信度的准确校准
首个端到端多模态深度研究基准,评估智能体的图文证据整合与报告生成能力
强化智能体模型中的行为知识合并
👍 27提出RAM方法解决RL训练智能体模型合并时的信号稀释问题,实现跨任务协同增强
迈向高效智能体:记忆、工具学习与规划综述
👍 57系统综述LLM智能体在记忆、工具学习和规划三个核心组件上的效率优化方法
通过知识经验学习对齐智能体世界模型
👍 15WorldMind框架通过过程经验和目标经验,在推理时自主对齐LLM智能体的内部世界模型
224个真实后端任务基准,评估LLM智能体全生命周期开发能力
提出测试时工具演化范式,让智能体在推理过程中动态合成、验证和演化可执行工具,突破静态工具库的根本限制
提出层级认知缓存架构,实现超长时间跨度自主机器学习工程
系统综述大语言模型中的记忆机制,构建隐式/显式/智能体记忆三层分类体系
首个视频深度研究基准,要求模型结合视频线索与开放网络进行多跳推理
提出模块化RLaaS框架,通过关注点分离实现可扩展的多智能体RL训练
将人类桌面录屏转化为结构化动作轨迹,实现 60.1% 的 OSWorld 任务成功率
提出双层记忆架构SEEM,通过情景事件帧和图记忆解决LLM长期记忆的检索分散问题