构建1780个科学工具环境与基准,揭示LLM在长序列科学推理中的瓶颈
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过探索-验证-记忆策略实现法律推理过程合规性的自主法律研究智能体
提出INTENT框架,通过意图感知世界模型在推理时实现预算受限的工具使用规划
196B MoE 模型仅激活 11B 参数,通过架构与 RL 创新达到 GPT-5.2 水平
让模型自主管理上下文,从被动预测器转变为状态感知智能体
构建可执行的终端任务数据管道,在TerminalBench上提升20%性能
面向材料科学的智能体化人工智能
👍 48提出以管线为中心的视角,将材料发现全流程从被动预测推进到闭环自主智能体系统
面向语言模型的特权信息蒸馏
👍 28利用训练时特权信息蒸馏前沿模型,无需Chain-of-Thought
ProAct:交互环境中的智能体前瞻推理
👍 27通过蒸馏MCTS搜索树和蒙特卡洛评论家,让LLM智能体内化准确的前瞻推理能力
通过四元组抽象动态创建专用子智能体,实现复杂长周期任务的自动化编排。
预算感知MCTS+模块化构建+比较反思记忆,自动化MLE研究
提出智能体进化范式和A-Evolve框架,通过部署时自主诊断与修复实现LLM持续适应
通过多轮强化学习训练MLLM自主调用分割工具,实现超越人工提示的医学图像分割
多模态联合训练+Agent Swarm并行编排,实现通用智能体
双智能体文件系统框架突破上下文限制实现深度研究
通过闭环优化同时优化环境、策略和奖励模型,实现LLM代理任务的显著提升
探索面向智能体的推理奖励模型
👍 24提出多维度推理奖励模型Agent-RRM,通过文本批评和标量奖励的统一集成提升智能体性能
用轻量级神经网络探索环境,再蒸馏到LLM并用RL激活,大幅提升非语言任务性能
通过关键状态动态分支实现精准资源分配,提升长时域智能体探索效率
智能体驱动的超长视频理解
👍 22提出EGAgent框架,通过实体场景图实现跨天超长视频的多跳推理问答