将提示优化建模为POMDP,用五角色多智能体协作提升心理健康情感诊断准确性与鲁棒性。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
两阶段框架:检索增强原型生成+GRPO片段优化,实现分子多属性精确控制
通过有限状态机实现可控自进化,提升深度研究任务的稳定性和性能
提出FactArena框架,通过竞技场风格的多智能体对战评估LLM在整个事实核查流程中的能力
通过里程碑记忆+多模态搜索双创新,实现跨平台桌面智能体SOTA性能
多智能体竞争共识+门控RL,解决旅行规划中多目标冲突与约束满足难题
提出推理驱动的多智能体路由器,支持动态加入Agent和多Agent协作执行
本文首次系统综述 Agent-as-a-Judge 范式,通过规划、工具验证、多智能体协作和记忆机制提升 AI 评估的鲁棒性和可验证性。
首个端到端分子动力学代码生成与QA框架,结合三阶段训练与闭环强化学习
通过四次端到端自主科研尝试,揭示 LLM 的六大失效模式并提出四个设计原则