多模态三智能体评判器,结合学习者画像评估教学视频,达专家水平并辅助审校
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
测量被赋予权力的 AI 会不会自发胁迫甚至欺骗下属 AI 的基准。
递归式智能体框架自我改进(RHI)
👍 24少量迭代优化任务专属提示级智能体框架,超越最强推理档并省最多60%成本。
将长程搜索状态外化为系统级共享状态,多智能体在两大基准全F1指标领先
首个通用医学影像自主多智能体建模框架,以数据条件规划与验证引导搜索,19/20任务超越基线。
揭示 LLM 多智能体系统不会主动探索同伴,提出基于 LinUCB 的轻量引导框架 MACE。
提出将机器人策略表示为可执行计算图,通过多智能体自动生成和模拟自学习优化,实现可靠的可变自动化任务执行
通过多智能体协同将静态生物医学报告转化为可追溯、可探索的交互式证据界面
多智能体LLM系统中延迟验证可能导致共识振荡,提出稳定性阈值与贪心校正器放置算法
通过梯度计算实现token级别的跨智能体错误归因与优化
首个评估 LLM 智能体在多智能体经济中长期决策能力的基准,模拟90天咖啡供应链
让AI代理扮演数据科学家,通过迭代优化创建高质量合成训练数据
通过执行-蒸馏-验证三阶段框架解决单智能体经验学习的自确认陷阱问题
首个大规模中文精神科诊断基准,通过多智能体框架评估LLM在精神科咨询和诊断中的能力
语义浏览:图像生成的可控多样性
👍 20通过多智能体工作流和层次语义树实现可控的图像生成多样性
提出以Session为一等运行时值,解决多智能体系统状态分散问题
提出PhySciBench基准和DelveAgent框架,提升物理科学AI研究能力
提出价值多样性作为评估多文化智能体系统的新指标,揭示当前系统存在持续同质化问题
提出分层多智能体框架实现端到端个性化具身化教学
形式化并验证多智能体LLM系统中的四种并发异常,构建一致性层级,提供可检测预防方案