评估多模态大模型在多层条件分支推理中的视觉理解与决策能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
构建基于认知框架的代码创造力基准,发现扩展收敛现象并提出EvoRePE增强方法
CREATE:测试大语言模型的关联创造力
👍 15提出关联创造力基准,通过知识图谱路径生成评估LLM的创意联想能力
首个针对右删失生存数据中HTE估计的综合基准平台
首个评估多智能体长时序第一人称视频理解能力的问答基准及基线模型
提出OAKS基准,评估LLM在流式动态知识更新下的在线适应能力
首个体育空间智能数据集CourtSI,100万QA对,25个VLM评测揭示人机差距
评估VLM细微视觉差异识别能力的基准,揭示时空推理与人类的显著差距
用测试驱动方法编译LLM智能体提示词,确保行为合规
提出主动意图推荐基准PIRA-Bench,评估GUI代理预测用户意图的能力
MicroCoder 用难度感知数据筛选,让 4B 代码模型 300 步内获得 3 倍提升
基于百年美财政部公报构建的企业级多文档推理基准
大规模机器人操作基准测试,系统评估记忆增强型策略
提出 SoT 提示技术与 T2S-Bench 基准,系统评估和提升 LLM 的文本结构化能力
首个系统评估视频LLM实时交互能力的基准,覆盖记忆、感知与主动响应
首个基于持续集成循环的仓库级基准,评估LLM智能体在长期代码演进中维护代码质量的能力
大语言模型有多可控?跨行为粒度的统一评估
👍 25提出SteerEval基准,系统评估LLM在不同粒度级别的可控性
首个将虚假叙事与仇恨言论融合的多维可解释仇恨检测基准
提出RubricBench基准,揭示LLM自动生成评估标准与人类标准之间存在约27%的准确率鸿沟
首个基于真实个人相册的多源意图驱动照片检索基准,揭示统一嵌入模型的模态鸿沟与智能体的源融合悖论。