从数据覆盖角度研究世界模型幻觉,提出三种检测方法并验证缓解效果
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个端到端AI系统,从自然语言生成可平折的可识别折纸设计,结合神经符号方法与强化学习优化美学质量
后训练如何塑造生物推理模型
👍 3研究后训练阶段对生物推理模型泛化的不同影响
首个支持摄影师构图和被摄者姿态推荐的拍摄时MLLM摄影指导系统
代理式AI指南:从基础到系统
👍 18从LLM架构、强化学习训练到代理系统设计的全栈指南
用强化学习优化文档索引以提升复杂推理检索效果
首个跨7域语言世界模型,CPT→SFT→RL三阶段训练实现高保真环境模拟
首个公开agent训练pipeline,100+实验,32B模型超越基线3.9pp
无需人工标注,通过分层反馈引导策略优化实现移动GUI代理的自适应
智能体模型的批判性分析与GIC架构
👍 21区分工具型与内禀型系统,提出基于分层目标、演化身份和自调节的GIC架构
使用SAC算法+多目标奖励函数优化LLM预训练数据混合策略
通过可验证的数据构建解决视觉数学推理中的数据质量和奖励信号可靠性问题
提出智能体数据裁剪框架,将高熵原始多模态流转换为意图对齐的结构化训练数据
TAPO通过构建微观反思轨迹,让模型从自己的错误中学习,在数学推理任务上显著提升表现
为智能体手机使用训练开放模型
👍 16结合真实与模拟应用环境的手机代理训练方法,大幅提升任务成功率
Tmax:终端智能体的简单配方
👍 14提出大规模RL数据集和简单配方训练强终端智能体
提出CoD框架,用RL训练LLM获得长生命周期智能体的元能力
利用3D视觉基础模型提供密集可验证奖励,提升多视图空间推理能力
通过强化学习后训练框架提升VLA模型执行效率,减少物理步数51.4%,加速5.83倍
将LLM问题采样建模为流形结构化老虎机,通过层次树和贝叶斯方法平衡效率、多样性与评估效用。