自动化粗到细生成评分标准,驱动LLM开放域任务超越GPT-5
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
通过边界感知奖励训练LLM在信息不足时主动承认"不知道",提升智能体搜索的可靠性
推理模型生成思维社会
👍 14推理模型通过模拟多视角对话实现深度思考,本质是'思维社会'的涌现
首个将物理碰撞规则直接编码到高维空间的强化学习视频生成框架。
10B参数多模态模型通过统一预训练和平行协调推理,在60+基准上媲美或超越100B+模型
基于视觉-语言推理的城市社会语义分割
👍 155用VLM两阶段推理+强化学习实现卫星图像中社会语义实体的像素级分割
通过奖励LLM生成的罕见但正确的解题策略,解决强化学习中的探索崩溃问题。
让LLM先推理再生成,突破T2I模型的文字-像素映射局限
提出步骤级工具调用安全检测基准、防护栏模型和反馈驱动推理框架,将有害调用降低65%
将工具调用信用分配建模为二部图匹配问题,实现细粒度的回合级奖励估计
两阶段框架:检索增强原型生成+GRPO片段优化,实现分子多属性精确控制
通过逻辑结构化数据构建和感知结构的奖励聚合,显著提升LLM复杂指令遵循与逻辑推理能力。
在GRPO优势之后加反向累积log比,修正自回归KL信用分配
通过有限状态机实现可控自进化,提升深度研究任务的稳定性和性能
7B小模型通过虚拟宽度扩展和两阶段RL在皮肤诊断上超越235B大模型
基于Gemma 3的开源翻译模型,SFT+RL双阶段训练大幅提升质量
提出自适应前瞻机制,让LLM智能体在行动前动态决定想象多远的未来
统一多种多模态推理技能为生成范式,用SFT+RL实现
通过规划阶段分支策略和多样性奖励提升LLM创意写作多样性
通过策略与评论家的协同进化,解决强化学习中评论家过时导致反馈失效的问题