混合线性注意力+KPop RL+异步流水线,构建开放高效万亿智能体模型家族
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
利用参考解决方案作为密集奖励脚手架,改善LLM推理路径覆盖
面向全模态任务的多智能体编排框架与决策对齐强化学习方法。
通过多视图GRPO与自验证锚点,解决GUI定位RL训练奖励退化问题。
把RL粒度从token拉到step,对齐MDP与信用分配单元。
用世界坐标系认知地图+三阶段工具调用 Harness,把 MFM 空间推理提升 5%–18%
用层次化强化学习让LLM边读边想并自动分配计算
MaxProof框架使M3模型在IMO/USAMO达超人类金牌水平
首个多智能体框架,通过规划-生成-批评流程赋予任意图像生成器交错生成能力
提出三阶段框架让MLLM主动恢复损坏的视觉内容,实现像素级重建与多模态推理的鲁棒理解
通过嵌入级语义邻居混合提升强化学习推理探索能力
通过显式边界标记使隐藏状态循环推理可RL优化且可解释
将T2I缺陷诊断建模为结构化集合预测,支持精确定位和语义理解
提出单策略多智能体框架,通过角色解耦优化和KV缓存重用,在视觉推理任务上显著减少幻觉并提升推理效率
通过二元验证器信任信号改进在线策略蒸馏,在数学推理基准上平均提升1.98%
基于MuJoCo和MJX的多无人机RL仿真平台
统一的8B参数具身基础模型,整合认知、规划和定位能力,实现SOTA性能
系统梳理LLM智能体环境的生命周期,涵盖环境建模、自动合成、质量评估及智能体-环境协同演化
通过将推理内化到分数分布中超越标量奖励
👍 65提出Z-Reward教师-学生框架,将推理增强的分数分布蒸馏到高效的学生奖励模型中
提出端到端TV损失与拒绝采样方案,将RL训练加速1.8倍