提出TRACE基准,用对比分析提升LLM检测代码奖励黑客的能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
用难度感知策略优化与多角度改题,显著提升数学推理
通过透明高效的训练流程,用不到500万科学样本构建竞争性的科学多模态大模型
通过自我蒸馏实现强化学习:SDPO算法
👍 51SDPO用模型自身反馈做自蒸馏,突破RL信用分配瓶颈
通过关键状态动态分支实现精准资源分配,提升长时域智能体探索效率
MoE架构GUI智能体,SFT+GRPO训练,跨平台SOTA性能
提出多对手GDRO框架,通过动态难度分组和自适应资源分配提升LLM推理性能
在已饱和问题上通过失败前缀条件化恢复学习信号
通过强化学习训练多模态模型自适应选择和编排视觉工具,实现复杂推理任务的突破性性能。
用点序列预测实现无解码器的MLLM像素级分割
通过攻击者-防御者-评估者三角色闭环强化学习,实现LLM安全对齐的自动协同进化
三智能体框架将粗粒度对话自动转化为电影级长视频
通过元强化学习生成自适应课程,突破数学推理性能瓶颈
发现状态信息丰富度和规划复杂度是 RL 训练保留跨域泛化能力的关键因素
通过双代理执行反馈循环自动生成难度可控的深度搜索问答数据
FluidGym:首个全自包含、全可微分的流体控制强化学习基准平台
美团开源560B MoE推理模型,在智能体搜索与工具使用任务上达到开源SOTA
统一训练和推理的 FP8 精度流,解决 RL 滚动加速中的训练不稳定问题
无限终端:为终端智能体扩展强化学习环境
👍 19通过程序化生成终端任务环境,用简单PPO显著提升LLM终端能力
首次提出基于强化学习训练LLM通过多轮对话进行策略决策的框架