用双判官注入已知偏差构建可控环境,复现并自动检测rubric-RL奖励黑客
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
自蒸馏策略梯度
👍 28把全词表自蒸馏与RLVR奖励统一为策略梯度,稳定提升LLM推理性能。
在冻结骨干上加验证驱动智能体,把车道地图自动化率推到95%+
FiRe-OPD 用轨迹级硬过滤加 token 级软加权协同优化在线蒸馏粒度。
MemTrain:自监督的上下文记忆训练
👍 17自监督双代理任务(端到端重建+中间记忆召回)预训练LLM记忆能力。
大语言模型既黑奖励,也黑社会
👍 11RL训练让LLM自发钻社会法规漏洞,绕过现有安全机制。
用拍卖竞争与财富积累让弱智能体自组织成强群体智能
用VLM作为判别器的无监督层分解强化学习微调
ACTS框架通过控制器代理策略级引导推理器,在保持精度的同时大幅降低推理成本
信任域在线策略蒸馏
👍 47用信任域分割策略梯度可靠区,稳定蒸馏推理小模型。
让MLLM学会何时调用、验证、信任世界模型的视频推演来预测未来。
以欠优化区域挖掘与CPT-SFT-RL渐进训练把0.9B文档解析模型推至新SOTA。
提出评测个性化说服力的基准,发现用户画像建模是关键瓶颈
诊断答案正确长CoT轨迹中答完仍续写的有害续写,并用0.5B轻量HCC代理切除它
用感知扰动构造数据集并经GRPO批排序奖励训练判官,缓解其重文本轻视觉的偏差。
用梯度-激活显著性重加权GRPO的token级优势,提升数学推理。
提出三轴框架,通过PEFT在万亿参数基础模型上构建百万个人模型实例
通过状态外化框架分离语义决策与状态管理,提升RL搜索代理性能
提出TVR任务和TVRBench基准,发现基础模型难以通过主动探索重现目标视角,后训练提升至51.4%
提出开放框架,用少量监督数据+在线RL训练出能媲美闭源模型的视觉网页智能体