提出首个针对 VLM-GUI 智能体的效率后门攻击,通过两阶段 RBI 策略在触发时让响应长度激增
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
用动态概率感知裁剪替代固定裁剪,解决LLM RL中的探索瓶颈问题
通过分层并行架构和博弈协议解决LLM在长期规划中的约束漂移问题,FPR达52.65%
无批评器、无似然的步级对比排序框架,解决流式VLA的在线RL难题
稳定扩散语言模型的强化学习训练
👍 3提出StableDRL,通过无条件裁剪和自归一化解决dLLM强化学习中的奖励崩溃问题
用多任务强化学习训练企业搜索智能体,在多类知识检索任务上超越闭源大模型
通过截断步级采样和分解式过程奖励,解决检索增强推理中的信用分配问题
用轻量级代理模型卸载LLM记忆检索,通过结果导向强化学习优化下游任务表现
用索引式外部记忆+RL训练,让LLM智能体在有限上下文窗口下高效完成长程任务
通过动态奖励的强化学习提升多模态模型在开放世界分类中的特异性
V1:统一生成与自验证的并行推理框架
👍 14通过成对比较和联合训练统一生成与验证,提升并行推理性能
用可验证物理奖励和LoRA微调小型推理模型求解梁静力学,发现模型学到程序模板而非物理方程
80B参数MoE模型仅激活3B参数,通过大规模可验证任务合成实现高效编码智能体
提出Mix-GRM框架,通过B-COT和D-COT双机制协同,在五个奖励基准上平均超越基线8.2%
下一嵌入预测使世界模型更强大
👍 21用因果Transformer预测下一时刻嵌入,替代像素重建学习世界模型
MOSAIC 框架通过显式安全检查和偏好学习,让智能体在多步工具调用中学会安全决策
通过反事实信息增益奖励解决多轮RL中的信用分配问题,实现智能体主动不确定性消减
用 LLM 编排器根据任务难度动态生成并迭代精炼分层 DAG 拓扑,比最强基线最多提升 14.6% pass@1。
提出语言无关的自动化管道,从GitHub大规模收集可执行的软件工程任务用于训练智能体
仅 9K 合成推理样本即可让 4B 模型逼近 235B 模型的推理能力