CanvasAgent协调11种视觉工具实现复杂图像创建与编辑。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
TREK:蒸馏以探索、强化以精炼
👍 8TREK扩展GRPO探索支持,提升数学和Agent性能
从专家视频演示中学习进度排名,用Spearman相关系数作为无奖励RL的奖励信号
1B 端到端 OCR VLM 系统升级:DFlash 推测解码提速,Agent 数据流扩长尾能力。
研究发现RL训练增益集中在少量中间层,单层训练可超越全参数方法
将交错多模态推理统一为单一决策过程
👍 37BRAID框架将文本-图像交错推理统一为MDP,联合优化文本和图像生成
通过利用LLM评分token的完整分布实现细粒度反馈的通用验证框架,在多个领域达到SOTA性能
通过双循环框架学习可复用的漏洞复现策略,显著提升LLM代理在仓库级漏洞复现任务中的表现
首个使用GRPO后训练的3D医学流匹配模型,实现可控胸部CT合成
使用强化学习自适应调整LHC触发阈值,在保持背景率约束的同时提高信号效率
揭示训练-推理不匹配导致的目标错位,提出 MIPI 原则和 MIPU 两步框架
评估AI代理通过反馈迭代改进可执行策略的能力
通过步骤级奖励重塑解决医学VQA早期推理级联失败问题
通过分布级奖励优化视觉生成模型
👍 16提出分布级奖励框架解决样本级RL的reward hacking问题,显著提升生成质量
SDPO在专业化任务上表现强劲但持续学习中易遗忘
结合学习性与梯度对齐的多领域强化学习课程调度方法
提出P2R框架,将细粒度视觉推理解耦为感知定位和推理回答两个阶段,仅需最终答案监督
Valdi:价值扩散世界模型
👍 15结合扩散模型与价值函数的在线模型预测控制方法
通过图原生GRPO训练实现可追溯的科学假设生成
通过结构去噪和逆向规划实现个性化幻灯片设计