通过输入侧自适应分辨率分配,在消除90%视觉token的同时保持或超越基线性能
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
KAT-Coder-V2 技术报告
👍 15快手agentic coding模型,多基准接近最先进水平
将轨迹重建重新定义为地图视觉视频生成任务,用视频模型直接在地图上绘制连续GPS路径
Cursor发布专用编码智能体模型Composer 2,经继续预训练+强化学习训练
首个万亿参数科学多模态MoE模型,突破100+科学任务
用VLM将复杂科学图表转换为可编辑SVG,结合课程学习与强化学习
提出代码流多阶段训练范式与循环Transformer架构,在代码智能基准上达到开源SOTA。
多答案RL训练模型单次前向推理生成多个候选答案及置信度
自蒸馏通过压制不确定性表达损害数学推理泛化
两阶段自进化框架训练4B模型达81%成功率,超越人类水平
通过规划先于感知的迭代推理,让MLLM自主决定看什么、何时看、怎么看
Actor-Judge架构实现多模态推理无监督自进化,无需标注数据
揭示LLM生成优化三大隐藏设计决策如何决定成败,无通用解
从《怪物猎人:荒野》采集的1亿帧游戏数据集,支持动作条件世界建模
将文生图的推理与生成统一为MDP,用GRPO联合优化文本和图像策略
PEPO:通过视觉感知与探索耦合的token级优势估计优化多模态推理
AutoGaze:3M参数前置模块裁剪冗余patch,实现19×加速
RLVR仅通过修改极少量关键token分布即可大幅提升推理性能
通过工具调用按需检索高分辨率裁剪区域,实现VLM高效推理
560B MoE模型在Lean4定理证明任务上达到开源SOTA