用在线动态奖励权重与每题目标长度,兼顾正确性与简洁性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
切片编码+ViT内早期压缩,55.75%降算力且精度持平
SPEED 让 prefill 只走前 K 层、decode 全层走,配 BoS 锚点降本。
在短上下文GRPO中按推理步置信度屏蔽优势,稳定高效压缩推理链。
Sol-RL 用 FP4 探索候选池,BF16 再生成关键样本,加速扩散 RL 4.64×。
查询感知的两阶段自适应框架,让MLLM按需细化局部细节
用预 RoPE 空间的 Q/K 中心点估计 KV 重要性,匹配全注意力的同时吞吐提升 2.5 倍。
TAPS:面向任务感知的推测采样提议分布
👍 146任务专属草稿模型+推理时组合显著提升推测解码接受长度
通过动态混合精度量化与时间增量缓存,实现视频DiT 1.92倍加速和3.32倍内存缩减
将推测解码从token级提升到智能体级,用轻量模型跳过不必要的工具调用链
AutoGaze:3M参数前置模块裁剪冗余patch,实现19×加速
通过工具调用按需检索高分辨率裁剪区域,实现VLM高效推理
用信息瓶颈理论压缩推理链,Token减48%准确率基本不变
基于平衡思维的高效推理
👍 151通过置信度动态调控推理轨迹,在抑制冗余思考的同时防止推理不足
三阶段对齐框架高效地将预训练ViT转换为线性注意力模型
面向混合 xLSTM 架构的高效蒸馏
👍 34用 mLSTM-SWA 混合架构蒸馏 Transformer,通过专家合并实现近乎无损的性能迁移
通过训练二元探针分类器检测最终答案首次出现位置,实现LRM推理的早期退出
揭示扩散过程与尺度空间的信息层级对应关系,通过广义线性退化实现多分辨率高效生成
通过为每种模态学习独立平滑因子并用低秩补偿统一量化权重,解决多模态LLM量化难题
dLLM:简洁的扩散语言建模框架
👍 154统一扩散语言模型训练、推理与评估的开源框架,并提供从BERT/AR模型转换为DLM的实用配方