绕过扩散LLM不可计算的似然,用速度场整流实现精准对齐
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
dLLM:简洁的扩散语言建模框架
👍 154统一扩散语言模型训练、推理与评估的开源框架,并提供从BERT/AR模型转换为DLM的实用配方
提出Ψ-采样器和高效课程学习,显著提升离散扩散模型的生成质量和训练效率
扩散语言模型的注意力汇聚感知剪枝
👍 4针对扩散语言模型中注意力汇聚不稳定的特点,提出感知汇聚的剪枝方法
提出统一后训练框架,通过SFT与多任务RL结合,大幅提升多模态扩散语言模型的推理能力
用MCTS优化掩码扩散语言模型的槽填充顺序,在推理任务上平均提升3.2%
利用dLLM重掩码机制实现免训练高效投票推理
轨迹自蒸馏+DDO目标函数,让扩散语言模型用更少步骤生成高质量文本
通过两阶段后训练和并行推理范式,让扩散大语言模型成为高效的搜索智能体
引入T2T编辑机制突破扩散语言模型速度-质量权衡瓶颈
用轻量块扩散模型做并行草稿,实现6倍以上无损加速
利用相邻步骤置信度相关性预测解码位置,实现无训练的29倍长上下文推理加速
残差上下文扩散语言模型
👍 37通过回收被丢弃的中间计算信号,显著提升扩散语言模型的推理准确率
用模型预测熵自适应混合软/硬token嵌入,解决离散扩散LLM奖励引导的梯度-可靠性矛盾
基于频域滑动窗口引导dLLM实现结构到细节的解码策略
扩散大语言模型用于音频理解,四阶段训练超越自回归基线
扩散语言模型的任意顺序生成反而限制推理,用标准GRPO效果更佳
通过块扩散持续预训练,使扩散语言模型在代码任务上超越自回归基线
用软 token 分布替代硬二元掩码,实现扩散语言模型的渐进式可修正解码