通过算法强制执行残差层级结构,解决2-bit量化中的路径共适应问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
利用相邻步骤置信度相关性预测解码位置,实现无训练的29倍长上下文推理加速
利用虚拟头实现高效自回归视频扩散
👍 8通过识别并压缩注意力中的虚拟头实现自回归视频扩散模型的无损加速
提出2D探测+并行思维控制器,节省35%推理token且不损精度
通过在预填充阶段裁剪深层网络、在解码阶段保留完整模型,实现 1.37 倍加速且精度几乎无损
通过FP8量化RL rollout阶段实现最高44%吞吐提升,同时保持与BF16基线相当的学习效果。
基于初始token熵的步级协同推理框架,显著降低延迟同时提升准确率
按去噪阶段重要性分配大/小模型,实现1.65×加速且保持质量