4.4B参数原生流式ASR,480ms延迟媲美离线Whisper
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
将无用的池化文本嵌入变为免费的质量提升器
自适应一维视频扩散自编码器
👍 5用 Transformer 替代 CNN 做视频压缩,支持自适应长度编码和扩散解码
SimpleNorm在线性映射后归一化,降低Hessian范数,学习率提升3-10倍。
通过在标记化阶段强制因果依赖,弥合标记化与生成之间的鸿沟
通过多头RoPE抖动解决自回归视频生成中的注意力坍塌问题,首次实现12小时连续流式视频生成
RAE 用高维语义空间替代 VAE 低维压缩,让扩散模型收敛更快、生成更好且更抗过拟合
揭示LLM注意力斜线模式由RoPE中高频分量与近秩一查询/键的相互作用内在产生
LTX-2:高效联合音视频基础模型
👍 183首个开源高效音视频联合生成模型
提出滚动内存机制实现无限长度在线3D几何重建
DDL通过rank-1重写机制让Transformer残差流可被显式替换而非累积
首次提出统一检测点异常和集体异常的多模态日志异常检测框架
通过引入中间层监督和内部引导机制,显著提升扩散Transformer的生成质量和训练效率
SAM+AST 在 ICBHI 2017 数据集上实现 68.10% SOTA 分数