每时间步压缩为一个世界token、以物理时间为轴的因果序列机器人模仿学习策略
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
因果Transformer预测下一音频补丁嵌入,仅凭掩码加停梯度实现极简SOTA音频自监督
Maglev:滑动窗口循环记忆
👍 14用并行预填充器生成记忆目标,一致性损失训练滑窗解码器,实现可并行预训练的固定内存循环语言模型
借鉴网游权威服务器架构,以类型化共享状态解耦世界推演与视角渲染。
解耦预训练知识与任务几何的所有权,让编码器每日刷新而不破坏迁移
统一生成式Transformer,从单段第一人称RGB视频同时重建人体、手、视线、相机轨迹与深度
开放权重多乐器音乐转录模型,结合合成数据预训练、真实数据微调与强化学习后训练
研究发现RL训练增益集中在少量中间层,单层训练可超越全参数方法
学习未来注意力信号,在保持性能的同时大幅压缩KV缓存
通过旋转基共享 Lloyd-Max 码本实现数据无关的 DiT 低比特量化,无需校准数据即可跨模态应用
提出FlashMorph,通过联合优化层间门控,高效选择混合注意力模型的全注意力层
用学习型查询token解决视频世界模型的长期记忆问题
提出ILLUME-X统一模型,实现高质量N-to-M自由形式交错文本-图像生成
在天文图像上系统比较四种分词策略,发现重构质量与物理信息表征能力解耦
基于扩散Transformer的3D物理运动模拟框架,直接在世界坐标系生成完整网格轨迹
重新思考混合架构中高效注意力的角色
👍 20系统分析混合架构中高效注意力对长上下文能力的影响机制
消除Encoder-Predictor分裂,将多任务推理内化于Transformer栈中
从冻结扩散Transformer提取多模态感知信息
网络原生时间序列基础模型,在AP边缘实现预测和异常检测
通过分层token化和粗到细rollout实现长视频生成的一致性