用可重复的BA启发迭代层在隐空间细化相机位姿与几何
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过邻域注意力解码器和点梯度匹配损失提升单目3D重建的局部表面质量
迈向原生多模态建模:一份路线图
👍 43形式化定义"原生多模态",梳理2023–2026年40+模型架构、训练、推理与评估。
用证据影响核分解实现长视频流式三维重建的稳定长程传播
CAT:用一致性正则化解决多尺度 GAN 跨尺度轨迹错位
统一处理多视图配置、多模态融合、长时程感知和度量尺度的几何感知框架
揭示标准损失与正偏激活函数交互导致的负权重漂移机制,刻画其对激活稀疏性和准确率的影响。
WorldString:统一表征铰接/蒙皮/软体三类可动作对象的隐式神经占据场。
Lighthouse:训练期对称Q/K/V金字塔+Top-K,续训恢复全注意力
LC-MAPF:3M参数Transformer+多轮局部消息传递,无通信监督的新SOTA
在Retinexformer上引入深度、亮度、语义三模态跨注意力融合以提升低光增强。
首个面向点云的物体级Transformer刚体仿真器,速度比HopNet快101倍
首个能从一般视角广播视频中端到端重建乒乓球 140+ 小时 3D 轨迹、旋转与人体网格的大规模数据集,核心是把 2D 分段留在 3D 提升之后。
用可微高斯溅射替代硬投影,从理论上消除跨模态熵坍缩,让稀疏点云真正吃进图像先验。
R-CLA 训练时随机丢弃层缓存,使单一模型自适应多种深度共享策略。
用递归复用共享层替代堆叠参数,开辟CTR预测的循环缩放新范式。
用几何上下文注意力实现长视频实时三维重建,效率与精度双超SOTA
Parcae:稳定循环语言模型的标度律
👍 10用动力学系统稳定循环Transformer,并建立可预测的循环标度律。
用语音驱动情绪,跨模态学习语义向量差生成未见过的情绪表情
2D 自然图像自编码器把 fMRI 体压为 27 token,支持 256 帧长程建模。