DCS:利用FOMC时间相对变化从冻结LLM提取经济意义显著的货币政策立场分数
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
利用多头注意力查询向量的时序可预测性检测多变量时间序列的结构性异常
通过跨模态对齐将DINOv2转变为能统一处理RGB、深度、分割等多模态输入的视觉编码器
通过压缩LLM潜在响应生成输出空间嵌入,无需标注数据
首个端到端自监督物体中心世界模型,提出每粒子潜在动作实现可扩展多物体随机视频预测与决策。
Utonia:迈向适用于所有点云的统一编码器
👍 187首个跨域联合自监督预训练的点云统一编码器,用三个简洁设计解决域间不一致问题
InfoNCE 损失诱导高斯分布
👍 14证明对比学习中 InfoNCE 目标函数在高维表示空间中渐近诱导出高斯分布结构
将JEPA从图像块扩展到对象级表示,通过遮蔽诱导因果归纳偏置,实现高效交互感知的世界建模
借鉴HEVC视频编解码器思想,只编码视频中3.1%-25%的运动关键区域实现高效视觉理解
通过序列级控制-效果对齐学习可迁移的潜在动作,实现跨场景零样本动作转移
通过动力学增强的潜在动力学模型,从无标签视频学习可迁移任务知识
面向 LLM 智能体的强化世界模型学习
👍 28用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力
用回译与强化学习在无配对数据下同步提升代码生成与文档生成能力。
自监督预训练放射学基础模型,统一分类、分割与图像描述
V-JEPA视频预训练+模拟器多模态轨迹蒸馏,实现SOTA端到端驾驶规划
用下游信号训练任务设计器,间接引导自监督预训练更新方向
面向空间感知的掩码深度建模
👍 30将RGB-D相机缺失深度视为自然掩码,通过掩码建模学习联合几何-外观表征
构建1.47亿动作片段的大规模视频动作数据集,显著提升零样本动作识别性能
首次实现无需标注的骨骼绑定与运动生成统一框架
提出L2T框架,用14个语言学习任务与CLM结合,提升模型语言能力