用冻结LLM的next-token预测损失训练密集检索器,无需标注正负样本对
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过门控Transformer架构缓解注意力集中问题,在多个医学成像基准上平均提升6.1% F1分数
提出R-SWA注意力机制,实现KV cache恒定,支持一次解析数十页文档
通过句子级注意力引导的二叉树实现多粒度检索,平均提升信息效率6.1%
重新思考混合架构中高效注意力的角色
👍 20系统分析混合架构中高效注意力对长上下文能力的影响机制
利用Fisher-Rao距离检测注意力转移,动态重加权token级优势以提升MLLM跨模态推理。
发现CoT微调破坏混合模型长上下文召回能力,提出QK-Restore零训练修复方法
提出FlowTracer框架,通过注意力图谱追踪信息流实现token级别的精准信用分配
SwiftVR:实时单步生成式视频恢复
👍 17首个在消费级GPU上实现实时1080p视频恢复的单步生成模型
将RAT+的指数衰减记忆模块应用于Quest、MoBA、SnapKV等稀疏推理方法,大幅提升精度
首个系统评测多模态模型视频记忆能力的认知心理学基准。
揭示图语言模型中图sink token的激活模式与语义效用解耦现象
将注意力重新解释为函数空间之间的线性算子,实现高效且分辨率无关的算子学习
以「空间锚点token+条件化弹性query」分工压缩视觉token,单模型支持16~256多预算推理
通过微调轻量级交叉注意力层实现高效长上下文压缩
提出解耦记忆架构实现分钟级一致长视频生成
用自适应状态替换静态锚点,解决流式视频生成中的动态性抑制问题
通过学习探测KV协方差的探针向量,将局部线性注意力可扩展地应用于大模型预训练
提出Simplex旋转编码和稀疏Hub注意力,实现可扩展至四个玩家的多智能体世界模型
把注意力矩阵拆成对称与反对称两部分,用 Hopfield 能量视角诊断并用「循环扰动」控制扩散模型的保真度-多样性权衡。