保留少数垂直线token和局部窗口为全精度,其余低比特量化,实现近无损长上下文推理加速
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
UniH3用层级同质记忆与异质平衡器统一七种医学图像修复任务并刷新SOTA
利用全局查询的聚类几何结构,用信标查询预判思维回看,保留关键KV缓存并实现5.8倍显存压缩
滑窗注意力胜过线性注意力
👍 14零训练的带槽滑窗注意力在短长上下文任务上追平甚至碾压昂贵的后训练线性注意力
任务需求不是放行已就位的变量,而是驱动注意力在中层窗口把变量汇聚到查询位置
用输入生成的幂律正算子替换注意力的固定双线性形式,训练后坍缩为可缓存的常量算子。
以GDLA注意力与384选8细粒度MoE,13.2B激活参数实现智能体任务开源领先
发现 ALiBi 线性偏置在长上下文中数值下溢,使注意力头变盲。
训练单个可学习令牌在值空间检索,让VLM精准定位长视觉上下文中的相关帧。
用最终答案注意力学习投影,滤除推理轨迹噪声步骤以提升大模型幻觉检测
Chat模板token是DiT的隐式语义寄存器:语义走S→I→R间接回路,据此剪枝省20%注意力算力
长上下文 LLM 的自引导测试时训练
👍 18让LLM自主选择训练片段提升长上下文推理性能
无调参零样本方法,通过动态组大小实现高效长上下文扩展
基于查询机制的实时多目标视频分割,实现接近单目标处理效率
系统刻画MLLM生成时逐token注意力动态,并用注意力阻断与增强干预验证因果并提升性能
学习未来注意力信号,在保持性能的同时大幅压缩KV缓存
通过注意力机制提取跨模态检索头,实现长文档问答中文本与图像证据的高效定位
基于Logit贡献评分的非字面检索头识别
👍 18提出LOCOS方法通过OV电路投影识别执行语义综合的检索头
系统表征多探针网格算法的N和d扩展性,发现在高维场景下相比图、树、划分方法具有独特优势
提出基于3D射线几何的轻量特征上采样框架,仅用16%参数实现SOTA性能