保留少数垂直线token和局部窗口为全精度,其余低比特量化,实现近无损长上下文推理加速
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
冻结子代理并行读全文,主代理散射-聚合多轮推理,长文多跳问答更准且最高提速11倍。
扩展上下文管理工具集,用细粒度强化学习教智能体主动管理自身工作上下文
滑窗注意力胜过线性注意力
👍 14零训练的带槽滑窗注意力在短长上下文任务上追平甚至碾压昂贵的后训练线性注意力
推理时只保留提示前缀加滑动窗口,让长思维链成本恒定,免训练提速3倍
在融合注意力内核内按分数Tile组路由FP16/INT8精度,稠密全连接下加速长上下文预填充
首个原生10240核苷酸上下文的十亿级双向RNA基础模型,统一长RNA表征学习与全长mRNA设计
均值校正+FA3/4级稀疏内核,长上下文prefill最高加速47倍并落地SGLang
自适应长度离散部件令牌+长上下文自回归,部件级3D生成扩展至300部件、256k令牌
离线抽取信息金块并切片复用上下文化KV缓存,在100ms尾部延迟预算下兼顾精度与效率
以GDLA注意力与384选8细粒度MoE,13.2B激活参数实现智能体任务开源领先
离线缓存教师Top-K对数几率并融合分块KL损失,让蒸馏显存随序列长度线性增长。
LG 升级再造 K-EXAONE,构建 750B 总参/37B 激活的 MoE 多语言基础模型。
用8个可学习恢复token生成上下文条件化紧凑缓存,弥补KV驱逐损失。
发现 ALiBi 线性偏置在长上下文中数值下溢,使注意力头变盲。
Kimi K3:开放的前沿智能
👍 431首个开源3T级原生多模态MoE,配1M上下文与多档强化学习
长上下文 LLM 的自引导测试时训练
👍 18让LLM自主选择训练片段提升长上下文推理性能
德语和英语的主权开源基础模型
👍 830B总参数仅激活3B的双语MoE模型,长上下文服务效率领先,德语能力突出
无调参零样本方法,通过动态组大小实现高效长上下文扩展
学习未来注意力信号,在保持性能的同时大幅压缩KV缓存