冻结AR权重、外挂LoRA扩散权重并行起草,AR验证实现全批量无损提速
Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya...
LoRA
RL后训练加速
一致性蒸馏
扩散语言模型
投机解码
以验证器优势校准同模型密集自引导,用轨迹平衡拟合归一化目标分布实现自改进。
Zixun Huang, Kishan Panaganti, Haitao Mi, Leowei Liang
GFlowNets
LLM推理
RLVR
在线策略蒸馏
自改进
级联嵌入匹配加按需VLM裁决,让文本提示分割既追得稳,又能识破雕像画作等相似干扰。
Javier del Pino, Salvador Rodríguez, Alejandro Garabito, Javier Álvarez,...
3D重建前处理
VLM语义验证
开放词汇分割
文本提示分割
级联推理
预训练Transformer上下文学习零训练估计因果效应,精度媲美调优基线且推理快约百倍
Christopher Stith, Hossein Rahmani, Jesse C. Cresswell
先验拟合网络
因果推断
基础模型
摊销贝叶斯推断
综述与基准
用验证器抽检教师逐题可靠性,按提示在密集OPD与GRPO间独占路由
Zhiwei Zhang, Zechen Sun, Fei Zhao, Kang Peng, Bin Liang, Huayu Deng, Yao...
LLM后训练
RLVR
在线策略蒸馏
知识蒸馏
算力利用
以可执行技能契约和守卫运行时把VLA策略变成闭环具身智能体
Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao,...
VLA
具身智能
智能体框架
机器人操作
闭环控制
OPSD以自身加特权信息当教师,但不对称也扭曲信号,可用三个杠杆治理坍缩。
Justin Robert, Raheel Qader
大语言模型
强化学习
推理
知识蒸馏
综述
不设专用记忆模块,把分钟级时间戳视频直接作为VLM原生上下文,四项记忆基准全部刷新SOTA
Cheng Yin, Wang Xu, Junpeng Yang, Sikyuen Tam, Hanyu Liu, Yuan Yao, Xiangrui...
VLA
机器人操作
流式推理
视频语言模型
长时程记忆
把安全对齐从「整题拒绝」细化为学习主题内的拒绝边界,用数据组成控制安全与可用性权衡
Alejo López-Ávila, Iker García-Ferrero, Jezabel Garcia, Antonio Tiene, Román Orús
LLM安全对齐
LoRA微调
数据组成
窄边界拒绝
自生成安全数据
用ICL示例集成的评分函数替代人工提示,在七项NLP内容选择任务上保覆盖、提简洁。
Xiao Shi Huang, Chen-Yuan Lin, Bruce Kuwahara, Kin Kwan Leung, Jesse C. Cresswell
LLM评分
上下文学习
不确定性量化
共形预测
内容选择
未被审计的回传梯度以精确零值暴露真实数据行,令前向信道的隐私门形同虚设
Georgios Politis, Evangelos Pappas
差分隐私
拆分学习
梯度泄露
系统安全
隐私审计
提出RevPropBench评测LLM修订传播能力,并行采样加选择是性价比最高的测试时计算方法
Daisuke Kikuta
LLM基准评测
修订传播
成本效益分析
测试时计算
结构化输出编辑