用预训练的泛化价值模型V0作为先验,自适应融合稀疏采样经验均值,实现低方差基线估计
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
差分子空间分解与双通道软加权注意力,实现精准提示词高亮
利用作者反驳作为偏好监督,训练模型生成可操作的审稿反馈
通过对比学习对齐成功推理轨迹,增强RLVR泛化能力
LLM 写代码替代 PSRO 的深度 RL 预言机,生成可读可审计的多智能体博弈策略。
推理通过计算缓冲和事实启动两大机制扩展LLM参数知识边界
通过解耦推理与置信度优化目标,解决 RLVR 训练中模型过度自信的根本问题
基于因子化世界状态的奖励预测
👍 2通过将观测分解为对象-属性结构,实现零样本跨域奖励预测
用多信号漂移检测+约束保持+回归风险三项保障实现递归自改进中的对齐保护。
用双向LLM并行编辑CTC假设,实现27倍推理加速且精度持平自回归模型。
BitNet 1.58-bit 量化天然兼容 N:M 稀疏,同稀疏率下退化更小
语言模型预训练中的渐进残差预热方法
👍 36通过逐层渐进激活残差连接,提升Transformer预训练稳定性和性能
提出两阶段框架解决多模态图中的跨模态对齐和模态偏好问题
通过理论分解和层次搜索,将科学发现的训练复杂度从指数级降低到对数级
基于迭代自策略蒸馏的推理压缩方法
👍 9用自身简洁行为蒸馏模型,无需标注即压缩推理token并提升准确率
通过截断步级采样和分解式过程奖励,解决检索增强推理中的信用分配问题
通过动态奖励的强化学习提升多模态模型在开放世界分类中的特异性
首个系统评估视频LLM实时交互能力的基准,覆盖记忆、感知与主动响应
首个集成跨模态payload生成、多轮攻击和LLM裁判的多模态安全评估平台
大语言模型有多可控?跨行为粒度的统一评估
👍 25提出SteerEval基准,系统评估LLM在不同粒度级别的可控性