将推理时转向向量转化为组件级 rank-1 权重编辑,实现更优的属性-效用权衡
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过累积误差反馈和无状态种子重放,直接在量化空间对大模型进行全参数微调
从信息论角度证明自进化、隔离、安全三者不可兼得,封闭自进化系统安全必然退化。
通过将多个简单问题组合成复杂新题,解决RLVR训练中"全对"提示泛滥导致有效数据枯竭的问题
超越教师:基于奖励外推的泛化在线策略蒸馏
👍 68通过奖励外推实现超越教师的在线策略蒸馏框架
用长度奖励+冗余惩罚打破LLM推理的浅层探索陷阱
Aletheia 数学研究智能体实现自主证明与论文生成
通过更新门和退出门解决长上下文推理中的记忆爆炸与冗余计算问题
提出梯度引导软掩码方法优化LLM用户表示学习,9个工业任务上超越现有方法
固定更新预算下,少样本多轮训练比多样本单轮训练显著提升推理性能
基于在线因果卡尔曼滤波的稳定高效策略优化
👍 18用卡尔曼滤波平滑token级重要性采样比率,提升大语言模型强化学习的稳定性与效果
用迭代解码替代自回归,让小模型在测试时持续推理远超训练长度
提出分块优势估计方法,为LLM结构化生成中的不同目标分配独立优势信号,解决奖励干扰问题
通过解耦语义推理与时间生成,让全模态LLM原生支持语音同步3D面部动画
知识图谱验证的大语言模型基准测试
👍 7提出FactCheck基准,系统评估LLM在知识图谱事实验证中的能力、RAG效果与多模型共识策略
将搜索QP子任务统一为生成范式,通过渐进式对齐策略实现工业级部署
通过联合优化记忆提取与管理,构建可泛化的自进化智能体记忆系统
提出轨迹级可解释性框架MEP,证明静态归因方法无法诊断智能体多步执行失败
在线强化学习框架,在提升代码安全性的同时保持功能完整性
RL训练的推理模型存在最优输出长度,过长或过短都会降低准确率