通过停止梯度算子实现无界正向更新的非对称优化框架,解决RL中探索与稳定性的矛盾
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出端到端可学习的层级稀疏注意力机制,实现超长上下文外推和高效推理
通过半自回归生成和硬件感知调度,将LLM推理速度提升60%-85%
TREK:蒸馏以探索、强化以精炼
👍 8TREK扩展GRPO探索支持,提升数学和Agent性能
结合学习性与梯度对齐的多领域强化学习课程调度方法
字节跳动Seed2.0系列模型,专注处理真实世界复杂任务的多尺寸大语言模型
研究表明读者难以区分 AI 翻译,但更偏好人类译作的流畅性和沉浸感。
提出RLMF方法,通过元认知反馈强化学习实现LLM数值和语言不确定性的忠实校准
异步OPD中陈旧数据影响分析与高效训练流水线
通过分离确定性计算与语言层,实现硬件感知的七通道EEG智能代理系统
研究编码 Agent 训练中的奖励信号设计问题,提出验证器与生成器协同进化的框架
ViQ:任意分辨率的文本对齐视觉量化表示
👍 38ViQ实现高质量量化视觉表示,兼顾语义与细节,支持任意分辨率。
代理式AI指南:从基础到系统
👍 18从LLM架构、强化学习训练到代理系统设计的全栈指南
通过学生-教师概率比识别高价值负样本轨迹,提升 LLM 策略蒸馏效果
首个大规模中文精神科诊断基准,通过多智能体框架评估LLM在精神科咨询和诊断中的能力
更深不一定更好:通过置信层解码缓解对齐税
👍 24通过动态选择熵谷层而非最终层,缓解 RLHF 对齐训练对复杂推理任务的负面影响
TAPO通过构建微观反思轨迹,让模型从自己的错误中学习,在数学推理任务上显著提升表现
将LLM问题采样建模为流形结构化老虎机,通过层次树和贝叶斯方法平衡效率、多样性与评估效用。
将Python代码基准扩展到12种语言,揭示LLMs的Python过拟合和多语言性能差异
通过惊异度引导的令牌级优势重加权解决GRPO训练中的策略熵坍塌问题