将标注作为oracle加入RL组,解耦优势估计防反转,免CoT高效训练统一视频感知。
Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou,...
GRPO
后训练
强化学习
统一视频感知
视频多模态大模型
三系统架构+3.7万小时异构数据一阶段预训练,协同理解、预测与行动的具身基础模型。
GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi,...
VLA
世界模型
具身智能
强化学习
机器人基础模型
两阶段训练的多模态嵌入家族:2B 超越 8B 基线,9B 以 80.6 分居 MMEB-v2 榜首
Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao, Jing Lyu
Matryoshka表示学习
多模态嵌入
对比学习
知识蒸馏
跨模态检索
用奖励梯度构造有界正负中间目标并在线自蒸馏拟合,把图像级奖励变成显式可诊断的监督。
Wei Zhou, Xiongwei Zhu, Lingdong Kong, Bo Chen, Lei Zhang, Yongyuan Liang,...
信任域目标构造
在线策略自蒸馏
奖励引导生成
强化学习对齐
扩散模型后训练
将Harness优化建模为离线学习,用失败轨迹驱动诊断、修补与进化,产出持久更新
Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei...
Harness优化
LLM智能体
执行轨迹诊断
自动提示优化
进化搜索
token级干净上下文蒸馏使最强自适应注入ASR从94%降至9%且效用无损
Yibo Peng, Long Lian, David Wagner, Sizhe Chen
LLM安全
在线策略蒸馏
提示注入防御
自适应攻击
防御性微调
将真实CVE转化为可执行数据训练OpenAegis,CyberGym通过率达58.1%
Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan...
LLM智能体
后训练
数据合成
漏洞复现
网络安全
用经校验的工作记忆驱动技能调用,以结构化证据定位失败并定向演化记忆,实现冻结模型的递归自我改进
Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang,...
Agent Harness
LLM智能体
技能演化
智能体记忆
递归自我改进
通过有界价值头、蒙特卡洛目标与长度自适应GAE,让单样本Critic强化学习稳定媲美GRPO
Penghui Qi, Xiangxin Zhou, Wee Sun Lee
PPO改进
RLHF
价值函数学习
大语言模型
强化学习
用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数
Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang,...
RLVR
大模型后训练
强化学习
数学推理
知识蒸馏
固定元操作Ω并递归作用于其自身输出,构建深度自增长、角色涌现的自我提升智能体栈
Zae Myung Kim, Young-Jun Lee, Seungyeon Jwa, Dongyeop Kang
LLM智能体
元认知
程序合成
进化搜索
递归自我提升
LAION 发布 1000 万小时开放视频数据集,一源三用验证视频、音频、图文预训练
Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic,...
多模态预训练
对比学习
开放视频数据集
数据整理
视频-文本
构建G2WEngine数据引擎与免掩码GameCleaner,剥离游戏HUD提升世界模型数据质量
Wenxuan Shen, Dongna Jin, Dongping Chen
世界模型
多模态大模型
数据引擎
游戏视频
视频编辑
首篇智能眼镜系统综述:以感知-状态-行动闭环为纲,提出L0-L5能力分级与九维部署评估框架
Jiangning Zhang, Haojun Chen, Yong Liu
L0-L5能力框架
具身智能
可穿戴智能体
智能眼镜
第一人称智能
算法专家智能体接力协作,用公开测试反馈逐步修复竞赛代码
Andrei Mikhailov, Mikhail Burtsev, Alsu Sagirova
LLM智能体
代码生成
多智能体系统
检索增强生成
竞赛编程
CRDT 共享工作区加显式协调层,抑制多智能体弃坑失败并提升质量
Seonglae Cho, Donghyun Lee
CRDT
LLM Agent
MCP
代码生成
分布式系统
语言交接会保留约束的语义内容,却悄悄剥夺其行动强制力,造成工作流状态传递失败。
Yiheng Sun, Huifei Wang, Yancheng Zhu, Zhenyu Li, Zebin Zhao, Yifan Yuan
AI安全
LLM智能体
多智能体协作
智能体交接
状态保持
用无超参方法把智能体轨迹压成小型FSM,统一支撑下一步预测、失败预测与运行时监控
Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton...
LLM智能体
工作流记忆
智能体安全监控
自动机学习
过程挖掘
智能体与批评者共享参数交替进化,在轨迹中主动纠错,领先最强RL基线2.1 EM
Boyang Liu, Senjie Jin, Peixin Wang, Zhangyue Yin, Yibo Wang, Yuhao Zhou,...
LLM反馈
信用分配
偏好优化
强化学习
搜索智能体
不替换现有推荐流水线,用意图引擎+元引擎+双重奖励回路实现淘宝首页GMV提升1.31%
Bin Zhang, Bowen Zheng, Chao Yi, Chengyu Lai, Dian Chen, Dimin Wang, Gaoyang...
LLM智能体
工业级A/B测试
意图理解
推荐系统
离线强化学习
免训练的熵谷选择器:解码前用全掩码平均熵为掩码扩散翻译自适应挑选目标画布长度
Yan Zhan, Mengkai Hou, Wanting Zhang, Zhijun Gao
免训练方法
掩码扩散语言模型
机器翻译
测试时长度选择
解码策略
API 逐参数对齐 scipy.ndimage 的 CUDA 形态学、距离变换与最优输运加速库
Kai Zhao
CUDA
GPU 加速
PyTorch
数学形态学
最优传输
把LLM前馈层改造成任务专家,任务级路由让1B模型超越8B基线且可即插即拔增删任务。
Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker
多任务学习
多模态大模型
模块化架构
混合专家
视频理解
无中央协调的多智能体科学社区自主做出五项超越现有文献的数学新结果
Stephen Chung, Wenyu Du, William J. Wesley
AI for Mathematics
AlphaEvolve
多智能体系统
开放世界环境
数学构造搜索
把未来想象压缩为潜在动作意图序列,性能追平 Joint-WAM 且延迟降低 42.9%
Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie,...
世界动作模型
动作无关预训练
机器人操作
流匹配
潜在动作
直接问答测得的记忆准确率与用户满意度脱钩,自然融入才真正相关
Ryuichi Sumida, Koji Inoue, Tatsuya Kawahara
LLM-as-a-judge
基准构建
对话记忆评估
长期人机对话
随机化部署实验