用13个可组合技能在编程助手中端到端生成论文,8.1美元、3.2小时一篇
Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai, Liangwei Zheng,...
AI 写作
LLM Agent
智能体系统
自动科研
论文生成
以可执行环境为评测单元,通过环境演化式红队测试将攻击成功率推至85%
Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia...
基准评测
攻击成功率
智能体安全
环境演化
红队测试
强模型构建推理时脚手架,让弱模型零训练下从0.49跃升至0.91。
Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji,...
心智理论
推理时能力迁移
智能体脚手架
知识蒸馏替代
认知负荷卸载
把AI当科学仪器:多智能体自主发现、验证并干预大模型内部机制
Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong...
AI for AI
AI安全
AI智能体
信念机制
机制可解释性
将技能库压缩为保契约的可逆宏图,按任务水合最小可执行上下文
Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang
LLM智能体
图压缩
图文法
技能库
技能检索
NCP-Bench 揭示:最强 LLM 叙事代理 20 轮后存活率仅 42%,长程承诺保持未解决
Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu,...
LLM-as-a-Judge
LLM智能体
交互式叙事
基准评测
对抗性测试
以可编辑的持久3D世界状态为中心,把预可视化从一次性视频生成变为可构建、演化、访问的世界建模
Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu,...
3D场景生成
世界模型
免训练系统
智能体视频生成
相机规划
用测试时2D像素对应作伪真值,两分钟内以显式多视几何约束适配冻结的3D基础模型
Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh
3D视觉基础模型
LoRA
多视几何
对极几何
测试时自适应
让AI编码智能体在6小时固定算力内自主改进世界模型,64次会话63次成功提升
Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput,...
AI智能体评测
世界模型
基准测试
强化学习
自动化科研
冻结模型参数,通过进化技能与上下文支架免训练适配具身智能体
Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng,...
LLM智能体系统
免训练适配
具身智能
机器人学习
自演化智能体
把潜变量演化显式建模为运动学积分,只回归三阶以上残差,让视频世界模型外推未见动力学
Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang,...
分布外泛化
动力学学习
结构化表征
视频世界模型
视频预测
首个视频去反射闭环框架:物理增强合成配对数据、一步扩散去除模型与专用基准S2R-Bench
Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou
基准测试
扩散模型
数据合成
视频修复
视频去反射
自动合成有状态对抗环境、发现可行注入点并生成可验证攻击,评测并对齐LLM智能体安全性
Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu,...
LLM智能体安全
安全对齐
对抗环境合成
强化学习
红队评测基准
三级因果干预显示视觉工具调用的收益集中于少数校准轨迹,多数调用与答案无因果耦合。
Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
因果推断
多模态大模型
强化学习
忠实性评估
视觉工具使用
让软件项目而非智能体保持持久,用有限寿命智能体递归演化出大型软件系统
Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng
多智能体系统
智能体软件工程
科学代码迁移
自动软件演化
长时程任务
以Dirichlet辅助单纯形变量精确增广均匀离散扩散,在不改前向过程下同时升级训练目标与采样器
Jinya Sakurai, Patrick Pynadath, Satoshi Hayakawa, Jaehong Yoon, Xulei Yang,...
Dirichlet分布
Rao-Blackwell化
文本生成
生成模型
离散扩散
首个多模态商业创意基准与智能体:30K样本、SFT+GRPO两阶段训练,7B模型比肩闭源MLLM
Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim
Agentic AI
GRPO强化学习
LLM-as-a-Judge
商业创意生成
多模态基准
用变分后验采样扰动权重替代温度调节,为GRPO注入参数空间探索
Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych
LLM后训练
RLVR
参数空间探索
变分推断
强化学习
用几美元LLM查询克隆出的低参数代理模型,在笔记本上复现大规模LLM社会模拟的宏观规律
Igor Itkin
LLM多智能体
代理模型
平均场理论
社会模拟
统计物理
提出PGE任务与端到端模型GazeAnywhere,用文本/坐标提示直接预测指定人物的注视目标
Xu Cao, Houze Yang, Vipin Gunda, Zhongyi Zhou, Tianyu Xu, Adarsh Kowdle,...
可提示视觉模型
数据引擎
端到端检测
行为理解
视线目标估计
智能体安全应是运行时强制的契约:预防面事前拦截,证据面以硬证据门控提交。
Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang
大模型对齐
安全护栏
智能体安全
立场论文
运行时契约
按神经元模态角色分配更新约束,多模态微调中恢复94.5%语言能力损失
Jiayue Jin, Jingwei Zhang, Chen Wang, Jing Liu, Longteng Guo
多模态大模型
灾难性遗忘
神经元分析
能力保持
视觉指令微调
用扩散先验从低比特权重重建连续权重,为 RTN 中点歧义舍入提供证据,免校准提升 3/4 比特精度
He-Yen Hsieh, H. T. Kung
低比特推理
免校准量化
后训练量化
扩散先验
舍入优化
首个手部逐关节可见性估计独立任务:冻结HPE骨干训轻量头,HInt上mAP达0.931
Ryosei Hara, Masashi Hatano, Rintaro Yanagi, Atsushi Hashimoto, Takuma Yagi,...
可见性估计
多视角三角化
手部姿态估计
计算机视觉
预训练迁移
用 F≤P*≤U 四个份额界定 GPU 机会边界,设备端决策比主机往返快 1.19–2.39 倍
Josef Liyanjun Chen
CUDA Graphs
GPU调度
LLM智能体系统
批处理调度
系统测量
用4D持久世界记忆+自我工作记忆,让VLA仅凭腕部相机打赢多视角基线的长时程操作
Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao,...
4D世界记忆
扩散Transformer
机器人操作
视觉-语言-动作模型
部分可观测性
把复合选项拆成原子证据、用算子约束ILP组合,NEITHER/NOR宏F1从14跃至76.8
Obed Junias, Maria Leonor Pacheco
LLM逻辑推理
基准数据集
整数线性规划
神经符号方法
组合推理