通过位置注入和多角色转换建模实现长叙事视频生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出多智能体框架,利用代码驱动的探索自动将数学问题演化为更难的变体
面向科研全流程的数据中心化多智能体框架,在六项基准上取得 SOTA 并开源 27B 模型
用 LLM 编排器根据任务难度动态生成并迭代精炼分层 DAG 拓扑,比最强基线最多提升 14.6% pass@1。
测试时拦截-纠正-拒绝框架,动态优化多智能体系统中错误信息的传播
用技能手册实现高效可解释的多智能体编排,替代昂贵的RL训练
在真实部署环境中对LLM智能体进行红队测试,揭示11类安全、隐私与治理漏洞
大规模 AI 社交平台 Moltbook 虽有密集互动,但未出现人类式的社会化收敛。
利用VLM视觉接口实现异构多智能体间无文本潜空间通信
通过异构知识检索+多视角评审委员会+多维度解耦评估,实现自动化研究创意深度评估
基于LLM的多智能体系统,通过迭代推理实现零样本单细胞类型注释
提出AI代理间安全可验证的自适应委托框架
通过双流架构和物理感知闭环机制,将文本指令转化为物理一致的4D动态场景
从信息论角度证明自进化、隔离、安全三者不可兼得,封闭自进化系统安全必然退化。
首个面向多智能体买卖谈判的LLM基准测试框架,覆盖110+任务场景
多智能体分层框架实现4K原生分辨率高保真多轮图像编辑
通过按智能体归一化优势值,解决多智能体LLM系统中RL训练的梯度不稳定问题
多智能体+知识图谱框架,通过图遍历算法发现PFAS可持续替代材料
用结构化表格管理搜索状态,统一解决深度/广度/深广混合信息搜索
提出可学习的潜在记忆框架,通过角色感知的潜变量优化解决多智能体记忆同质化和信息过载问题