DF26基准显示人类与最先进检测器识别AI生成视频的能力已接近随机
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把多镜头叙事从时间轴搬进空间网格,联合生成长视频
开源五阶段视频数据流水线,对照实验证明广覆盖配方的早期预训练效果优于高过滤配方
可微分令牌取舍机制让视频 VAE 按内容复杂度自适应压缩,生成更快更省
剖析DiT层间记忆偏好,让有界内存的自回归视频模型按状态检索远期历史并只注入敏感层
环形数据构造强制模型检索远期历史,实现分钟级长视频与客体永久性
PAWBench:概率对齐世界建模评测基准
👍 140视频模型能生成合理的单条未来,却难以复现同一条件下可能未来的正确分布。
以人类视频为上下文提示,让机器人零样本完成训练中从未见过的操作任务
300个程序化视觉推理任务+可验证奖励评分器,让视觉生成成为可训练、可验证、可优化的推理媒介
27任务810实例的过程敏感基准:最强视频模型Seedance 2.0推理也仅51.0分
代码世界模型:以编程智能体为世界大脑
👍 34编程智能体用代码维护世界状态,代理视频驱动视频模型渲染高保真开放世界
用4D高斯泼溅重建奖励取代静态3D奖励,修复流式视频生成的几何漂移而不冻结运动。
以传统仿真器八项能力为标尺审计200篇文献,指出状态反馈与物理引擎是结构性缺口
冻结流式生成器,适配器在编辑到达时点火,无限轮指令编辑质量不衰减
响应耦合分区+探针残差重构,22–26%密度下免训练稀疏注意力加速视频生成1.48–2.61倍
以像素级动作流为共享接口,统一跨本体世界建模、开环策略评估与逆向机器人控制
提出以结果为导向的视频生成新任务,用VLM评判结果达成与语义接地双重指标。
V-RAE:为生成重新思考视频潜在空间
👍 29以冻结视觉基础模型特征构建语义潜空间,视频重建与生成双优、收敛快至6倍
分层智能体评测流水线把世界模型评分变成可审计的证据树,判断与人类高度一致
SE(3) 几何感知的动作条件视频世界模型,登顶 WorldArena 2.0 预测赛道