把多镜头叙事从时间轴搬进空间网格,联合生成长视频
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于离散扩散解锁大语言模型的无损加速
👍 144冻结AR权重、外挂LoRA扩散权重并行起草,AR验证实现全批量无损提速
归一化低秩适配(NoRA)
👍 37沿秩维度归一化LoRA下投影矩阵,零额外参数即可加速收敛、提升性能与稳定性
广覆盖SFT获取参与,回合级DPO修复可验证错误,权重缩放保留通用能力
用轻量隐藏态门控连续调节安全LoRA强度,将HarmBench攻击成功率降至近零同时保留通用能力
SFT 让模型改用希腊语推理,RLVR 修好格式缺陷,而准确率基准被 7.7 分种子噪声淹没
首个流式音视频联合身份替换框架:单一扩散模型同步换脸换声,3步采样13.6 FPS
用测试时2D像素对应作伪真值,两分钟内以显式多视几何约束适配冻结的3D基础模型
端到端适配 Nemotron 到希腊语专业域,1B 嵌入微调+LoRA 读者大幅超越通用多语言栈。
用像素桥接与可切换适配器把异构教师能力蒸馏进单一学生
系统诊断小模型PPO对齐的三大失效模式,提出工程化稳定框架与能力余量假说
复用预训练 VLM 自身做视觉 token 自压缩,轻量适配、极端压缩下仍强。
基于超网络的大语言模型知识注入的缩放定律
👍 16首次系统刻画超网络知识注入的幂律缩放,目标模型缩放收益最大且OOD泛化优于微调
把后训练重构为token级正确性二元分类,提升分布外事实忠实度
用人类把关的自我进化循环把医疗后训练变成数据配方搜索问题。
让两个模型互相当考官,竞争式RL隐式评估推理过程质量。
通过上下文空间和参数空间双重蒸馏,将大模型的过程式记忆能力迁移到小模型,实现边缘设备部署
通过挖掘社区LoRA构建大规模数据集,实现高质量的风格-内容双重参考图像生成。
揭示 LoRA 缩放因子 α 的主导作用,提出 α*≈C√r 平方根律。
揭示参数化工具检索系统存在知识-检索解离现象,提供诊断框架和缓解方案