9B参数全双工全模态模型,<12GB内存实现实时听说看同步
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
面向图像编辑/恢复任务的保真度评估模型与基准
首个高保真无人机具身搜救基准与仿真平台。
为LVLM设计并行PVM模块,缓解长序列生成中的视觉信号衰减
首个面向海洋科学的统一多模态语料库,含50亿token与14万指令对
用单一Transformer让ViT直接预测文本token,省去对比损失和文本解码器,5倍数据效率超越SigLIP2。
Z.ai发布原生多模态智能体基座,集成CogViT与多任务RL。
Tuna-2:像素嵌入像素空间统一多模态,端到端无VAE/编码器达SOTA。
提出 TEXOCR-Bench 基准与 2B 模型 TEXOCR,用 SFT+RLVR 把 PDF 页面恢复成可编译、结构一致的 LaTeX 源码。
提出L1-L4四层时间序列推理认知分类法,构建8.3万样本HITSR数据集,并基于Qwen3-VL训练双视图(折线图+索引-数值表)的LLaTiSA模型,通过三阶段课程微调在L1-L3 OOD任务上大幅超越GPT-4o等基线。
用上下文展开让统一多模态模型在推理时动态调用多模态原子能力。
在同一架构中联合训练图像生成与伪造检测,让两者互为老师、学生并协同进化。
从生成视角探索空间智能
👍 23提出 GSI-Bench:首个生成式空间智能基准,仿真训练可提升空间编辑与理解。
通过工具监督强化学习实现视觉推理
👍 4用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理
统一推理与生成的自动摄影图像编辑框架
提出组合性偏差框架与首个专门评测 MLLM 裁判可靠性的九类偏差基准
CoT 提示降低视觉空间推理能力,揭示 MRMs 文本先验幻觉
VLM+2D模型+YAML中转,把游戏UI截图自动还原为Unity资产。
首个专为视频RL设计的端到端训练评测框架,带离线缓存与异步推理
首个8B音视觉语言模型,将长影视视频转写为分层、时序对齐的剧本。