用FFT类结构化矩阵与方差率损失,构建跨模态实时神经压缩编码器。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用语言模型作推理接口,把科学专用基础模型(Tsaheylu 接口)接入智能体系统,让多模态科学任务效用更高、Token 更省。
NVIDIA开源30B-A3B MoE全模态模型,文本图像视频音频全支持。
首个面向持续同事型智能体的活世界基准,100任务/13场景/1537确定性Python检查器打分
构建了跨越47国17语、3万+奥数题的MathNet基准,并首次系统性评测模型在数学等价检索上的能力。
真实可复现的多模态深度研究智能体评测基准
LG 发布 33B 开源视觉语言模型,主打文档理解与韩语能力
基于 Focus-and-Refine 的区域化图像精修,在用户指定区域内恢复细节且严守背景不变。
通过主动降低图像分辨率,强制VLM关注核心结构信息以提升VQA性能
SteerViT通过早期融合交叉注意力让冻结ViT可文本操控,并保持原表征质量
用扩散 Transformer 直接生成分割 mask,一步推理,达到 SOTA
用独立LoRA在并行画布上训练13种音视频控制模态,仅需55K步即可超越VACE等基线
开源统一视频生成模型,融合多模态组合与推理能力,支持文本/图像/视频自由形式输入
将查询分解为逻辑树,用轻量专家做多模态帧选择,无需训练即可超越迭代方法
首个评测全模态模型社交互动能力的 who-when-how 三维基准
多模态OCR:解析文档中的一切内容
👍 46将文档中的文字和图形统一解析为可渲染的结构化代码,而非像素裁剪
首次将双向音视频扩散模型蒸馏为实时流式自回归生成器
4B参数医疗智能体通过行为蒸馏实现离线部署,性能媲美前沿大模型
首个多模态多源个性化记忆问答基准 ATM-Bench,SGM 显著优于传统 DM。
首个基于掩码离散扩散的any-to-any多模态模型,统一文本/语音/图像处理