LLM+GNN联合选择问题与受访者,在预算约束下高效推断群体属性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
400B总参数/13B激活的MoE模型,采用交错注意力和新型负载均衡策略
用大语言模型发现多智能体学习算法
👍 17LLM驱动的进化搜索自动发现并蒸馏CFR和PSRO新算法
首个星际争霸II世界模型,通过预测未来观测实现LLM决策的前瞻性优化
通过低曲率投影约束优化实现LLM编辑时的能力保持
GLM-5:从氛围编码到智能体工程
👍 198智谱旗舰模型GLM-5,通过DSA、异步RL和大规模智能体训练实现前沿性能。
SAE未能学到有意义的特征分解,随机基线与其表现相当
自适应优化器中更新掩码的惊人有效性
👍 11随机掩码参数更新可显著提升LLM预训练性能
利用正交字典学习和闭式Procrustes更新实现训练后Transformer压缩
通过四层测试套件和能力自适应课程策略,优化LLM代码生成的强化微调
屏蔽0.01%伪标记token,稳定RL训练并提升LLM推理准确率
在RL训练中嵌入经验-反思-整合循环,使语言模型通过显式自我反思将环境反馈转化为持久行为改进
基于1M+真实轨迹训练的开放网页世界模型,显著提升智能体性能
提出Q-Anchor框架,利用LLM和查询锚点机制实现工业级场景自适应用户表征。
基于LLM的多智能体系统,通过迭代推理实现零样本单细胞类型注释
首个针对RAG系统知识提取攻击的系统性基准测试,涵盖6种攻击策略和4种防御机制
系统解构指令选择的数据表示与算法,揭示梯度表示最可靠但收益随预算衰减
通过分层合成数据框架为推荐LLM建立首个幂律缩放定律
通过双流架构和物理感知闭环机制,将文本指令转化为物理一致的4D动态场景
首个系统性LLM原生推理框架,自动化单细胞组学分析