找到 62 条结果

构建百万级多方言指令数据集并微调LLM可控生成阿拉伯诗歌。

Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed... 2026-05-01
LLM评估 LoRA 创意文本生成 指令微调 方言处理

构建405道自然科学实验预测任务,揭示LLM在实验结果预测与可靠性校准上的双重缺陷

Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi,... 2026-04-14
LLM评估 基准测试 实验预测 校准评估 科学发现

推理型LLM在概率性推理中过度自信,无法复现人类的分级不确定性判断

Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de... 2026-03-04
LLM评估 不确定性量化 人类认知 常识推理 概率推理

Gemini 3数学Agent在FirstProof中自主解决6/10道研究级难题

Tony Feng, Junehyuk Jung, Sang-hyun Kim, Carlo Pagano, Sergei Gukov,... 2026-02-25
AI数学推理 LLM评估 数学研究 自主Agent 自动定理证明