Frontline Lab 摘要与来源
Microsoft Research 研究称,多语言 Agent 评估常比较最终答案并丢弃轨迹;论文将 action policy 作为衡量对象,覆盖 8 models、6 parallel benchmarks、41 languages、2.38M rollouts,并分析五类混杂因素。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名X · @dair_ai
打开原始来源证据简报
Microsoft Research 研究称,多语言 Agent 评估常比较最终答案并丢弃轨迹;论文将 action policy 作为衡量对象,覆盖 8 models、6 parallel benchmarks、41 languages、2.38M rollouts,并分析五类混杂因素。
Microsoft Research 研究称,多语言 Agent 评估常比较最终答案并丢弃轨迹;论文将 action policy 作为衡量对象,覆盖 8 models、6 parallel benchmarks、41 languages、2.38M rollouts,并分析五类混杂因素。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名X · @dair_ai
打开原始来源相关关系来自共同主题、实体、分类、标签与社区语境;每条结果仍保留独立来源回链。
Mustafa Suleyman 表示,Microsoft 的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。
原始来源@satyanadella 转发 @mustafasuleyman 的消息:MAI-Thinking-1 是其第一个 reasoning model,built from scratch,目前已在 Microsoft Foundry 可用,并向团队致意。
原始来源LlamaIndex 发布 ExtractBench,覆盖 370 份企业文档和 14 个系统,重点测试 long-list completeness;其称 Frontier VLMs 在最长文档上 F1 为 8.9–35.8%。
原始来源@Llama_index 转发 @jerryjliu0 的帖文:ExtractBench 被称为面向真实世界文档抽取的最全面基准之一,帖文明确提到它覆盖 4869 页。
原始来源Google Research 提出知识画像框架,称前沿 LLM 事实编码接近饱和但 recall 不足;框架将事实分为五类画像,并推出含2,150 条维基百科事实的 WikiProfile 基准。
原始来源