Frontline Lab 摘要与来源
@satyanadella 转发 @mustafasuleyman 的消息:MAI-Thinking-1 是其第一个 reasoning model,built from scratch,目前已在 Microsoft Foundry 可用,并向团队致意。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名X · @satyanadella
打开原始来源证据简报
@satyanadella 转发 @mustafasuleyman 的消息:MAI-Thinking-1 是其第一个 reasoning model,built from scratch,目前已在 Microsoft Foundry 可用,并向团队致意。
@satyanadella 转发 @mustafasuleyman 的消息:MAI-Thinking-1 是其第一个 reasoning model,built from scratch,目前已在 Microsoft Foundry 可用,并向团队致意。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名X · @satyanadella
打开原始来源相关关系来自共同主题、实体、分类、标签与社区语境;每条结果仍保留独立来源回链。
Mustafa Suleyman 表示,Microsoft 的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。
原始来源Microsoft Research 研究称,多语言 Agent 评估常比较最终答案并丢弃轨迹;论文将 action policy 作为衡量对象,覆盖 8 models、6 parallel benchmarks、41 languages、2.38M rollouts,并分析五类混杂因素。
原始来源作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。
原始来源Poe 宣布 Grok 4.6 已可用,并称其为 @SpaceXAI 的新 frontier model,面向长时间运行的 agents、coding 和知识工作构建,提供 500K-token context window。
原始来源@FireworksAI_HQ 转发 @sonyatweetybird 的帖子;原帖询问何时应开始对自有模型做 post-training,并转述 @FireworksAI_HQ CEO @lqiao 的回答:在 product-market fit 之后。
原始来源