跳到主要内容

证据简报

OpenAI:我写了一本 AI 教科书——AI 还要多久才能写得更好?

作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。

发布
更新
编辑
Frontline Lab
来源
Nathan Lambert:Interconnects(RSS)
来源作者
Nathan Lambert:Interconnects(RSS)
相关主题
1
采集时间
2026-08-13

Frontline Lab 摘要与来源

编辑摘要

作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。

这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。

来源署名Nathan Lambert:Interconnects(RSS) · Nathan Lambert:Interconnects(RSS)

打开原始来源

相关已发布证据

相关关系来自共同主题、实体、分类、标签与社区语境;每条结果仍保留独立来源回链。

Google Research:Blog(网页)

WikiProfile 区分事实编码与 recall 瓶颈

Google Research 提出知识画像框架,称前沿 LLM 事实编码接近饱和但 recall 不足;框架将事实分为五类画像,并推出含2,150 条维基百科事实的 WikiProfile 基准。

原始来源
GitHub Blog

OpenAI:AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求

AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。

原始来源