跳到主要内容

证据简报

Grok 4.6 强化长时运行智能体与视觉工作能力

xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

发布
更新
编辑
Frontline Lab
来源
xAI:News(网页)
来源作者
xAI:News(网页)
相关主题
1
采集时间
2026-08-13

Frontline Lab 摘要与来源

编辑摘要

xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。

来源署名xAI:News(网页) · xAI:News(网页)

打开原始来源

相关已发布证据

相关关系来自共同主题、实体、分类、标签与社区语境;每条结果仍保留独立来源回链。

Nathan Lambert:Interconnects(RSS)

OpenAI:我写了一本 AI 教科书——AI 还要多久才能写得更好?

作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。

原始来源
Google Research:Blog(网页)

WikiProfile 区分事实编码与 recall 瓶颈

Google Research 提出知识画像框架,称前沿 LLM 事实编码接近饱和但 recall 不足;框架将事实分为五类画像,并推出含2,150 条维基百科事实的 WikiProfile 基准。

原始来源