Frontline Lab 摘要与来源
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名xAI:News(网页) · xAI:News(网页)
打开原始来源证据简报
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名xAI:News(网页) · xAI:News(网页)
打开原始来源相关关系来自共同主题、实体、分类、标签与社区语境;每条结果仍保留独立来源回链。
作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。
原始来源Google Research 提出知识画像框架,称前沿 LLM 事实编码接近饱和但 recall 不足;框架将事实分为五类画像,并推出含2,150 条维基百科事实的 WikiProfile 基准。
原始来源OpenRouter 发布工具调用指南,说明如何用同一套代码在 Claude、GPT 和开源权重模型间切换,并覆盖定义工具、请求和返回结果循环。
原始来源@reach_vb 表示其团队昨天发布 Codex for Linux,完整 Codex 桌面体验现已登陆 Ubuntu、Debian 和 Fedora,并包含 parallel agents、worktrees、diffs、skills、automations 和 browser workflows。
原始来源AIHOT 称,DeepSeek V4 Pro 正式版与 Grok 4.6 在2 小时内先后发布,参数规模分别为1.6T/1.5T,并被描述为逼近 Claude Fable 5 体验。
原始来源