Frontline Lab 摘要与来源
@dongxi_nlp 认可 MATS 对 AI safety 的贡献,但认为部分研究把中国 open-weight models 描绘成“evil”,并建议采用跨模型家族相同测试、独立标注和更多元评估。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名X · @dongxi_nlp
打开原始来源证据简报
@dongxi_nlp 认可 MATS 对 AI safety 的贡献,但认为部分研究把中国 open-weight models 描绘成“evil”,并建议采用跨模型家族相同测试、独立标注和更多元评估。
@dongxi_nlp 认可 MATS 对 AI safety 的贡献,但认为部分研究把中国 open-weight models 描绘成“evil”,并建议采用跨模型家族相同测试、独立标注和更多元评估。
这份简报保留原始来源,摘要和编辑判断都可以回到原文独立核验。
来源署名X · @dongxi_nlp
打开原始来源相关关系来自共同主题、实体、分类、标签与社区语境;每条结果仍保留独立来源回链。
@DataChaz 转发 @Marie_Haynes 的观点;原帖称,围绕 Anthropic 为 Claude 输出加水印的愤怒很离谱,并称 Google 一直在做同样的事。
原始来源AIHOT 称,DeepSeek V4 Pro 正式版与 Grok 4.6 在2 小时内先后发布,参数规模分别为1.6T/1.5T,并被描述为逼近 Claude Fable 5 体验。
原始来源Anthropic 研究称,45 个协调智能体在 2700 万 token 中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个漏洞。
原始来源发帖作者称,在 @aimlapi 为 TERAFAB megafactory 推出的 three.js benchmark 中,Grok 和 Claude Opus 5 首次尝试都完成代码;列出的成本为 Opus 2.06 美元、Grok 0.38 美元。
原始来源Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工 Anthropic 再培训项目应对 AI 劳动力市场冲击的效果。
原始来源