2026-07-16
GPT-Red:通过自对弈提升 AI 鲁棒性
OpenAI 发布了 GPT-Red,这是一个自动化红队测试的 LLM,利用自对弈(self-play)来提升 AI 抵御网络攻击和提示注入攻击的鲁棒性,并透露将 GPT-5.6 与 GPT-Red 对抗训练增强了其防御能力。 这标志着 AI 安全研究的一项突破,使模型能够通过对抗性自对弈自主提升安全性,有望大幅减少人工红队测试的需求,并加速更安全 AI 系统的部署。 最新的 GPT-5.6 通过与 GPT-Red 对抗训练而提升了鲁棒性。GPT-Red 生成攻击提示以寻找漏洞,迫使目标模型学习更好的防御策略。rss · OpenAI · 7月15日 10:00
背景: AI 红队测试是通过模拟对抗性攻击来发现漏洞的过程。自对弈是一种训练技术,AI 通过与自己对抗来提升能力,由 AlphaGo 推广。GPT-Red 结合了这两个概念,充当自动化的对抗性陪练伙伴,不断生成新的攻击策略,从而推动目标模型随着时间的推移变得更加鲁棒。
参考链接
xAI 开源 Grok 构建工具
xAI 已将用于开发 Grok AI 模型的工具基础设施 Grok Build 开源,并在 GitHub 上以开源许可证发布。 此举使外部开发者能够参与并构建在驱动顶级 AI 实验室的相同工具之上,可能加速 AI 开发工作流的创新。 Grok Build 包含 CLI、编码代理和全屏终端 UI,并由 Grok 4.5 驱动。此次开源发布允许开发者检查、修改和扩展该工具。rss · HN Frontpage · 7月15日 20:24
背景: Grok Build 是 xAI 为构建和完善 Grok AI 模型而创建的开发工具链。它提供命令行界面和编码代理,简化复杂工程任务。通过将其开源,xAI 遵循了主要 AI 公司发布基础设施组件以促进社区协作的趋势。
Thinking Machines 发布开放权重模型 Inkling
2026 年 7 月 15 日,Thinking Machines 发布了其首个开放权重 AI 模型 Inkling,这是在经过 18 个月几乎不公开的基础设施建设之后的首个公开成果。 此次发布挑战了 AI 模型开发中“一刀切”的做法,提供了一种模块化替代方案,可能增加开放权重生态系统的竞争与多样性。 Inkling 是 Thinking Machines 基础设施工作的一个证明,其开放权重的特性允许用户下载和微调模型,但它并非完全开源,因为缺少训练代码和数据。rss · HN Frontpage · 7月15日 18:12
背景: 开放权重模型将其训练好的参数公开提供,这与封闭模型不同。然而,开放权重模型与开源 AI 不同,后者还包括训练代码和数据。许多流行模型如 Llama 和 DeepSeek 只是开放权重。
参考链接
社区讨论: 在 Hacker News 上,社区表现出强烈兴趣,共有 143 条评论和 576 个积分。情绪褒贬不一:有人赞扬向模块化 AI 迈进,也有人质疑其透明度,指出仅开放权重可能无法确保真正的开放性。