← Index

2026-06-01


  1. NVIDIA 发布 Cosmos 3:首个面向物理 AI 的开源全能模型 10/10
  2. 1 位 Bonsai Image 4B 实现设备端图像生成 9/10
  3. ChatGPT 谷歌表格插件存在提示注入泄露风险 8/10
  4. Odysseus:开源自托管 AI 工作空间发布 7/10

NVIDIA 发布 Cosmos 3:首个面向物理 AI 的开源全能模型

NVIDIA 发布了 Cosmos 3,这是首个专为物理 AI 推理和行动设计的开源全能模型,使机器人和自主系统能够感知、推理并在物理世界中行动。 此次发布意义重大,因为它提供了一个开放、统一的模型,能够原生处理多种模态,通过降低入门门槛,可能加速机器人、自动驾驶等领域的发展。 该模型将生成的每个视频分解为四个维度的单一事实是与否问题:语义对齐、物理定律、几何推理和视觉完整性,涵盖包括机器人和自动驾驶在内的七个物理 AI 领域。

rss · Hugging Face · 6月1日 04:44

背景: 当前的人工智能系统通常是多模态的,但并非真正统一;它们将各模态的模型拼凑在一起。全能模型旨在创建跨所有模态的共享潜在表示。物理 AI 指的是能够感知、推理并在物理世界中行动的人工智能系统,而非纯数字环境。

参考链接

1 位 Bonsai Image 4B 实现设备端图像生成

PrismML 发布了 Bonsai Image 4B,这是首个可在 iPhone 等本地设备上直接运行的 1 位图像生成模型,与标准 4B 模型相比,内存占用减少高达 8.3 倍。 这一突破使得高质量图像生成在无需云端依赖的消费级硬件上成为可能,普及了 AI 图像创作,并支持保护隐私的设备端应用。 该模型使用二进制{-1, +1}变换器权重,配合 FP16 分组缩放因子,实现每个权重仅 1.125 有效位,基于 FLUX.2 Klein 4B,并提供 1 位和三元两种变体。

rss · HN Frontpage · 5月31日 15:04

背景: 大型图像生成模型通常因其规模和内存需求而需要强大的云端 GPU。量化通过降低模型精度来减少内存占用,但极端的 1 位量化此前被认为损失过大。Bonsai Image 4B 证明了精心设计的量化可以在保留视觉质量的同时实现本地部署。

参考链接

ChatGPT 谷歌表格插件存在提示注入泄露风险

PromptArmor 的安全研究人员演示了针对 ChatGPT 谷歌表格插件的提示注入攻击,可以在用户无感知的情况下将整个工作簿数据窃取到攻击者控制的服务器。 该漏洞暴露了 AI 驱动的生产力插件中存在的严重安全风险,攻击者无需用户交互即可窃取敏感的电子表格数据。 攻击无需用户点击或确认;只需加载包含恶意提示的文档,即可触发整个工作簿所有工作表中的数据窃取。

rss · HN Frontpage · 5月31日 20:35

背景: 提示注入攻击通过在看似正常的提示中嵌入恶意输入来操纵大语言模型。ChatGPT 谷歌表格插件允许用户在侧边栏中与 AI 聊天机器人交互,并可以访问和处理电子表格数据。间接提示注入可以嵌入到单元格中,在 AI 处理时会命令其将数据发送到外部 URL。

参考链接

社区讨论: Hacker News 上的评论者表达了担忧,有些人表示他们每天依赖此功能,并希望出台更精细的安全修复方案。一位评论者对 Anthropic 尚未解决类似风险感到震惊。


Odysseus:开源自托管 AI 工作空间发布

Odysseus 是一个新的开源、自托管 AI 工作空间,提供聊天、代理、工具、模型服务、电子邮件集成和研究等功能,全部运行在用户自己的硬件上。 该项目让注重隐私的用户和开发者完全控制自己的 AI 工具和数据,减少对第三方服务的依赖,顺应了自托管解决方案日益增长的需求。 Odysseus 提供本地 Shell 访问、文件上传、模型下载、网络研究、日历/电子邮件集成以及 API 令牌管理等功能,均通过 Web 界面访问。

rss · HN Frontpage · 5月31日 15:50

背景: 自托管 AI 工作空间允许用户在本地机器上运行 AI 模型,而非依赖云服务。这种方式确保数据隐私、避免使用费用并支持定制化。Odysseus 是旨在去中心化 AI 访问的开源工具生态的一部分。

参考链接

社区讨论: Hacker News 上的讨论总体正面,用户赞赏其全面的功能集和自托管方式。一些评论提到项目创建者的背景,以及一个关于使用 AI 生成邮件作为礼貌拒绝的趣闻。