2026-06-03
- AI 在盲测中击败法学教授 9/10
- 微软 Project Solara:为 AI 代理而非应用打造的安卓系统 9/10
- 微软发布 MAI-Code-1-Flash 及六个新 AI 模型 9/10
- Dashlane 遭黑客暴力破解 2FA 窃取密码库 9/10
- VSCode 漏洞实现一键窃取 GitHub 令牌 9/10
- Pluto.jl 1.0 发布:Julia 响应式笔记本 8/10
- 在 Linux 上将 NVIDIA GPU 显存用作交换空间 8/10
- CT 扫描揭示比亚迪工程选择 8/10
- 微软 ASSERT:用文本描述生成 AI 行为测试 8/10
- 数学家警告 AI 威胁职业,继 OpenAI 突破之后 8/10
AI 在盲测中击败法学教授
斯坦福法学院的一项研究发现,在近 3000 次盲测比较中,AI 生成的学生问题答案在 75%的情况下优于法学教授的答案。 这一结果表明,先进 AI 的 legal reasoning 能力已达到或超越人类专家水平,可能改变法学教育、辅导甚至法律实践的某些方面。 该研究涉及 14 名法学教授为学生问题撰写原始答案,以及来自某未指名大型语言模型的 AI 生成回答;两组答案由相同或不同的教授在不知来源的情况下评分。rss · HN Frontpage · 6月2日 23:43
背景: 大型语言模型(如 GPT-4)在各种知识和推理任务中表现出色。LegalBench 是专门评估 LLM legal reasoning 的基准之一,包含 162 项任务。本研究超越了基准测试,在真实教育场景中直接比较 AI 与人类专家。
参考链接
社区讨论: Hacker News 上的讨论(176 条评论)既有对 AI 能力的兴奋,也有对法学教育和法律职业影响的担忧,部分评论质疑研究结果的可推广性。
微软 Project Solara:为 AI 代理而非应用打造的安卓系统
在 2026 年 Build 大会上,微软宣布了 Project Solara,这是一个基于安卓的全新操作系统,专门为运行 AI 代理而非传统移动应用而设计。 这代表了移动计算的范式转变,可能改变用户与设备的交互方式以及开发者的软件构建方式,从以应用为中心转向以代理为中心。 Project Solara 包含两款可工作的硬件设计,并已获得多家大公司的初步承诺。它基于安卓而非 Windows,标志着微软的战略转向。rss · Ars Technica · 6月2日 20:47
背景: AI 代理是能够代表用户执行任务的自主软件程序,例如预订约会或管理日程。传统上,安卓和 iOS 等移动操作系统围绕安装和启动单个应用构建。Project Solara 将操作系统重新构想为一个平台,让代理直接与用户及彼此交互,无需传统的应用界面。
参考链接
微软发布 MAI-Code-1-Flash 及六个新 AI 模型
微软宣布推出 MAI-Code-1-Flash,一个基于清洁数据端到端构建的新代码生成模型,同时发布了包括推理和语音模型在内的另外六个 MAI 模型。该模型现已开始在 GitHub Copilot 中推出,首先在 VS Code 中可用。 这扩大了微软的 AI 模型组合,提供了一个针对轻量级工作流程的快速、高效编码助手,可能改变开发者的生产力。与 GitHub Copilot 的集成直接影响数百万开发者,为现有代码生成工具提供了新的替代方案。 MAI-Code-1-Flash 是一个小型模型,能够端到端地规划和推理复杂编码任务,在早期测试中优于其他小型模型。它由微软使用清洁且适当许可的数据构建,旨在为日常开发工作流程提供快速高效的辅助。rss · HN Frontpage · 6月2日 18:47
背景: 像 GPT-4 和 Codex 这样的代码生成模型已被用于通过自然语言提示生成代码来辅助开发者。微软一直在开发自己的 MAI 系列,包括像 MAI-Thinking-1 这样的推理模型和像 MAI-Voice-1 这样的语音模型。MAI-Code-1-Flash 专为轻量级任务和与 GitHub Copilot(一个流行的 AI 结对编程工具)的集成而优化。
参考链接
社区讨论: Hacker News 上的讨论有 207 条评论和 466 分,反映了社区强烈的兴趣和认可。开发者们对该模型与现有选项相比的性能表示好奇,并讨论了其对编码工作流程的潜在影响。一些评论提出了关于许可和数据透明度的担忧。
Dashlane 遭黑客暴力破解 2FA 窃取密码库
Dashlane 报告称,攻击者暴力破解了其双因素认证系统,访问了不到 20 个客户账户并下载了其加密密码保险库。 此次泄密削弱了对密码管理器的信任,并表明即使双因素认证如果验证码长度或速率限制不足,也可能遭受暴力破解攻击。 攻击针对 Dashlane 的设备注册流程,通过暴力破解短 2FA 代码在现有账户上注册新设备。下载的保险库已加密,但公司警告用户更改主密码。rss · TechCrunch · 6月2日 15:40
背景: 双因素认证(2FA)在密码之外增加了额外安全层,通常需要来自验证器应用或短信的一次性代码。暴力破解 2FA 涉及系统地尝试所有可能的代码直到找到正确的,如果代码较短(例如 6 位数字)且没有速率限制或锁定,这种攻击是可能的。在 Dashlane 案例中,攻击者利用了设备注册 2FA 流程中的弱点。
参考链接
VSCode 漏洞实现一键窃取 GitHub 令牌
VSCode(1.71 及更早版本)中存在一个漏洞,攻击者通过将命令 URI 嵌入恶意笔记本,在文档被信任时触发任意命令,从而一键窃取 GitHub 令牌。 此漏洞极其危险,因为数百万开发者使用 VSCode 并通过 GitHub 集成进行源代码管理;被盗的令牌可能导致帐户接管、代码窃取及供应链攻击。 该漏洞利用了 VSCode 的'command:' URI 方案,当文档的'isTrusted'标志为真时可执行任意命令。此漏洞与 CVE-2022-41034 相关,影响 VSCode 1.71 及更早版本。rss · HN Frontpage · 6月2日 15:29
背景: VSCode 支持包含可点击链接的富内容(如笔记本)。命令 URI 本应用于可信上下文以执行受限操作,但信任模型的一个漏洞允许恶意笔记本错误地设置'isTrusted'。VSCode 中用于认证的 GitHub 令牌可能被精心构造的命令提取。
参考链接
Pluto.jl 1.0 发布:Julia 响应式笔记本
Pluto.jl 是一个面向 Julia 的响应式笔记本环境,现已发布 1.0 版本,标志着该项目的一个重要里程碑,为交互式计算提供了更完善的工具。 此版本使 Pluto.jl 趋于稳定,成为科学家、教育工作者以及依赖响应式笔记本进行可重复研究和交互式探索的 Julia 开发者的生产级选择。 Pluto.jl 1.0 改进了性能、错误处理和包管理,并重新设计了用户界面,增强了对外部编辑器和版本控制的支持。rss · HN Frontpage · 6月2日 23:09
背景: Pluto.jl 是 Julia 编程语言的响应式笔记本环境,类似于 Jupyter,但具有响应性:当你修改一个单元格时,所有依赖的单元格会自动更新。该项目已经开发了数年,其预发布版本广泛应用于教育和研究领域。
参考链接
在 Linux 上将 NVIDIA GPU 显存用作交换空间
一款名为 nbd-vram 的新开源工具通过网络块设备(NBD)协议,允许在 Linux 上将 NVIDIA GPU 显存用作交换空间。 这为内存焊死在主板上的笔记本电脑提供了一种扩展系统内存的新方法,通过利用未使用的 GPU 显存,可能在内存紧张时提升性能。 该工具利用 Linux 的 NBD 驱动将一部分显存呈现为块设备,随后可用作交换空间。它专为使用专有驱动的 NVIDIA GPU 设计,无需内核模块。rss · HN Frontpage · 6月2日 22:55
背景: 交换空间是存储设备上的一块区域,当 RAM 满时用作虚拟内存。显存(VRAM)是 GPU 上专用于图形任务的内存,但可能未被充分利用。网络块设备(NBD)是一种 Linux 协议,允许远程存储作为本地块设备出现;在此它被本地用于暴露显存。
参考链接
- GitHub - c0deJedi/nbd-vram: Use your NVIDIA GPU's VRAM as swap space on Linux. Built for laptops with soldered memory and no upgrade path. If you have an RTX card sitting there with 8GB of VRAM and you're getting swapped to SSD, this puts that VRAM to work · GitHub
- NBD-VRAM Provides Swap Space On Your NVIDIA GeForce GPUs - Phoronix
社区讨论: Hacker News 社区表现出浓厚兴趣,获得 298 分和 82 条评论,讨论了将显存用作交换空间的实用性和风险,例如可能导致 GPU 不稳定和显存损耗。
CT 扫描揭示比亚迪工程选择
Lumafield 发布了比亚迪汽车零部件的工业 CT 扫描图像,前所未有地揭示了这家中国电动汽车制造商的内部设计和制造决策。 这些扫描让外界罕见地深入了解比亚迪的工程方案,使工程师和爱好者能够分析成本、性能及装配方面的权衡,并可能影响汽车拆解分析的标准。 这些扫描使用了 Lumafield 的工业 CT 扫描仪,能够在不物理拆解零件的情况下,对内部几何结构、材料分布和装配方法进行无损 3D 检查。rss · HN Frontpage · 6月2日 20:30
背景: 工业 CT 扫描是一种无损检测技术,利用 X 射线生成物体内部结构的详细 3D 图像,常用于汽车和航空航天领域质量检测。Lumafield 提供低成本的工业 CT 扫描仪和基于云的分析软件,使该技术更易用于拆解分析和逆向工程。此次扫描系列是 Lumafield“月度扫描”项目的一部分,该项目通过分析消费产品来揭示工程洞察。
微软 ASSERT:用文本描述生成 AI 行为测试
微软发布了 ASSERT,这是一个开源框架,可以将 AI 行为的自然语言描述转换为评分测试。 它简化了 AI 回归测试和行为验证,可能加速 AI 开发并减少手动测试创建。 ASSERT 代表自适应规范驱动的评估与回归测试评分,它利用 AI 从高层次目标生成全面测试。rss · TechCrunch · 6月2日 19:02
背景: AI 评估通常需要手工编写测试用例。微软的 ASSERT 框架旨在通过利用 AI 解释规范来自动化这一过程。
参考链接
数学家警告 AI 威胁职业,继 OpenAI 突破之后
一群数学家发布声明,警告 AI 对数学职业构成严重威胁,此前 OpenAI 宣布其通用推理模型否定了存在 80 年之久的 Erdős–Hajnal 猜想。 这是通用 AI 首次独立推进一个重要的开放数学问题,引发了关于人类数学家在研究中的角色及伦理与职业问题的担忧。 该证明由剑桥数学家 Timothy Gowers 确认为达到顶级期刊标准,普林斯顿的 Will Sawin 对该结果进行了精化。OpenAI 的模型是通用推理系统,而非专门针对数学的。rss · Ars Technica · 6月2日 18:19
背景: Erdős–Hajnal 猜想由 Paul Erdős 和 András Hajnal 于 1977 年提出,是组合数学中的一个核心问题。OpenAI 的模型是一个为通用推理训练的大型语言模型,成功否定了该猜想。这一成就引发了关于 AI 能力及其对数学界影响的讨论。