2026-07-09
31 篇热帖
2. Grok 4.5 (x.ai)
Grok 4.5 模型总结
核心发布
SpaceXAI 于今日发布其迄今为止最智能的模型 Grok 4.5。该模型专精于编程、智能体任务及知识工作,是在与 Cursor 合作下训练而成的。
训练与技术特点
- 训练基础设施:在数万个 NVIDIA GB300 GPU 上进行大规模训练,并针对大规模运行优化了稳定性技术。
- 数据工程:重点投资于数据过滤与策划,包括去重、质量评分和领域聚焦筛选,以确保数据混合物的高覆盖率和高信息量。
- 强化学习:大规模强化学习,专注于逐 token 的智能。训练涵盖数十万项任务,核心是多步骤软件工程及其他技术工作,并采用自动化和基于模型的评估。其训练栈支持高度异步的智能体执行(可持续运行数小时),从而在实际工程和智能体任务上实现更智能、高效的推理。
核心能力与优势
- 卓越的工程性能:在编码、科学、工程和数学等知识数据集上训练,在多项基准测试中表现优异。例如:
- DeepSWE 1.0 评分:62.0% (pass@1)
- SWE Marathon 解决率:29.0% (pass@1)
- Terminal Bench 2.1:83.3%
- SWE Bench Pro 解决率:64.7% (对比模型如 Fable、GPT 5.5、Opus 4.8 等的具体分数见原文图表)
- 极高的编码能力:从复杂的 Rust/C/C++ 任务到从提示到生产的端到端应用构建均表现出色。能够仅凭一个提示,创建出设计精良、功能完备的应用程序。
- 效率与速度:
- 服务速度:以快速模型速度 80 TPS 运行。
- Token 效率:在同等任务下,其 Token 效率比其他领先模型高出一倍以上,解决任务所需的平均输出 Token 数量显著更少(例如,在 SWE Bench Pro 任务中平均使用约 15,954 个输出 Token,而 Opus 4.8 (max) 约需 67,020 个,效率提升约 4.2 倍)。
- 办公工作能力:现为 Grok Build 中的默认模型。除编程外,还能胜任复杂办公任务,例如:
- 构建涉及网络研究、多表公式运用的复杂 Excel 模型。
- 使用 PowerPoint 原生形状构建复杂图表,设计直观的幻灯片内容。
- 在 Word 中撰写清晰的文档。
- 定价:极具竞争力,每百万输入 Token 2 美元,每百万输出 Token 6 美元。结合其 Token 效率,整体实现了单位时间和成本下的最高智能产出。
可用性
- 立即可用:现已在 Grok Build(提供限时免费使用)、Cursor(所有计划)及 SpaceXAI 控制台 上提供。
- 集成方式:可通过获取 API 密钥,并参考 API 文档,快速将其集成到现有技术栈中。
3. TypeScript 7 (devblogs.microsoft.com)
TypeScript 7 发布总结
TypeScript 7 是一个里程碑式的版本,它通过将整个工具链用 Go 语言进行原生移植,实现了约 10 倍 的性能提升。此版本旨在充分利用现代硬件的多核能力,并在编辑器支持、构建速度和内存使用方面带来全面改进。
核心优势与性能表现
- 极致的速度提升:在多个大型开源项目(如 VS Code、Sentry)的测试中,TypeScript 7 的全量构建速度提升了 7.7倍至11.9倍。
- 内存使用优化:构建过程中的聚合内存占用普遍降低,最高可减少 26%。
- 编辑器体验飞跃:在 VS Code 中打开包含错误的文件,从打开编辑器到显示第一个错误的时间从约17.5秒缩短至1.3秒以下,提升超过 13倍。
- 并行处理:解析、类型检查和代码生成等步骤现在默认并行执行。引入了
--checkers和--builders标志来精细控制并行度,以及--singleThreaded标志用于调试或资源受限环境。
安装与编辑器支持
- 安装:通过
npm install -D typescript即可安装。 - 编辑器兼容性:基于语言服务器协议(LSP)构建,可与 VS Code、Visual Studio、WebStorm 等主流编辑器良好协作。VS Code 提供专用扩展,Visual Studio 会根据工作区自动启用。
与 TypeScript 6 并行运行(兼容性方案)
由于 TypeScript 7 初期不提供稳定的 API,为方便需要编程访问编译器(如 typescript-eslint)的工具,官方提供了并行运行方案:
- 安装兼容包:
npm install -D typescript@npm:@typescript/typescript6,这会提供tsc6可执行文件。 - 同时使用两个版本:通过别名同时安装 TypeScript 7 和 6 的兼容包,例如在
package.json中配置,使得tsc命令对应 v7,而其他工具可通过 v6 的 API 工作。
重要新特性与行为变更
- 改进的
--watch模式:基于移植自 Parcel 的@parcel/watcher重建,提供更高效、稳定的跨平台文件监听。 - JavaScript 支持重构:对
.js文件的类型分析更严格,更贴近 TypeScript 文件的分析方式。移除了多项对 JSDoc 和闭包风格的支持,如@enum、独立的?类型、闭包风格的函数语法等。 - 模板字面量类型中的 Unicode 处理:现在将 Unicode 码点(如表情符号 😀)视为一个整体,而非按 UTF-16 代码单元拆分。这是一个对类型级字符串操作的破坏性变更。
- 采纳 TypeScript 6.0 的新默认值:包括
strict: true、module: esnext、stableTypeOrdering: true等。 - 多项已弃用配置变为硬错误:例如不再支持
target: es5、downlevelIteration、moduleResolution: node、module: amd/umd等。
生产就绪性与生态反馈
TypeScript 7 经过了大规模的测试和验证:
- 广泛的实际代码库测试:与微软内部团队(Loop, Office, Teams 等)以及 Slack、Sentry、Canva、Google 等众多公司合作,在真实项目中进行了测试。
- 显著的效率提升案例:
- Slack 团队:合并队列时间减少 40%,CI 类型检查时间从7.5分钟降至1.25分钟。
- 微软 News Services 团队:每月节省 400 小时的 CI 构建等待时间。
- 稳定性提升:新的语言服务器相比 TypeScript 6.0,失败的命令减少超过 80%,服务器崩溃减少超过 60%。
当前局限与未来计划
- 嵌入式语言支持:目前不支持 Vue、MDX、Svelte 等框架中的类型检查,因为它们依赖 TypeScript 的编程 API。团队正在积极与这些项目维护者合作解决。
- 夜间构建:即将恢复在标准的
typescript包(通过next标签)中提供。 - 未来版本:TypeScript 7.1 预计将发布新的 API。团队将回归新功能开发、人体工程学改进和进一步的性能优化,发布节奏预计保持每 3-4 个月一次。
4. John Deere owners will get the right to repair equipment under FTC settlement (apnews.com)
美国联邦贸易委员会(FTC)与多个州检察长于2025年与农业设备制造商迪尔公司(John Deere)达成维修权和解,结束了长期的反垄断诉讼。此前,迪尔公司被指控通过控制专有诊断和维修软件,限制农场主和独立维修店自行维修设备,迫使消费者依赖授权经销商。
和解主要内容:
- 迪尔公司必须向设备所有者和独立维修店提供完整的诊断与维修工具,不再仅限授权经销商使用。
- 禁止迪尔经销商对选择自主维修的用户或独立维修店进行报复。
- 迪尔需向五个涉诉州支付总计100万美元的反垄断执法费用,并接受长达10年的严格合规监督。
背景与意义:
- 这是迪尔公司今年第二起维修权相关和解,此前已与农民达成9900万美元的集体诉讼赔偿。
- FTC指出迪尔长期垄断维修工具,增加了农户维修成本和时间;迪尔则否认指控,称其从未垄断维修服务。
- 此次和解被视为“维修权”运动的重要进展,有望影响科技产品等领域的类似争议。
迪尔公司副总裁表示,该协议体现了公司支持更灵活维修选择的承诺,并对客户有益。
5. My Thoughts on the Bun Rust Rewrite (andrewkelley.me)
《我对 Bun 用 Rust 重写的看法》一文总结
本文作者(疑似 Zig 语言核心成员)回顾了 JavaScript 运行时/工具链 Bun 项目的历史,阐述了 Bun 从 Zig 切换到 Rust 重写的原因、过程,并针对 Bun 官方关于重写的博客文章提出了技术性批评,最后进行了个人反思。
核心背景与关系演变
- 早期:Bun 创始人 Jarred 最初投身 Zig 社区,被描述为具有“初学者能量”,快速试错学习。Bun 项目因其潜力获得关注,并获得了风险投资,转向商业化。
- 积极互动:Jarred 曾公开感谢 Zig,向 Zig 软件基金会(ZSF)进行高额年度捐赠(6万美元/年),并在早期承认 Zig 对 Bun 性能的贡献。
- 关系破裂原因:
- 管理与文化问题:作者引述多方信息,批评 Jarred 管理风格糟糕(沟通差、期望不切实际、缺乏经验),导致优秀人才远离 Oven(Bun 背后的公司)。
- 代码质量担忧:Zig 团队审查 Bun 代码后,认为其代码库存在“代码混乱”、“滥用断言”、“忽视技术债务”等严重问题,这与 Zig 语言倡导的可靠性、安全性价值观相悖。
- 目标分歧:Jarred 专注于快速产出和退出策略,与 Zig 项目的长期愿景(如开发语言服务器协议)产生冲突。Bun 项目日益被视为 Zig 生态的“负资产”。
- 收购影响:Bun 被 Anthropic(一家大型 AI 公司)收购后,其与 Zig 的间接关联引入了低质量的代码贡献和不适配的社区成员,给 Zig 社区带来困扰。
对 Rust 重写及官方博文的评价
- 对重写的总体态度:当 Bun 宣布用 Rust 重写时,ZSF 方面感到“如释重负”并支持此决定,认为这解决了上述“问题”。
- 对官方博文中技术论点的反驳:
- 减少 bug 的方式:作者指出,博文暗示只能通过“风格指南”或语言特性避免 bug,但关键在于投入工程资源去发现和消除 bug(以 TigerBeetle 项目为例)。
- 测试套件的有效性:博文声称良好的测试套件足以保证质量,但作者质疑:为何它能处理重写后百万行未审核代码的 bug,却无法解决此前 Zig 代码中的问题?
- 性能提升归因:Bun 将性能提升归因于链接时优化(LTO),但作者指出 Zig 一直支持 LTO,且曾因其与 LLVM 相关的 bug 而默认关闭。Zig 方面曾建议启用,但 Bun 未听取。
- 模糊测试:博文暗示曾对 Zig 代码进行模糊测试,但作者称在之前的沟通中 Bun 团队承认并未进行。
- 二进制大小优化:博文详述了为减少二进制体积所做的工程工作,作者认为这些本应在 Zig 代码时代就完成,是“补做功课”,并批评了 Bun 长期存在的
comptime滥用问题。 - 编译速度:作者指出博文中未提及重写后的编译速度,并对比了 Zig 编译器项目的编译性能数据。
作者的个人反思与结论
- 根本分歧:重写的核心原因并非语言特性优劣,而是双方价值观、项目方向的根本分歧以及关系破裂。
- 对 Jarred 的复杂情感:作者承认对 Jarred 使 Bun 成为 Zig 的“尴尬”感到怨恨,并批评其领导力,但也理解并同情他选择了不同的成功路径(实现生产力幻想、获得财富和名声)。
- 对博文性质的自我修正:作者最初将博文定义为陈述一段失败的合作关系,但反思后承认文中带有未处理的怨恨情绪,将博文定性为“个人攻击”是合理的。他也考虑不周,未想到这可能会让普通 Zig 用户担心自己也会遭到类似对待。
- 道歉与未来方向:作者为给部分 Zig 用户带来的担忧道歉,并表示将把博客重心转向展示 Zig 社区的积极协作与酷炫成果。
6. EU now one step away from reviving private message scanning rules (cyberinsider.com)
欧洲议会已批准一项紧急程序,以快速推进立法,旨在恢复欧盟已过期的"聊天控制1.0"规则。
此举为7月9日就"在线平台是否可以重新被允许自愿扫描用户私人通信以查找儿童性虐待材料"举行决定性投票铺平了道路。
议员们以331票赞成、304票反对通过了使用紧急程序的投票,使得议会能够绕过常规的委员会审议阶段。该程序性投票本身并未恢复法律,但加速了一项提案的审议,该提案实际上将恢复于4月份到期的临时法律框架。
需注意的是,此项立法与欧盟长期谈判的《儿童性虐待法规》提案(通常称为"聊天控制2.0")是分开的。两个不同立法文件的同时存在导致了混淆:一个涉及恢复一项已过期的临时措施,另一个则旨在建立检测和报告CSAM的永久性框架。
临时法规(正式名称为第2021/1232号法规)最初在《隐私电子指令》中创建了一项豁免,允许服务提供商自愿扫描私人通信以查找CSAM。该豁免主要适用于Gmail、Facebook Messenger、Instagram Messenger等服务,而端到端加密服务通常不受影响,除非提供商选择实施客户端扫描。
欧洲议会曾在3月份投票拒绝延长该临时豁免。该法规随后于2026年4月4日到期,移除了许多平台在《隐私电子指令》范围内进行自愿扫描所依赖的法律依据。
然而,此后欧盟理事会一直试图通过一项实质上包含相同条款的新法规来恢复该措施。反对者称此举为前所未有的尝试,旨在复活议会已拒绝的立法。
具有约束力的投票定于7月9日(星期四)进行。根据程序,反对者需要欧洲议会所有议员的绝对多数(361票)才能拒绝或修正该提案。若未达到该门槛,理事会的文本预计将在议会不施加额外保障措施的情况下获得通过。
此项复活的提案不应与"聊天控制2.0"混淆。后者是永久性《儿童性虐待法规》,自2022年以来一直处于谈判中,并在议会、理事会和欧盟委员会之间进行了五轮三方谈判后陷入僵局。
主要分歧在于:是否应允许或要求服务提供商对私人通信(尤其是在端到端加密服务上)进行广泛的无嫌疑扫描。议会的谈判立场将扫描范围限制在被具体怀疑涉及儿童性虐待的用户或群体,并需要司法授权;而理事会则继续倡导更广泛的风险缓解义务和自愿检测措施,批评者认为这仍会鼓励大规模扫描。
据报道,理事会自身的法律服务部门曾在6月警告,除非有合理怀疑和事先司法授权支持,否则即使是"自愿"的广泛通信扫描也可能违反《欧盟基本权利宪章》第7条。
因此,欧盟目前正推进两条并行的立法轨道:一条寻求临时恢复已过期的自愿扫描制度;另一条则继续就可能重塑欧盟全境在线平台检测CSAM方式的永久性法律进行谈判。
星期四的议会投票将决定是否在就更具争议性的永久性法规进行谈判的同时,恢复临时框架。
7. EU Parliament greenlights Chat Control 1.0 – Breyer: "Our children lose out" (www.patrick-breyer.de)
欧洲议会通过“聊天控制1.0”:多数议员反对但未达法定门槛
2024年,欧洲议会放行了允许对私人通讯进行无差别大规模扫描的临时法规(“聊天控制1.0”),该法规此前已于三月两次被否决。尽管投票的议员中多数实际反对(314票反对,276票赞成,17票弃权),但要求否决该法规的动议未能获得所需的361票绝对多数,导致该措施重新生效,有效期至2028年。
法规核心内容与变化
- 重新允许的内容:美国科技公司(如Meta、谷歌、苹果等)在无需搜查令或事先怀疑的情况下,可再次扫描通过其平台(如Instagram、Discord、Snapchat、Gmail等)发送的私人消息和电子邮件。
- 保持不变的内容:公共社交媒体的帖子以及云存储中的文件原本就可被扫描;用户举报和基于法院令的针对性监听也始终存在。
- 仍未被扫描的内容:端到端加密通讯(如WhatsApp)历来被豁免;欧洲本土的通讯和电子邮件服务商从未实施过聊天控制措施。
反对意见与主要论据
以公民权利活动家、前欧洲议会议员帕特里克·布雷耶为代表的人士强烈反对此项政策,认为其无效且危害民主:
- 程序正当性问题:政策在多数投票议员反对的情况下通过,被批评为损害民主。
- 实际效果存疑:多项数据表明该措施效果不佳:
- 自2022年以来,由于加密通讯的普及,美国发出的疑似虐童报告已减少50%。
- 2024年,仅36%的虐童报告来自私人聊天扫描,多数来自公共平台和云存储。
- 德国联邦刑事警察局称48%的警报不具刑事相关性。
- 约40%的后续调查针对的是未成年人自身。
- Meta产生的报告中,估计99%是已知材料,对阻止现行虐待帮助甚微。
- 欧盟委员会承认,无差别扫描私人通讯并未带来定罪率或获救儿童数量的增加。
- 对儿童保护的副作用:批评者认为,该政策分散了资源,延误了采取更有效措施的时间,并可能破坏受害者需要的隐私安全空间。
- 反对者的替代方案:他们主张应转向针对性的法院命令,针对犯罪嫌疑人,并建议设立欧盟儿童保护中心系统性地清除已知虐童材料,以及推行“设计安全”的通讯应用。
支持者立场与未来谈判
支持者认为该法规是防止“保护漏洞”的必要工具。欧盟理事会(代表成员国政府)倾向于维持现有的自愿、无差别扫描模式。
未来走向:临时法规将持续有效至2028年或永久性法规达成协议为止。关于永久性法规(“聊天控制2.0”)的谈判将于9月恢复。核心分歧依然在于:私人聊天的扫描应该是无差别的,还是仅限于针对犯罪嫌疑人的针对性措施。
布雷耶认为,临时法规的延续减轻了谈判压力,可能导致永久性解决方案被拖延。他总结道:“只要欧盟政府能通过程序漏洞持续延长其舒适的无差别扫描现状,他们就没有任何动力去采纳议会提出的有针对性、合法且更有效的儿童保护策略。”
性侵幸存者的声音:文中引用了几位性侵幸存者的证词,他们强调隐私对于受害者寻求正义至关重要,并指出无差别的聊天控制并未帮助受害者,真正的保护应从源头删除材料、加强网络巡逻和确保应用程序设计安全入手。
8. Rewriting Bun in Rust (bun.com)
Bun 团队为解决其 Zig 代码库中频发的内存安全问题(如 use-after-free、内存泄漏和双重释放),决定使用 Rust 进行全面重写。此次重写耗时 11 天,主要借助 AI 工具 Claude Code 完成,显著提升了稳定性、性能和二进制体积。
背景与动机
- 起源:Bun 最初是将 esbuild 从 Go 逐行移植到 Zig 的产物,后发展为涵盖转译器、包管理器、测试运行器等多功能的 JavaScript 运行时。
- 问题:Zig 的手动内存管理在与 JavaScript 垃圾回收器交互时,导致大量内存安全漏洞,尽管已采用地址消毒器、模糊测试等措施,但仍难以根除。
- 选择 Rust:Rust 的所有权系统和借用检查器能在编译时防止 use-after-free 等问题,自动内存管理(Drop)可减少泄漏,且与现有 C/C++ 库(如 JavaScriptCore)有良好互操作性。
重写过程
- 方法:采用“一次性全面移植”而非渐进式重写,以保持架构和行为一致,便于后续重构。
- AI 辅助:使用预发布版 Claude Fable 5 生成代码,通过 Claude Code 的动态工作流协调约 64 个并行实例。
- 质量控制:
- 前期准备:与 AI 对话生成详细的移植指南(PORTING.md)和生命周期映射(LIFETIMES.tsv)。
- 对抗性审查:每个代码变更由两个独立的 Claude 实例审查,专注于寻找潜在错误。
- 测试驱动:沿用原有的百万级 TypeScript 测试套件验证功能正确性,直至所有平台 CI 测试全部通过。
- 统计:11 天内完成约 6,500 次提交,峰值时每分钟处理 1,300 行代码,消耗约 16.5 万美元 API 成本。
成果与收益
- 稳定性提升:修复了 128 个在 v1.3.14 中可复现的 bug,包括内存泄漏和崩溃。引入的安全工具(如 Miri、LeakSanitizer)将有助于持续改进。
- 内存泄漏减少:例如
Bun.build()的内存泄漏从每次约 3MB 降至可忽略水平,解决了长时间运行场景的内存耗尽问题。 - 性能优化:HTTP 吞吐量提升 2-5%,CLI 任务(如
next build)加速约 4.5%。归因于 Rust 的链接时优化(LTO)和更高效的代码生成。 - 二进制体积缩小:Linux/Windows 版本体积减少约 20%,主要得益于移除 Zig 中冗余的编译时代码(comptime)和后续的链接器优化。
- 栈空间优化:递归下降解析器(如 TOML、JSON)使用更少的栈空间,避免了深层嵌套导致的崩溃。
挑战与回归
- 语言差异:例如 Rust 的
debug_assert!在发布模式下不执行参数,导致热重载功能失效;Rust 的切片边界检查比 Zig 的 ReleaseFast 模式更严格。 - 已知回归:引入了 19 个回归问题(均已修复),主要源于语法相似但语义不同的代码(如颜色标记处理)。
后续工作
- 安全审计:已完成 11 轮安全审查,并部署了 24/7 覆盖率引导的模糊测试,自动为发现的漏洞提交 PR。
- 代码质量:当前约 4% 的代码包含
unsafe块(主要为了与 C/C++ 互操作),计划通过重构进一步减少。 - 发布计划:Bun v1.4.0 将是首个基于 Rust 的正式版本,已在 canary 频道可用。
此次重写证明了借助先进 AI 工具,大型系统的语言迁移可以在保证质量和功能的前提下高效完成,显著提升软件的基础可靠性。
9. Show HN: 18 Words (18words.com)
文章标题: Show HN: 18 Words
摘要内容: 本文是作者在Hacker News(HN)上展示名为“18 Words”的游戏的帖子。主要内容包括:感谢玩家的参与,邀请玩家提供反馈,并推广其另一款游戏Zanagrams,提供了相关链接。帖子结构简洁,以感谢和互动为主,旨在吸引玩家注意并促进用户反馈和游戏体验扩展。
10. FAANG Simulator (www.abeyk.com)
FAANG模拟器
这是一个模拟在大型科技公司(FAANG)职业生涯的互动游戏。其核心设定为“一次点击代表人生一个季度”,玩家通过快速决策推进虚拟职业生涯。
核心玩法与功能
- 进度机制:玩家每次点击(或操作)会推进游戏内时间的一个季度。游戏以“每日挑战”形式运行,所有玩家在同一天面对相同的角色“时间线”,结束后可比较各自的“逃脱”(职业结局)成果。
- 角色状态面板:游戏界面展示了关键状态指标,包括:
- 年龄与时间:起始为22岁1季度。
- 自由度:以“辞职永久基金”的积累百分比体现,当前为0%。
- 绩效:衡量工作表现,初始值为50。
- 牵引力:可能指项目影响力或职业上升动力,初始为0。
- 倦怠值:反映身心疲劳程度,初始为10。
- 净资产:起始为0美元。
- 年薪:起始为19万美元。
- 结局与社交:游戏包含“退出面试”环节(对应HR表格),并设有社交媒体分享功能,允许玩家将成绩发布到“𝕏”平台。
总体定位
该游戏以讽刺和夸张的方式,模拟在高压科技巨头公司工作的生命周期与职业抉择。它并非与任何真实公司关联。
11. Cloudflare Drop (www.cloudflare.com)
Cloudflare Drop 概要
Cloudflare Drop 是一项允许用户快速将静态网站部署到 Cloudflare 全球网络的服务,无需预先拥有账户即可开始。
核心工作流程
- 上传文件:用户拖放一个包含静态站点文件(如 HTML、CSS、JS)的文件夹或
.zip文件。 - 自动部署:文件上传后,Cloudflare 会将其分发到其全球网络。
- 获取链接:用户会获得一个临时的
workers.dev实时访问 URL。 - 认领保留:用户需要在 60 分钟内 通过提供的认领 URL 来保持对该部署的所有权,否则链接将失效。
使用指南与注意事项
- 适用场景:主要适用于通过浏览器自动化操作的场景,需要准备完整的静态站点文件。
- 本地开发与 CLI 工作流:对于本地项目,官方更推荐使用 Wrangler CLI 工具进行部署。
- Wrangler 部署命令:
- 可以使用
npx或npm exec直接运行,例如:npm exec --yes wrangler@latest -- deploy ./dist --name my-static-site --temporary --compatibility-date <YYYY-MM-DD>。 - 关键参数:
./dist:替换为包含最终静态文件的目录。--name:必须指定 Worker 的名称。--compatibility-date:使用部署当天的日期(格式为YYYY-MM-DD)。--temporary:用于创建临时账户进行部署。
- 部署目录要求:目录中必须包含
index.html文件。 - 常见问题处理:
- 若首次部署因缺少名称失败,添加
--name重试。 - 若因缺少
compatibility_date失败,添加--compatibility-date参数重试。 - 部署后若访问实时 URL 返回 404,应稍等片刻后重试,因为资源分发可能需要时间。
- 若首次部署因缺少名称失败,添加
- 可以使用
- 返回结果:部署成功后,必须返回两个链接:
- 实时
workers.devURL(供访问)。 - 认领 URL(用于获取所有权,60 分钟后过期,应视为敏感信息)。
- 实时
- 认证环境:如果 Wrangler 已通过 OAuth、API 令牌或全局 API 密钥进行了身份验证,则不应使用
--temporary标志,而应直接使用wrangler deploy进行常规部署。
12. Why developers are ditching GitHub for Codeberg and self-hosting alternatives (www.howtogeek.com)
开发者离开GitHub转向Codeberg及自托管替代方案的趋势
尽管GitHub在用户规模和提交数量上仍保持增长(每秒新增一位用户,托管超过6亿个仓库),但部分知名项目和开发者已开始转向其他平台,这一趋势可能预示着更广泛的迁移。
重点项目迁移案例
- Ghostty(跨平台终端模拟器):其维护者Mitchell Hashimoto于2026年4月宣布将离开GitHub,计划逐步移除依赖,并在GitHub保留只读镜像。
- Zig(系统编程语言):于2025年11月宣布离开GitHub,自2015年首次提交以来长期托管于该平台。
- Tenacity(跨平台音频编辑器):于2023年迁移,仅在GitHub维持镜像。
- 其他项目如Dillo网页浏览器和Hare编程语言也已迁移。一些项目如GNOME和Apache从未使用GitHub,而是选择自托管。
迁移的主要原因
- 技术稳定性:GitHub频繁出现服务中断。据IncidentHub统计,2025年5月至2026年5月期间,GitHub共发生48次重大中断,累计宕机时间达112小时。此问题是驱动Ghostty和Zig迁移的关键因素。
- 政治立场:Zig的创建者Andrew Kelley提及了GitHub与美国移民海关执法局(ICE)的关系。该公司早前与该机构的20万美元合作协议曾受到员工批评。
- 人工智能(AI)整合:GitHub深度集成Copilot等AI功能。其CEO在2025年强调“要么拥抱AI,要么退出该行业”的立场,这引发了争议。
- 开发体验:Mitchell Hashimoto总结道,GitHub已不再是能让人愉快高效工作的地方,阻碍了软件发布。
此外,如GNU项目等从未使用GitHub的群体,因其坚持使用自由软件原则,并认为GitHub鼓励了不良的许可证实践。
流行的替代方案
开发者和项目正转向多种替代平台:
- Codeberg:由德国非营利组织运营,基于Gitea软件,功能与GitHub相似(问题跟踪、静态页面托管、CI/CD),因其注重隐私和道德实践而日益流行,是Zig等项目选择的目的地。
- GitLab:提供强大的自托管选项,集成了完整的DevOps生命周期。
- Bitbucket:作为GitHub的主要竞争者之一,深受Atlassian生态用户欢迎。
- Sourcehut:完全开源,强调基于电子邮件的工作流。
- 自托管方案:许多开发者选择自行托管Git服务,常用软件包括Gitea和Forgejo(Codeberg底层软件)。
- 运动倡议:例如Software Freedom Conservancy发起了“放弃GitHub”运动,提供资源帮助用户迁移。
结论
GitHub极大地推动了开源开发与协作,但其在技术可靠性、政策方向及AI战略上引发的担忧,正促使开发者寻求替代方案。从Codeberg等托管平台到各类自托管选项,可行的选择正在增长,开发者拥有更多自主权。
13. Bonnie Tyler, singer of Total Eclipse of the Heart, dies aged 75 (www.bbc.com)
威尔士传奇歌手邦妮·泰勒(Bonnie Tyler)于2026年7月去世,享年75岁。她因今年早些时候在葡萄牙接受紧急肠道手术后出现并发症而逝世。
生平与职业生涯
- 早年经历:邦妮·泰勒本名盖诺尔·霍普金斯,出生于斯旺西的一个市政住宅区,自幼热爱音乐。1970年代在俱乐部演出时被星探罗杰·贝尔发掘。
- 艺名由来:签约唱片公司时,她从报纸上组合出“邦妮·泰勒”作为艺名。
- 音乐成就:她以独特沙哑的嗓音闻名,被誉为“女版罗德·斯图尔特”。1976年发行的《Lost in France》是她首支进入英国榜前十的单曲。
- 代表作巅峰:1983年,由吉姆·斯坦曼创作的《Total Eclipse of the Heart》成为其职业生涯的代表作。该曲原长达八分钟,缩编至四分钟的电台版风靡全球,登上英国和美国排行榜首位。泰勒也因此成为首位也是唯一一位在美国获得冠军单曲的威尔士艺人。
- 其他热门歌曲:她的其他知名作品包括《Holding out for a Hero》、《It's A Heartache》等。
- 职业生涯长度:其歌唱生涯跨越50年。她曾三次获得格莱美奖提名,并于2013年代表英国参加欧洲歌唱大赛。
个人生活与遗产
- 性格转变:泰勒自述童年时非常害羞,通过热爱歌唱克服了这一点。
- 家庭生活:她与丈夫罗伯特·沙利文定居于葡萄牙和斯旺西,在全球拥有多处房产,但两人没有子女。
- 晚年活动:她于2023年出版了自传《Straight from the Heart》,并持续活跃于乐坛,去世前发行了新单曲《Yes I Can》。
- 身后评价:邦妮·泰勒以其标志性嗓音和众多经典作品闻名,尤其是《Total Eclipse of the Heart》的MV在YouTube上的观看次数已超过13亿次。她被视为一位从威尔士走出的国际巨星,其音乐影响了数代人。
14. SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence (cognition.com)
SWE-1.7 模型概述与关键技术总结
SWE-1.7 是 Cognition 公司目前最强的模型,旨在以更低的成本达到前沿智能水平,优化了成本性能帕累托曲线。该模型基于 Kimi K2.7 代码基础模型进行深度强化学习(RL)后训练,其显著的性能提升挑战了“后训练存在上限”的传统观点,表明 RL 能进一步拓展模型能力。
性能基准对比
SWE-1.7 在多个智能体编码基准测试中表现出色:
- FrontierCode 1.1 Main:通过率 42.3%,接近 GPT-5.5(43.0%),低于 Opus 4.8(46.5%),但显著高于 Kimi K2.7 Code(30.1%)和 SWE-1.6(9.4%)。
- Terminal-Bench 2.1:通过率 81.5%,低于 Opus 4.8(86.9%)和 GPT-5.5(84.2%),但优于大部分其他模型。
- SWE-Bench Multilingual:通过率 77.8%,低于 Opus 4.8(84.4%)和 GPT-5.5(76.8%),但高于基础模型和 SWE-1.6。 该模型针对长周期异步任务进行了优化,这是高质量软件工程的重要组成部分。
训练方法的关键技术创新
SWE-1.7 的训练成功归功于对 RL 管道的广泛改进,主要涵盖以下四个核心方面:
1. 保持熵与稳定训练
长周期 RL 训练常面临熵崩溃和训练与推理间数值漂移导致的不稳定问题。
- Top-p 采样:防止熵崩溃,通过避免采样极低概率 token(这些 token 通常来自低奖励轨迹),并防止概率分布过度尖锐化。
- 采样分布重放:记录推理时用于采样的 token 子集,并在训练器中使用相同掩码重新归一化概率,以减小训练-推理分布差异。
- 优势:该方法使训练过程中熵保持稳定,同时优化算法专注于高学习信号的 token。
2. 多集群训练与容错
由于大规模计算资源稀缺,训练采用跨三大洲四个数据中心的多集群架构。
- 架构:单个训练集群位于美国,推理 rollout 集群分布在全球。训练器通过云对象存储传输压缩后的权重增量(减少 99% 以上数据量),推理引擎可异步应用更新。
- 容错:推理引擎故障代价低,可通过 NVIDIA Dynamo 重定向和重建;训练器故障通过快速检查点和节点状态复制快速恢复,中断期间推理管道保持温暖。
3. 高质量数据策展
数据质量直接决定模型学到的能力。
- 验证器质量:通过自动化执行测试和严格的质量保证流程,最小化误接受(假阳性)和误拒绝(假阴性)。
- 任务难度:选择模型解决率低的任务,以产生真正的学习信号并提升模型智能。
- 防作弊:采用网络隔离沙盒、移除 git 历史和参考文件、隔离评分路径、程序化检测利用签名,并对任何作弊尝试给予零奖励。
4. 长周期任务的自我压缩
为处理远超原始上下文窗口的长周期任务:
- 自我压缩:当接近上下文限制时,模型学习总结其工作状态,并从自我生成的摘要中恢复执行。这扩展了任务时长,训练中 rollout 可持续长达六小时。
- 交替长度惩罚:在无约束阶段仅优化任务成功;在预算阶段则对超过加权成本函数(包括 token 数、工具调用轮次和总时间)预算的解决方案进行惩罚。这使模型在能力范围内的任务中压缩响应长度,同时在困难任务中保留长周期行为。
模型行为特点
经广泛 RL 训练后,SWE-1.7 表现出与基础模型 Kimi K2.7 Code 明显不同的行为:
- 更值得信赖:比 K2.7 或其他前沿开源模型更具对齐性和可信度。
- 精简的思维链:平均句长更短,功能词比例更低,体现了预算阶段训练的效果。
- 更彻底的代码探索:在行动前会进行更深入的调查,例如修复 bug 时更可能探究根本原因、边缘案例和超出要求的需求。
- 通过实验解决歧义:倾向于通过编写小型脚本等实验和探测方式来解决语义模糊,而非猜测。
- 代价:这种更全面的推理会导致修改范围略微扩大,触及更多文件,这是当前推理增加模型的普遍趋势。
评估方法
所有模型均在其最大推理努力下进行评估:
- Terminal-Bench 2.1:使用内部评估框架,针对不同模型使用相应工具(如 Claude Code、Codex、Devin CLI),超时设为 4 小时。
- SWE-Bench Multilingual:优先使用官方自报告数据,否则使用 Devin CLI 评估。
- FrontierCode 1.1:遵循其专门的博客文章方法。
SWE-1.7 现已通过 Cerebras 在 Devin(Web、桌面和 CLI)中可用,推理速度达 1000 TPS。
15. PlayStation can delete all your digital games after 3 years of inactivity (EU) (www.flatpanelshd.com)
核心摘要:索尼面临因数字游戏所有权问题引发的广泛批评
索尼近期宣布自2028年起,新的PlayStation游戏将仅以数字形式发行,不再提供实体光盘。这一决定引发了玩家对价格垄断、数字所有权缺失的强烈不满。
更具争议的是,索尼在欧洲的服务条款明确规定:若用户账户连续36个月未使用,索尼可能关闭该账户,导致用户永久失去访问权及所有已购买的数字游戏。尽管索尼会提前通知并给予6个月宽限期,但此政策已存在多年(早期为18-24个月),并非因GDPR而新设。
关键区别与背景:
- 实体 vs 数字: 实体光盘虽也为许可产品,但物理存在使其难以被强制收回;而数字游戏可被平台方实质性撤回。
- 行业对比: 微软虽有类似不活跃账户政策,但明确承诺不会删除拥有已购数字内容的Xbox账户。
- 相关事件: 索尼此前已删除用户库中的影视内容,并关闭了PS3及PS Vita商店,加剧了用户对数字资产安全性的担忧。
目前尚不明确索尼是否会严格执行此条款,但该条款的存在使得数字游戏的所有权在法律上具有不确定性,引发了关于消费者权利的持续讨论。
16. Spider venom kills varroa mites without harming honeybees (connectsci.au)
17. Show HN: Microsoft releases Flint, a visualization language for AI agents (microsoft.github.io)
18. The classifiers Anthropic puts in front of Fable are too zealous (combine-lab.github.io)
文章标题总结: Anthropic的Fable模型的安全分类器过于严苛,在研究和学术任务中实用性差。
核心内容概述: 作者通过两次具体使用失败的经历,批评Anthropic公司推出的“安全版”模型Fable的安全过滤机制(分类器)过度敏感且校准不当,导致该模型在计算机科学研究等专业任务中几乎无法使用。
关键事件与论点:
第一次失败:软件重写任务被拒
- 任务:作者希望使用Fable辅助,将一个广泛使用的、处理RNA测序数据的开源C++工具(salmon)重写为Rust语言。
- 问题:尽管该任务是纯粹的软件工程移植,不涉及新的生物研究,但Fable的安全分类器因代码和文档中包含“RNA-seq”等生物术语而触发警报,直接拒绝了该请求。
- 结果:作者无法从Fable处获得任何解释或修改提示的指导,最终放弃并使用了其他模型(Opus 4.8)完成任务。这表明分类器可能仅根据术语黑名单(如生物学、网络安全)进行机械性屏蔽。
第二次失败:抽象数学问题遭全面拒绝
- 任务:作者向Fable提出一个纯粹的、抽象的图论与组合优化问题(源于其过去的一篇论文),询问该问题的计算复杂性或是否存在更优算法。
- 问题:尽管作者多次尝试,逐步剥离了问题中所有可能的生物学或网络安全上下文,甚至将问题表述为高度形式化的纯数学决策问题,Fable的分类器仍然一律拒绝回答。
- 结果:作者通过反复修改提示、移除个人描述信息等多种方法尝试绕过过滤,但均告失败。他无法让Fable与一个完全无害的数学问题进行互动。
作者的结论
- Fable的安全分类器存在严重缺陷,其过滤逻辑过于宽泛和严苛。
- 这导致模型对于从事生物信息学、基因组学、计算生物学、网络安全乃至计算机科学等相关领域的研究人员来说基本无用。
- 作者无法评估Fable的实际能力和价值,因为其核心安全机制阻止了任何有意义的学术或技术对话。
对比事例
- 文章末尾提到,当作者询问Fable关于“香草、巧克力和巧克力曲奇面团冰淇淋哪个更好”这类无风险的个人偏好问题时,模型给出了正常且详细的回答,进一步反衬出其安全机制对专业内容的过度排斥。
总结: 文章的核心论点是,Anthropic为Fable设置的安全分类器因过度敏感和错误校准,导致模型错误地将大量合法的、无风险的学术研究和技术开发任务(尤其是涉及特定领域术语的)视为威胁并拒绝处理,严重损害了其在专业用户中的实用性。
19. I Think I Have LLM Burnout (www.alecscollon.com)
文章标题:我认为我出现了LLM倦怠
总结内容:
文章作者于2026年7月8日描述了其个人因长期、高频使用大语言模型(LLM)而产生的疲惫感与心理变化。
- 使用现状与初衷:作者在工作和生活中广泛使用LLM(如Claude Code、Codex、Qwen等),其工作模式已从“设计并编写代码”转变为“设计代码、向LLM描述设计、审查LLM生成的代码、最终编写代码”。他认为LLM能提供新思路,并在不熟悉的领域增强其信心。目前的主要项目是建立一个大规模无监督代码生成框架,因此每天大量接触LLM生成的内容。
- LLM的价值:作者承认LLM提高了他的生产力,并认为持续学习如何有效使用它们是有价值的。对于日常查询,他也倾向于优先咨询LLM。
- 倦怠的根源:近几个月来,作者开始对阅读LLM的输出产生一种抵触情绪。他总结了LLM输出的普遍问题:错误的假设与幻觉、强调性且生硬的碎片化语句、过度使用表情符号(如✨、🚀)。这些模式在每次交互中反复出现。
- 核心矛盾:作者并非完全否定LLM,指出人类也会犯错。问题的关键在于“重复”:LLM以相同的风格写作并犯下同类错误。这种高度模式化、可预测的问题,加上无法控制他人生成内容的风格,导致了累积性的厌倦感。
- 现状与感受:尽管感到困扰,作者目前仍将继续使用LLM,并希望通过“咬牙坚持”来适应。他对此情绪感到意外,认为对工具的不稳定性感到沮丧可以理解,但对其写作模式也产生反感则是新的体验。他尚未找到应对此感受的方法。
20. Turning a pile of documents into a searchable useable knowledge base (github.com)
DocuBrowse v0.9.3 摘要
核心功能:DocuBrowse 是一款将杂乱的文档集合(如 PDF、电子书、Word 文档、笔记等)转化为本地、私密、可搜索的知识库的工具。其核心价值在于完全离线运行,使用本地 AI 模型,无需互联网、账户或 API 密钥,确保数据与隐私完全由用户掌控。
主要特性:
- 智能搜索:提供三种搜索模式。
- 关键词搜索:基于 SQLite FTS5 实现快速全文检索。
- 语义搜索:利用 AI 嵌入模型(nomic-embed-text)理解查询意图,寻找语义相关的文档。
- 混合模式(默认):结合关键词(30%)和语义(70%)结果,提供更精准的搜索体验。
- AI 摘要:点击任何文档标题,可即时生成类似书衣的 AI 摘要(由 dolphin3 模型生成),便于快速预览。
- 广泛格式支持:支持超过 40 种文件类型,包括常见办公文档(PDF、DOCX、XLSX、PPTX)、电子书(EPUB、MOBI)、电子邮件、代码文件、标记语言、图表(Visio、draw.io)等,并针对不同格式有专门的提取逻辑。
- 本地化与隐私:
- 所有处理均在用户本地机器完成。
- 内置 PII 保护功能,自动扫描并移除包含社会安全号、信用卡号等个人身份信息的文档。
- 数据库和索引文件本地存储。
- 用户界面:提供网页界面,支持深色/浅色主题切换、按字母顺序索引栏、标签云过滤、分页浏览以及单个文档的即时 AI 摘要、打开、删除等操作。
- 性能优化:搜索延迟通常低于 150 毫秒,采用多进程并行处理 PDF 提取,并设有内存安全限制。
技术架构与部署:
- 后端:由一系列 Python 脚本构成,核心包括文档扫描与提取模块、HTTP 搜索服务器、SQLite 数据库以及与本地 Ollama 服务集成的 AI 嵌入与生成模块。
- 前端:单页 Web 应用。
- 搜索算法:最终相关性得分由关键词搜索得分(BM25 算法)和语义搜索得分(余弦相似度)按 0.3:0.7 的权重加权计算得出。
- 安全措施:即使仅限于本地使用,也采取了防护措施,如 Host 头白名单(防御 DNS 重绑定)、基于 CSRF 令牌的请求验证以及对存储型 XSS 的防御。
- 系统要求:最低配置需 8GB 内存、支持的 x86_64 或 ARM64 CPU 及 2GB 磁盘空间。推荐配置为 16GB 内存和具有 4GB+ 显存的 GPU 以加速 AI 处理。
- 安装:提供 Linux(RPM/DEB/tarball)、Windows(ZIP)和 macOS(DMG)的安装包,通过命令行工具
docubrowser进行管理。
当前状态与限制:
- 版本:v0.9.3,接口稳定。
- 已知限制:不支持加密的 DRM 电子书内容全文搜索;扫描生成的 PDF 图像文件需外部 OCR 处理;语义搜索仅定位到文档级别;主要针对英文内容优化。
- 开发模式:项目在 Claude AI 的辅助下开发,并提供了相关上下文文件以促进持续开发。
- 许可协议:采用 GPL-3.0-or-later 许可证。
21. What Do We Know About the Microplastics Inside Us? (e360.yale.edu)
关于人体内微塑料的研究现状
研究面临的核心挑战
研究人体内微塑料是一项新兴且艰巨的任务,主要面临两大挑战:
- 分析方法不可靠:目前用于检测人体样本(如血液)中微塑料的技术存在缺陷。研究表明,血液中的脂质在仪器分析时会产生与最常见塑料(聚乙烯)相同的信号,导致假阳性。此前的18项研究可能因此高估了人体内微塑料含量。
- 实验室污染无处不在:塑料制品(如移液管、培养皿)及空气中的微塑料纤维极易污染实验样本。为建立可靠检测方法,研究人员从零开始建造了一个“无塑料”实验室,全部采用不锈钢和玻璃,并设计成正压环境,使实验室内的塑料和增塑剂(如邻苯二甲酸盐)水平降低了约一百倍。
微塑料进入人体的主要途径
研究表明,微塑料通过以下方式进入人体:
- 室内灰尘:家中的灰尘是重要来源,其中可能包含轮胎(由合成聚合物制成)等颗粒。增加吸尘频率有助于减少暴露。
- 合成纤维:使用烘干机处理涤纶、尼龙等衣物时会释放大量纤维。建议悬挂晾干这些衣物。
- 食品准备过程:使用塑料砧板、厨具烹饪,或用塑料容器加热食物,都会导致塑料碎片或微粒进入食物。建议改用竹、木或金属制品。
已知与未知
- 已知:塑料中广泛添加的化学物质(如邻苯二甲酸盐、双酚A)是已知的内分泌干扰物,对健康(如生育能力、II型糖尿病风险)有潜在影响。减少塑料使用,特别是单次使用塑料,因此是明智之举。
- 未知:关于塑料颗粒本身对人体的影响,目前证据非常有限。关键未解问题包括:
- 人体实际摄入的微塑料的大小、类型和数量。
- 最小的塑料颗粒能否穿过肠道屏障进入血液循环,或被深入吸入肺部。
- 毒理学研究常使用标准聚苯乙烯球体,但这并不能代表环境中实际存在的不规则塑料碎片或纤维。
重要澄清
“每人每周吃下一张信用卡重量的塑料”这一广为流传的说法已被证伪。实际研究显示,塑料食品容器虽会释放微塑料,但其数量远低于此。
总结
尽管塑料污染在环境中已无处不在,但科学界对人体内微塑料的精确暴露水平及其健康影响仍知之甚少。当前研究的重点是建立更可靠的检测方法,并在此基础上进行更贴近真实暴露情况的风险评估。在此期间,减少不必要的塑料接触,尤其是与食品相关的塑料制品,仍是合理的建议。
22. Separating signal from noise in coding evaluations (openai.com)
23. Postgres rewritten in Rust, now passing 100% of the Postgres regression tests (github.com)
pgrust:用 Rust 重写的 PostgreSQL,已通过 100% 回归测试
项目概述 pgrust 是一个用 Rust 语言重写的 PostgreSQL 数据库。其核心目标是通过 Rust 语言和 AI 辅助编程,使 PostgreSQL 更易于从内部进行修改和探索深度服务器变更。
核心进展与兼容性
- 回归测试达标:该项目最新版本已通过 100% 的 PostgreSQL 回归测试套件。
- 版本对齐:目标兼容 PostgreSQL 18.3,并在超过 46,000 个回归查询中匹配 PostgreSQL 的预期输出。
- 磁盘兼容:pgrust 与 PostgreSQL 在磁盘层面兼容,能够直接从现有的 PostgreSQL 18.3 数据目录启动。
性能表现与架构 新版 pgrust 采用了每连接一线程(thread per connection) 模型(取代了 PostgreSQL 传统的每连接一进程模型),并展现出显著的性能提升:
- 在事务处理工作负载中,比 PostgreSQL 快约 50%。
- 在分析型工作负载中,比 PostgreSQL 快约 300 倍(但在 ClickBench 基准测试中,目前比 ClickHouse 慢约两倍,并存在进一步优化的空间)。
当前状态与限制
- 非生产就绪:pgrust 尚未准备好用于生产环境,性能优化也未完成。
- 扩展兼容性:现有的 PostgreSQL 扩展及 PL/Python、PL/Perl、PL/Tcl 等过程语言扩展尚未全面兼容。部分捆绑的 contrib 模块已移植,未来可能提升兼容性。
未来路线图 项目规划包括:实现多线程 PostgreSQL 内部机制、内置连接池、更好的 JSON 重度工作负载支持、快速分叉与分支工作流、存储实验(包括免 vacuum 设计)、针对不良查询和 AI 生成 SQL 的运行时防护,以及减少执行计划的突然劣化。
试用与构建
- 在线演示:提供 WebAssembly 演示。
- Docker 运行:提供 Docker 命令一键启动。
- 从源码构建:详细说明了在 macOS 和 Debian/Ubuntu 系统上的依赖安装、编译、数据目录初始化及运行步骤。
- 回归测试:提供了运行 PostgreSQL 回归测试套件的脚本命令。
项目历史与资源 当前仓库包含的是达到回归测试里程碑的新版实现,旧版实现已归档。项目还列出了相关的背景文章链接、反馈渠道(GitHub Issues、Discord)以及维护者联系方式。项目采用 AGPL-3.0 许可证。
24. New Sweden: the US's long-lost 'secret' colony (www.bbc.com)
新瑞典:美国鲜为人知的“秘密”殖民地
殖民地概况
新瑞典(Nya Sverige)是1638年至1655年间存在于北美特拉华河谷的欧洲殖民地。它是美国历史上最小、人口最少、存在时间最短的欧洲殖民地,仅持续了17年,人口从未超过约400人。其领土覆盖了今天的新泽西州、宾夕法尼亚州、特拉华州和马里兰州的部分地区。
建立背景与秘密性
- 建立者:被解职的前新尼德兰(荷兰殖民地)总督彼得·米努伊特,为报复荷兰人,于1637年向瑞典王室提议建立殖民地。
- 秘密性质:瑞典人有意避免引起荷兰注意,将其建为一个“低调”的殖民地,专注于毛皮和烟草贸易。
- 首次登陆:1638年3月,米努伊特率25名定居者在特拉华河畔建立了克里斯蒂娜堡(以12岁的瑞典女王命名),这是特拉华谷地第一个永久欧洲定居点,也是后来特拉华州(美国第一州)的首个欧洲建筑。
殖民地治理与发展
- 初期挑战:米努伊特同年在寻找烟草时于飓风中溺亡,殖民地陷入困境,依赖原住民帮助才得以生存。
- 扩张时期:1643年,约翰·普林兹总督(被原住民称为“大肚汉”)上任,他扩建堡垒,将殖民地边界延伸至马里兰至新泽西地区,并在费城南部的蒂尼库岛建立了新首都。
- 与原住民关系:与当时其他欧洲殖民地不同,新瑞典与原住民部落保持着相对和平的关系。约80%的定居者是来自当时属瑞典领土的芬兰“森林芬兰人”,他们善于利用自然并与原住民共处。
衰落与终结
- 人口匮乏:殖民地长期人口不足,瑞典王室忽视补给,甚至用罪犯和逃兵充数。
- 内部冲突:1653年,四分之一的男性定居者签署请愿书抗议普林兹的专制统治,被视为美国殖民地最早的公民抗议之一。
- 被吞并:1655年,新尼德兰总督彼得·斯图伊维桑特率舰队轻易接管了新瑞典。瑞典定居者获准保留土地、自治政府并维持“瑞典民族”身份,殖民地被并入新尼德兰。
文化遗产与持久影响
尽管存在短暂,新瑞典对美国文化产生了深远影响:
- 原木小屋(Log Cabin):瑞典和芬兰定居者将这种建筑形式引入美国,后来成为美国边疆精神的象征,亚伯拉罕·林肯等先驱家庭也采用这种形式。
- 路德教传播:新瑞典带来了新大陆的第一个路德宗教堂。
- 城市命名:特拉华州的威尔明顿和宾夕法尼亚州的费城等地的地名、市旗均融入了瑞典元素(如瑞典国旗颜色)。
- 政治影响:新瑞典后裔约翰·莫顿在独立战争期间在宾夕法尼亚投下关键一票,支持《独立宣言》。
- 现存遗迹:
- 克里斯蒂娜堡公园(威尔明顿):首个定居点遗址。
- 老瑞典教堂(Old Swedes' Church):1698年建造,是美国现存最古老且持续用于礼拜的原始砖砌教堂。
- 原木小屋遗迹:如新泽西州吉布斯敦的C.A.诺斯纳格尔原木屋(建于1638年)。
- 普林兹州立公园(蒂尼库岛):殖民地最后首都的所在地。
现代纪念与认知
- 文化活动:瑞典裔美国人社区每年在费城举行仲夏节(Midsommarfest) 庆祝活动。
- 博物馆与教育:费城的美国瑞典历史博物馆和威尔明顿的新瑞典中心致力于保存和传播这段历史。
- 被遗忘的历史:尽管具有历史意义,新瑞典殖民地在美、瑞两国均鲜为人知,其和平共处理念为现代提供了借鉴。
新瑞典的故事揭示了美国建国史中常被忽略的篇章——一个短暂却对文化、建筑和社会关系产生持久影响的“秘密”殖民地。
25. Benchmarking coding agents on Databricks' multi-million line codebase (www.databricks.com)
Databricks 内部代码智能体基准测试:关键发现与方法论
测试概述
Databricks 为评估代码编写智能体(Coding Agents)的效能,构建了一套基于其实际工程任务的内部基准测试。该测试针对其**多百万行、涵盖多种语言(Python, Go, TypeScript, Scala 等)**的真实代码库,任务来源于工程师实际完成的Pull Requests(PRs),并经过严格筛选与人工验证。
主要结论
测试与分析揭示了以下几个关键洞察:
- 性能与成本帕累托前沿由混合模型组成:能提供最佳性价比(即在给定成本下最优质量)的模型组合,同时来自OpenAI、Anthropic以及开源模型。这意味着当前没有单一工具能提供全面的前沿性能。
- 开源模型已可胜任高难度编码任务:特别是GLM 5.2,其性能与顶级闭源模型(如Opus 4.8)在统计上相当,且单次任务成本更低($1.28 vs $1.94),已可作为许多开发者的日常编码工具。
- 按Token计价与按任务实际成本差异显著:模型的Token单价并非实际任务成本的良好指标。例如,Sonnet 5的Token单价虽低于Opus 4.8,但由于其在解决任务时消耗了更多Token(1.9倍),其实际任务成本($2.09)反而高于Opus($1.94)。
- 调用框架(Harness)对效率影响巨大:相同的模型在不同框架(如Pi vs Claude Code/Codex)下运行,任务成本差异可超过2倍,而质量相同。关键差异在于框架向模型提供的上下文量。高效的框架(如Pi)通过更精细的上下文管理,能以更少的运行次数完成任务。
模型能力分层
模型和框架的结果显示出明显的三个能力梯队:
- 顶层:最智能的模型,能高效解决各类复杂问题,但成本高昂。
- 中层:在处理常见任务时同样有效,且成本显著降低(如Haiku, GPT 5.4 Mini级别)。
- 底层:适用于最简单的任务。
基于此分析,Databricks正推动将更多日常任务(如翻转标志、更新配置)转移到中层模型,以优化成本。
基准测试构建方法论
为解决公开基准(如SWE-Bench)的局限性(如解决方案泄露、不匹配自身代码库),Databricks构建了专属基准:
- 任务来源:从工程师近期、真实的合并PRs中筛选,确保反映当前框架、模式与约定。
- 筛选标准:
- 人工编写:排除机器人、账户及完全AI生成的更改。
- 附带高质量测试:确保验证变更的有效性。
- 自包含:变更局限于少数模块。
- 具有代表性:涵盖全栈任务(后端、系统、前端、协议、配置)。
- 任务构建:
- 从PR中提炼意图,编写不含解决方案的提示。
- 分离出测试文件作为评估基准。
- 人工审核每个样本,必要时优化任务描述或重写测试。
- 评估与防护:
- 使用模型默认配置和工程师可用的工具运行。
- 当智能体声明完成时,应用保留的测试进行自动化评估,而非使用LLM判断。
- 采取安全措施(如运行时隔离Git历史),防止智能体直接检索原始解决方案。
结论与展望
通过此基准,Databricks证实了数据驱动地优化代码智能体使用的可行性,已能提升工程效率。该方法为其他团队提供了可复制的蓝图——利用历史PRs和团队编写的测试即可构建专属基准。未来,Databricks计划纳入更多高难度任务,并通过智能路由(如Unity AI Gateway和Omnigent)自动为开发者选择最优的模型与框架组合,以实现高效与智能的平衡。
26. OpenMandriva: Statement regarding attempted distribution sabotage (forum.openmandriva.org)
关于未遂分布破坏行为的声明
OpenMandriva 项目近期遭遇了一次来自前贡献者的未遂破坏行动,项目方为保持透明度已就此事件向社区发布声明。
事件概述 该项目的分发版本在近几日内经历了若干次干扰或破坏尝试。项目团队认为有必要及时、透明地向社区通报相关情况。
涉事人员 事件与一名名为 Davide Beatrici 的前贡献者有关。该人士以其在即时通讯应用 Mumble 方面的工作而知名。
项目方回应 OpenMandriva 团队公开了此事件,并可能通过社区论坛等渠道提供了进一步的详情说明。相关的讨论与信息也反映在项目论坛的一个帖子中,该帖子还链接到一个由外部人士(如“Lunduke”)制作并讨论此事件的视频。
关键点
- 性质:这是一次针对 Linux 发行版 OpenMandriva 的未遂破坏行为。
- 责任方:由前贡献者 Davide Beatrici 实施。
- 项目态度:OpenMandriva 选择公开透明地处理此事,主动向社区披露信息。
- 背景:涉事者拥有在知名开源软件 Mumble 上的贡献背景。
27. Suspecting AI cheating, Ivy League prof ordered in-person final; scores fell 50% (arstechnica.com)
布朗大学AI作弊疑云与成绩断崖式下跌
事件背景
- 教授与课程:布朗大学经济学教授Roberto Serrano,因其ECON 1170课程(通常难度较高)而面临疑似大规模AI作弊事件。
- 起因:2025年12月布朗大学发生枪击案,对Serrano教授造成心理冲击。为调整教学,他决定在2026年春季学期的期中和期末考试采用在家开卷考试形式。
异常现象与作弊迹象
- 选课人数激增:该课程通常仅吸引少量优秀学生(历史上从未超过30人,有时甚至仅8人),但改为开卷考试后,本期选课人数飙升至86人。
- 成绩异常高涨:2026年3月的期中考试(开卷)平均分高达96分(满分100),其中40名学生获得满分。而Serrano教授指出,该课程历史期中平均分通常在65-80分之间,且本次考试难度实际更高。
教授的应对与后续
- 怀疑与调查:面对异常成绩,Serrano教授怀疑大量学生使用生成式AI(如聊天机器人)作弊。他向媒体(包括《国家报》和《Inside Higher Ed》)公开此事,引发关注。
- 考试方式变更:为验证猜测并应对作弊,Serrano教授将期末考试改为必须参加的线下闭卷考试。
- 成绩大幅下滑:在实施线下考试后,学生平均分较期中考试下跌了50%,这强烈暗示此前成绩高涨部分源于AI辅助作弊。
更广泛的背景与影响
- AI作弊的普遍性:文章提及普林斯顿大学一项调查,显示**29.9%**的学生承认曾在至少一门考试或作业中使用AI作弊,表明此现象在精英院校中并非个例。
- 学生动机分析:常春藤学生虽具备学习能力,但出于竞争压力、时间紧张等因素,可能将AI视为“捷径”,以腾出时间从事其他活动。
- 学术诚信危机:此事件凸显了生成式AI对传统学术评估构成的严峻挑战,引发了关于学术诚信与评估方式改革的讨论。
28. Introducing Muse Spark 1.1 (ai.meta.com)
29. We made Grok 4.5, GPT-5.5, and Claude build the same apps (www.tryai.dev)
AI模型编程对决:Grok 4.5、GPT-5.5与Claude的同题比拼
本文记录了一场针对最新AI编程模型的标准化测试。测试对象包括xAI的Grok 4.5、OpenAI的GPT-5.5以及Anthropic的Claude Opus 4.8和Claude Fable 5。测试方法是给每个模型提供完全相同的三个提示,要求其一次性生成一个独立的、无需外部库的HTML文件来构建交互式应用,随后在真实浏览器中运行并评估结果。
主要测试结果
3D魔方(需要复杂的3D数学、状态管理和动画)
- Claude Opus 4.8 和 Claude Fable 5 均首次尝试成功生成了功能完整、色彩正确的3D魔方,并具备打乱和还原的动画。
- Grok 4.5 首次尝试失败(无魔方渲染),重试后成功。
- GPT-5.5 表现不佳,仅渲染出一个单色暗面。
粒子重力沙盒(创建带有吸引子和轨迹的交互式粒子系统)
- 所有模型均成功生成可运行的沙盒。
- GPT-5.5 被评为“最令人着迷”,因其具有发光的霓虹吸引子和密集的彩色轨迹。
- 其他模型也各具特色,如Grok 4.5的轨道感、Fable 5的柔和光球等。
打砖块游戏(构建经典游戏,包含鼠标控制挡板、球、砖块、分数和生命值)
- 所有四个模型均在首次尝试中成功生成了外观精美、可玩性高的游戏。
- 结果为平局,所有输出均达到可发布质量。
额外SVG绘图测试(生成描绘“马骑在宇航员脖子上在月球行走”的SVG图像)
- Claude Fable 5 凭借其幽默的场景描绘(配有对话框)脱颖而出。
- GPT-5.5 紧随其后。Grok 4.5 准确完成了任务。Claude Opus 4.8 的SVG存在技术错误。
速度与成本对比
测试还对模型性能进行了量化评估:
- Grok 4.5 在速度和成本上表现突出:首字延迟最低(0.44秒),输出流速最快(约110 token/秒),且单次查询成本最低(0.002美元)。其口号“单位时间和成本的智能”得到体现。
- GPT-5.5 在短回答上最迅速。
- Claude Opus 4.8 表现均衡。
- Claude Fable 5 速度最慢(28 token/秒)、成本最高(0.009美元)。
总结
- Grok 4.5 是速度与性价比之王。它构建了优秀的游戏和沙盒应用,流速是其他模型的两倍,运行成本最低。唯一的明显失误是在最复杂的3D魔方任务上首次尝试失败。非常适合高并发、对延迟和成本敏感的代码生成场景。
- Claude Opus 4.8 和 Fable 5 是最可靠的构建者。它们是唯一在首次尝试就完美完成3D魔方任务的模型,Fable 5在创意表达上也表现出色。但需要为此支付更高的延迟和价格成本。
- GPT-5.5 是风格突出的快速型选手。它制作了最华丽的引力模拟,在短回答上响应最快,但在最复杂的任务上稳定性不足。
核心结论是:在模型发布日,Grok 4.5在与市场顶级模型的直接对比中,在速度和成本方面取得了明确优势。所有这些模型均可在同一平台上按需付费使用。
30. US seeks cheaper hunter-killer drones after Iran destroys $1B worth of Reapers (arstechnica.com)
- MQ-9“死神”无人机损失惨重:美国空军在美伊冲突中已损失近30架MQ-9“死神”无人机(截至2026年5月),包括被伊朗防空系统击落和在地面被毁。这一损失导致美国空军的“死神”机队规模缩减至约135架,总价值约为10亿美元。
- 持续冲突与新增损失:尽管存在停火期与谈判尝试,美伊之间的空袭与无人机对抗仍在继续。2026年7月,伊朗声称又击落了一架“死神”无人机。
- 寻求更廉价替代方案:由于“死神”无人机单价高昂(3000万至5000万美元),且制造商通用原子公司已于2025年停止为美军生产该型号,美国国防创新单元(DIU)正招标研发更便宜的替代无人机。
- 新无人机技术要求:新无人机需能搭载多种传感器和武器(有效载荷达2800磅),作战半径至少2300海里(单程打击任务可达8000海里),并执行与MQ-9A相同的任务。计划在2031年前交付20架可执行任务的飞机。
- 巨额投资自主作战技术:美国国防部在2027财年预算中申请约540亿美元用于无人机和自主作战技术,该金额已接近乌克兰的年度军事预算。
31. Remote Attestation (www.liamcvw.com)
远程证明
远程证明是一种安全机制,用于在主机加入网络时,通过密码学方法验证其内部状态是否可信。其核心目标是确保主机在启动后未被篡改,且运行环境符合预期。
核心问题与解决方案
传统安全模型在主机配置完成后往往赋予其过高信任,导致攻击者可能潜入并持久化。远程证明通过结合可信平台模块 来解决此问题。TPM能够在主机启动过程中,对硬件、固件、内核、根文件系统及任意自定义检查项进行密码学测量,从而远程验证主机的初始状态。与侧重于阻断启动的“安全启动”不同,“测量启动”记录完整启动链的哈希值,能检测恶意签名驱动和 rootkit。
TPM 工作原理与密钥管理
TPM 提供受保护的密码操作接口,其关键组件包括:
- 平台配置寄存器:在启动各阶段按顺序存储哈希值,形成不可逆的测量链。
- 密封功能:允许将数据(如根文件系统加密密钥)封装在 TPM 中,仅在 PCR 值匹配预设策略时解封。
- 证明报告:TPM 使用其内部密钥对 PCR 值进行签名,提供启动状态的可信证明。
TPM 的密钥体系包括:
- 背书密钥:由制造商烧录,用于初始身份验证。
- 证明密钥:由 EK 派生,仅能签名证明报告。
- 本地设备标识密钥:由 AK 派生,可签名任意数据以代表主机身份,通常会被密封至预期的 PCR 值。
为应对系统升级导致的测量值变化,可使用 TPM2_PolicyAuthorize 策略,允许在特定条件下接受新的 PCR 值。
实际应用与优势
成功实现远程证明后,可带来以下安全效益:
- 访问控制:RA 可拒绝向未通过证明的主机签发 TLS 证书。
- 数据加密:主机的根文件系统可被 TPM 密封,仅在证明成功后可解密。
- 身份验证:使用 TPM 支持的证书进行 mTLS 认证,被篡改的主机无法获得有效证书。
- 工作负载调度:调度器可要求主机提供证明后,才允许在其上运行任务。
- 供应链安全:强制进行启动阶段的测量,有助于发现固件、内核等层面的供应链问题。
局限性
远程证明主要保障启动阶段的完整性,无法防御运行时攻击,这部分需要依赖 EDR、LSM 等措施。此外,它仍面临物理攻击的风险。全面实施需要仔细管理整个启动链的构建与分发过程。