2026-08-06

31 篇热帖

1. Discovery Loop (www.discoveryloop.com)

Discovery Loop is building AI systems that automate the experimental loops of science and engineering. Continuous Exploration.

2. Changes at Google DeepMind: Demis Hassabis from CEO to Chair, Jeff Dean departs (blog.google)

Google DeepMind 领导层变动摘要

Google 首席执行官 Sundar Pichai 宣布了 Google DeepMind (GDM) 的一系列重要领导层调整,旨在加速通用人工智能(AGI)的发展并专注于前沿科学研究。

核心人事变动

  • Demis Hassabis 的角色转型 Demis Hassabis 将卸任 Google DeepMind 的日常运营职责,转任 Google DeepMind 主席以及 Alphabet 首席科学家。这一转变使他能够将全部精力投入到塑造 AGI 的未来及相关科学研究中。同时,他将继续领导 Isomorphic Labs,并作为顾问为 GDM 团队及模型研发提供指导。

  • Koray Kavukcuoglu 接任领导职务 原 Google DeepMind 首席技术官兼 Google 首席 AI 架构师 Koray Kavukcuoglu 将晋升为 Google DeepMind 高级副总裁 (SVP),直接向 Sundar Pichai 汇报。他将负责监督 Gemini 模型开发、前沿 AI 研究,以及 Gemini 应用和开发者相关团队的工作。

  • Jeff Dean 离职与新事业 在 Google 任职 27 年后,Jeff Dean 将离开公司。他将与 Google 高级研究员 Sanjay Ghemawat 共同成立一家独立的公益公司 (public benefit corporation),致力于加速机器学习、科学和工程领域的发现。Google 将作为创始投资者和 Cloud 合作伙伴,与其保持研究框架与基础设施方面的合作。

业务背景与现状

此次架构调整正值 Google AI 业务处于高速增长期:

  • 模型影响力: Gemini 模型在开发者和企业中需求旺盛,Gemini 应用的月活跃用户已超过 9.5 亿;Gemma 模型下载量已突破 9 亿次。
  • 战略目标: Google 致力于利用其完整的 AI 技术栈(从基础设施、云服务到前沿模型和应用)来维持领先地位,并加速实现 AGI 的愿景。
3. Crime Pays but Botany Doesn't (www.crimepaysbutbotanydoesnt.com)

自学植物学指南

本文为希望自学植物学的初学者提供了指导,强调不应被复杂的专业术语或学术氛围所吓倒,并鼓励利用互联网资源随时查阅和学习。

核心概念

  1. 拉丁语术语 (Latin Terminology) 由于通用名(俗名)在不同地区可能指向完全不同的植物,科学家采用了由林奈(Linnaeus)建立的拉丁语命名系统作为全球通用的标准。在书写科学命名法时,必须遵循严格的格式:属名首字母大写,种名小写,且整体使用斜体(例如:Cedrus atlantica)。

  2. 分类学 (Taxonomy) 分类学是基于生物的演化关系进行分组的科学。通过掌握将特定科、属或族联系在一起的关键特征,学习者可以根据植物的演化特征,识别出从未见过的植物,并准确确定其所属的分类群。

核心教材推荐

  • Michael Simpson 的《Plant Systematics》(植物系统学) 这是深入研究植物学的权威教材。该书侧重于植物演化的研究,以及如何通过理解“共有衍征”(Synapomorphies)来进行植物鉴定。它详细介绍了植物学家在DNA分析出现之前是如何判断亲缘关系的,是学习植物形态学和演化的重要长期参考书。

  • 《Raven's Biology of Plants》(拉文植物生物学) 该书涵盖了植物生物学的基础知识及植物演化的细微差别。书中深入探讨了选择压力、趋同演化、等位基因频率以及哈迪-温伯格定理(Hardy-Weinberg theorem)等核心概念,并通过丰富的案例解释了植物演化的机制。

其他学习资源与建议

作者还列举了大量针对特定领域的参考书目,涵盖以下领域:

  • 系统发育与演化: 如关于被子植物演化、分子系统发育学的书籍。
  • 生态学与生物地理学: 包括植物生态学、种子生态学及生物地理学相关著作。
  • 特定学科与地域研究: 如地质学、仙人掌生物学,以及以加利福尼亚地区为案例的生态与植物研究。

学习建议: 考虑到教材成本可能较高,作者建议学习者可以利用电子设备(如安卓平板)阅读PDF格式的教材,并利用相关学术资源获取书籍,以降低自学成本并提高学习效率。

5. GitHub Actions and Pages are experiencing degraded availability (www.githubstatus.com)

GitHub Actions 与 Pages 服务可用性下降事故总结

事故概况

  • 发生时间:2026 年 8 月 6 日 15:22 UTC 至 8 月 7 日 02:04 UTC。
  • 受影响服务:GitHub Actions、GitHub Pages、Copilot(代码审查与编程代理)、GitHub Enterprise Importer(迁移功能)以及 Actions REST API。

主要症状与影响

  • GitHub Actions 异常:工作流运行失败、延迟启动、任务在队列中长时间等待或超时;部分 Actions API 请求返回错误;部分用户在工作流中遇到非预期的速率限制。
  • Webhook 触发受阻:由于系统为协助恢复而采取了 Webhook 节流措施,许多由 pushpull request 事件触发的工作流未能正常启动。
  • 运行器 (Runners) 问题
    • GitHub 托管运行器:在容量受限期间,任务处理能力下降。
    • 自托管运行器 (Self-hosted runners):部分运行器无法获取任务,或在注册时遇到错误及速率限制。
    • Actions Runner Controller (ARC):部分 ARC runner pods 进入了僵死(idle)状态。
  • 其他服务:GitHub Pages 出现性能下降或间歇性失败;Copilot 相关功能出现延迟或失败;GitHub Enterprise Importer 迁移功能在事故期间处于暂停状态。

核心原因分析

  1. 无效任务分配:发现运行器被分配了已不再有效的任务,导致任务处理循环异常。
  2. ARC 状态异常:在使用 Actions Runner Controller (ARC) 的环境中,部分 runner pods 无法正常工作并处于僵死状态。

恢复措施与解决方案

  • 部署修复程序:GitHub 部署了针对“运行器分配无效任务”问题的修复方案,并逐步提升了任务完成率(成功率最高达到 99%)。
  • 清理积压任务:清空了系统范围内的队列,并针对自托管运行器无法获取任务的问题部署了增量修复。
  • 恢复吞吐量:逐步恢复了 Webhook 触发的工作流吞吐量,并对 GitHub Pages 和 Copilot 等服务进行了稳定性监控。

用户后续操作指南

  • 手动重新触发:由于部分 Webhook 事件(如 pushpull request)无法自动重放,用户可能需要通过推送新提交更新 Pull Request手动重新运行工作流来完成未触发的任务。
  • ARC 用户手动干预:对于受影响的 ARC 用户,若 runner pods 处于卡死状态,可以通过 kubectl 删除这些 pods 或重新部署 ARC 应用程序。ARC 会自动创建新的替代运行器。

未来改进

GitHub 计划在后续发布的 Actions Runner 和 Actions Runner Controller 版本中引入自动恢复机制,旨在通过自动化手段解决运行器状态异常问题,避免用户需要进行手动干预。

6. Zed DeltaDB (zed.dev)

Zed DeltaDB 概述

DeltaDB 是一种新型的版本控制系统,其核心理念是在“提交(commit)之间”记录工作过程,并将每一次代码变更与其背后的对话逻辑紧密关联。

核心功能

  • 回溯任意编辑:DeltaDB 能够捕获提交之间的每一次操作,并为每个操作分配稳定的身份标识。这使用户能够精确地回溯到代码演进过程中的任何瞬间。
  • 代码与对话的溯源:每次代码变更都与产生该变更的智能体(agent)对话相关联。用户可以实现双向跳转:从任何一行代码找到对应的对话,或从任何一条对话消息跳转到其影响的代码。
  • 即时分支:通过虚拟化工作树技术,创建新的智能体分支几乎是零成本的。用户可以在历史记录中的任何时间点(包括任务运行过程中)创建分支。
  • 实时协作(共享对话而非 PR):团队成员无需等待用户完成提交和推送(push),即可在工作进行中加入。他们可以直接与执行工作的智能体进行交流并进行实时标注。
9. Almost no skill required to cook a steak (blog.sydorets.com)

总结:利用 AI 进行软件开发的本质——从“煎牛排”谈起

本文通过“煎牛排”这一生活化的比喻,深刻探讨了在 AI 时代进行软件开发的核心挑战、误区以及开发者应有的成长路径。

核心类比:煎牛排 vs. AI 软件开发

  • 低门槛与高标准的差异: 煎出一种“勉强能吃”的牛排几乎不需要技巧,只需简单的加热与翻面;同样,利用 AI 构建代码、工具和工作流也变得异常简单。然而,要做出完美的、品质高度一致且符合预期的牛排(或高质量的软件),则需要深厚的专业知识。
  • AI 的本质是“机器”而非“大厨”: AI 并非具备理解能力的“大厨”,而是一台“煎牛排机器”。它可以机械地、大规模地执行指令和配方,但它无法真正理解用户的愿景。除非人类将其转化为极其精确的要求、约束、示例和测试,否则 AI 无法感知开发者脑海中的设计图景。

行业现状与潜在陷阱

  • 逃避学习的代价: 许多开发者试图通过购买高端 AI 产品、订阅助手或雇佣机构来规避学习成本,期望他人直接解决问题。但由于行业内普遍使用相似的 AI 技术,最终产出的软件往往呈现出一种“平庸的合格”——虽然能运行,但充斥着奇怪的界面、无意义的功能和难以理解的生成代码。
  • 平庸的趋同性: 当开发者试图通过付费来获取“完美的梦想”时,往往会发现结果并不理想,因为市面上大多数服务都在使用相同的 AI 逻辑。这导致了软件质量的整体趋同,仅能满足客户对“基本可用”的容忍度。

结论:回归专业判断力

  • AI 的定位: AI 的价值在于提高效率、自动化重复任务以及提供初步的构思。它能加速开发过程,但无法取代人类的判断力。它无法定义什么是“高质量”,也无法在技术实现与实际业务需求之间做出关键的权衡。
  • 开发者的成长路径: 要构建卓越的软件,开发者必须掌握软件工程的底层逻辑。只有当你理解了原理,才能识别出 AI 输出中的错误(即“焦黑的牛排”),并利用 AI 作为工具来放大自己的专业能力,而不是盲目依赖运气。

核心观点: 利用 AI 可以让你更快,但唯有深厚的专业知识才能让你做得更好。

10. Meta Ran Ads That Contained AI-Generated Child Sexual Abuse Imagery (www.wired.com)

Meta 广告平台被指投放包含 AI 生成儿童性虐待内容的广告

据调查显示,Meta 公司在过去九个月内(从去年 11 月至今年 8 月初)在其旗下的 Facebook、Instagram、Messenger 和 Threads 平台上运行了数十个付费广告,其中包含由 AI 生成的儿童性虐待材料(CSAM)以及涉及未成年人的性暗示图像。

事件核心细节

  • 广告内容与性质:独立监督机构 Tech Transparency Project (TTP) 在 Meta 的广告库中发现了超过 50 个此类广告。这些广告往往指向所谓的“脱衣”或“裸露”类应用(nudify apps)。研究人员发现,部分视频广告极度恶劣,例如通过 AI 技术将儿童的面部合成到性行为视频中,或使用未成年人影像配合性暗示文字进行推广。
  • 投放范围与目标:这些广告针对美国、英国及十多个欧洲国家(包括法国、德国、意大利、西班牙等)的用户。部分广告明确仅针对男性群体。
  • 触达规模:虽然许多广告的覆盖面相对有限,但至少有一个广告在欧洲触达了 2,563 个账户。由于 Meta 广告库未公开美国及部分国家的详细数据,实际影响范围可能更高。
  • 审核漏洞:TTP 指出,这些违规内容并非普通的第三方用户发布帖子,而是经过 Meta 审核、批准并允许投放的付费广告。这意味着 Meta 在广告审核流程中未能拦截这些极端违规内容。

后续行动与回应

  • 报告与删除:TTP 已将发现的相关情况报告给美国失踪与受剥削儿童国家中心 (NCMEC)。在 WIRED 媒体联系 Meta 后,Meta 已将这些广告从其广告库中移除。
  • Meta 的官方回应:Meta 表示其正积极致力于清除平台上的性剥削内容。公司辩称,大多数此类广告的触达范围极小,且许多广告是在其最新推出的用于检测和拦截违规广告的 AI 技术上线之前投放的。Meta 还强调,去年已移除超过 3,600 万件儿童性剥削内容,并会对相关的“脱衣”应用开发者采取法律行动。
11. Humans missed 1 in 3 threats approving AI agent commands across 40k game runs (scalex.dev)

AI Agent 权限审批实验总结:人类在面对威胁时的表现

本文通过分析一款名为“人类在环”(human-in-the-loop)的浏览器游戏数据(包含超过 4 万次运行和 40.9 万次决策),探讨了人类在作为 AI 编程助手最后一道防线时,审批指令的安全性与有效性。

核心数据概览

  • 威胁拦截率:平均玩家会漏掉 1/3 的威胁(平均准确率为 66.3%)。
  • 负分比例:32.9% 的游戏环节因批准了威胁指令或过度拦截了安全指令而导致负分。
  • 极端表现:只有 20.8% 的玩家能在识别所有威胁的同时,保持极低的误报率(拦截不超过 1/5 的安全指令);另有 7% 的玩家直接批准了所有指令。

威胁类别与漏检率

人类对不同类型的威胁表现出不同的警觉性:

  • 显而易见的破坏性指令(如 rm -rf /):漏检率最低,仅为 11.7%
  • 持久化变异(如注入 crontab):漏检率为 23.8%
  • 数据外泄/代码执行(如向未知 API 发送数据):漏检率为 33.4%
  • 权限范围违规(如读取 .aws/credentials):漏检率最高,达 35.0%

npm run 的盲点

实验发现,npm run 系列指令是最大的安全漏洞。其中 npm run analyze 的被误批准率高达 64.7%

  • 风险逻辑npm run 本身通常是无害的,但它执行的脚本内容定义在 package.json 中。恶意 Agent 可以先修改配置文件,将攻击载荷隐藏在看似平常的脚本名称下。
  • 结论:即使历史日志中显示了真实的恶意代码,大量玩家仍会因习惯性信任熟悉的指令名而放行。这表明,单纯审批单一指令是不够的,因为 Agent 可以通过修改关联文件来绕过审批。

人类行为偏差

  1. 权限疲劳(Permission Fatigue):随着游戏进程的推进,随着审批指令数量的增加,玩家的漏检率会随之上升。这反映了用户在面对大量审批请求时,注意力会逐渐下降。
  2. 过度拦截(Over-blocking):为了安全,用户常会误拦截一些正常的开发指令(如清理构建目录 rm -rf dist/ 或设置 npm 镜像),这会降低 Agent 的工作效率,并进一步加剧用户的疲劳感。
  3. 上下文缺失:指令的风险具有高度上下文相关性(例如读取 .zshrc 是否危险,取决于用户是否在该文件中存储了密钥),而人类审批者往往缺乏完整的环境上下文。

总结与建议

实验表明,仅依靠“人类在环”的指令审批机制来保护 AI Agent 是不可靠的。由于高噪声带来的疲劳感以及开发者对上下文感知的局限,人类很容易成为安全链条上的薄弱环节。

为了降低风险,开发者应考虑更深层的安全防御措施,例如:

  • 沙箱化(Sandboxing):限制 Agent 的运行环境。
  • 凭据分离:将敏感信息与环境配置分离,减少被轻易读取的风险。
12. Show HN: I spent 2 years designing a mechanical Magic Keyboard (electronicmaterialsoffice.com)

Altar II 机械键盘产品总结

Altar II 是一款设计精密的超薄全机械键盘,旨在通过创新的工程技术,在极薄的机身内实现卓越的机械打字体验。

核心设计与构造

  • 极致轻薄:厚度仅为 4.75mm,远低于 Apple Magic Keyboard (10.09mm) 和其他主流机械键盘,有效减轻了手腕在打字时的延伸压力,降低了患上腕管综合征的风险。
  • 机械开关:采用突破性的双钢臂剪刀脚机械开关(Dual steel arm scissor switch),触发压力为 40gf,在极小的空间内提供了可靠的机械手感。
  • ESPtype™ 系统:通过不同的键帽形状来标识键盘区域,辅助用户实现更轻松的盲打体验。
  • 减震系统:内置 Inertial Damper™(惯性阻尼)系统,通过硅胶膜和弹性体脚垫实现声学与振动的有效隔离。

创新交互功能

  • M-Dial™ 旋钮:一个磁吸式、可拆卸且可点击的旋钮,用于音量调节、媒体控制(播放/暂停、切歌)及 Siri 调用。用户可以通过 Altar II 应用进行自定义,官方还公开了 3D 打印文件,支持用户 DIY 旋钮。
  • Harmonic Synthesiser™ 触觉反馈:提供细腻且具有表现力的触觉反馈,可用于模拟旋钮刻度感、提示快捷键完成状态,或通过轻微震动提醒 macOS 系统通知。
  • NiteLite™ 背光:配备环境光传感器,仅在低光环境下激活。采用长波长的琥珀红光,旨在保护用户的夜视能力并减少对生物钟(昼夜节律)的影响。
  • 内置音频:集成高保真扬声器,用于播放唤醒音、充电提示音等系统反馈。

软件与生态

  • 原生 macOS 应用:使用 Swift 编写,提供轻量化的深度定制体验,包括按键绑定、M-Dial 行为、背光、触觉及音频水平的调节,并支持针对特定软件(如 Figma、VS Code)设置快捷键。
  • 设置随身化:所有自定义设置均存储在键盘硬件本身,更换电脑或操作系统时无需重新配置。
  • 固件支持:基于 ZMK 和 Zephyr 的实时操作系统(RTOS)。

续航与可持续性

  • 强劲续航:典型使用环境下续航可达 30 天;支持快充,充电 2 分钟即可使用 2 天。
  • 环保材料:机身采用可回收铝材和含有至少 50% 再生内容的 REGEN™ 聚合物;采用无塑料包装(纸张与甘蔗浆制成)。

技术规格摘要

  • 布局:75% 布局(含功能行及全尺寸方向键)。
  • 连接方式:2 路蓝牙 5.0 Low Energy (LE) 及 1 路 USB-C。
  • 尺寸:299mm (宽) x 116.5mm (深) x 4.75mm (高)。
  • 系统兼容性:支持 macOS 12 及以上,Windows 10 及以上。
13. Mario Meets Pareto (www.mayerowitz.io)

马里奥与帕累托最优:驾驶员选择策略

本文通过《马力欧卡丁车8》的角色选择场景,深入浅出地解释了**帕累托效率(Pareto Efficiency)**及其在多目标决策中的应用。

核心挑战:权衡取舍

在选择最佳驾驶员时,不能仅依赖单一指标(如“速度”)进行排名。由于不同角色在不同属性之间存在权衡(Trade-offs),寻找最优配置需要同时考虑**速度(Speed)加速度(Acceleration)**两个维度。

关键概念

  1. 支配(Domination) 如果一个角色在某一属性上不如其他角色,且在另一属性上也不占优势,那么该角色就是“被支配”的(即次优选择)。

    • 示例:Koopa Troopa 是一个被支配的角色。因为 Cat Peach 在相同加速度下拥有更高的速度,而 Toadette 在相同速度下拥有更高的加速度。在追求性能的决策中,Koopa Troopa 是不理想的选择。
  2. 帕累托前沿(Pareto Front / Frontier) 由所有“高效”驾驶员组成的集合。这些驾驶员的共同特点是:没有任何一个角色能在不牺牲其中一项属性的情况下,在另一项属性上同时优于他们。

  3. 帕累托效率(Pareto Efficiency) 这是一种客观的筛选标准,用于过滤掉那些在多维度表现上都被其他选项“支配”的次优选择。

决策过程

帕累托效率虽然能帮助玩家排除掉表现不佳的角色,但它并不能直接给出“唯一最佳”的答案:

  • 客观筛选 vs. 主观决策:帕累托效率提供了一个经过优化的候选池(帕累托前沿),但最终的选择取决于玩家的个人偏好。
  • 个人风格:玩家会根据自己的游戏风格和技术水平,对速度或加速度进行不同的权重分配。例如,有的玩家追求极致的速度,而有的玩家则倾向于在速度与加速度之间寻求平衡。
14. Beating GPT-5.6 Sol on retrieval with 100x cheaper open models (neon.com)

摘要:利用 Castform 与 Neon 构建低成本、高性能的检索代理

背景:从 RAG 到代理化检索的挑战

随着 AI 技术的发展,检索模式正从传统的单次检索(RAG)转向“代理化检索”(Agentic Retrieval)。代理模型不再是执行单一查询,而是通过循环、多步规划来分解并解决复杂问题。然而,这种模式依赖于频繁调用前沿模型(如 GPT-5.6-sol),导致单次请求的成本高昂且延迟严重(单次请求可能耗时 >10s,成本约 $0.03)。

虽然小型开源模型成本更低(约前沿模型的 1/100),但其原生能力在复杂检索任务中往往不及闭源模型。

核心解决方案:强化学习(RL)后训练

通过强化学习(RL)后训练,可以弥补开源模型与前沿模型之间的能力差距。Castform 与 Neon 的结合为开发者提供了一套完整的流程,使小型开源模型在特定检索任务上的表现能够匹配甚至超越前沿模型。

1. Castform:简化后训练流程

Castform 解决了开发者在进行 RL 后训练时面临的两大难题:缺乏高质量训练数据基础设施复杂

  • 合成数据生成:Castform 能将企业现有的非结构化文档(如内部文档、产品记录、支持文章等)自动转化为高质量的训练任务,包括生成“问题”、“文档片段”和“标准答案(Ground Truth)”。
  • RL 循环管理:Castform 自动化了“模型尝试任务 $\rightarrow$ 奖励函数评分 $\rightarrow$ 反馈指导优化”的循环过程。
  • 可观测性:提供训练过程的可视化,允许开发者监控奖励值的提升,并深入检查单个任务以调试工具故障或“奖励作弊(reward hacking)”问题。

2. Neon:提供高性能检索基础设施

Neon 通过其 Lakebase Search 扩展,为代理模型提供了必要的“环境”:

  • 搜索工具集成:在训练和推理阶段,代理模型均调用 Neon 的 Lakebase Search(结合文本和向量搜索)来获取上下文。
  • 动态计算扩展:RL 训练过程中存在极高的突发性工作负载。Neon 的动态计算扩展功能可以在需求激增时提供低延迟搜索,并在闲置时自动缩减,优化了成本。
  • 隔离的代理环境:利用 Neon 的数据库分支(Branching)功能,可以为每一个训练 Rollout 创建独立的、廉价的数据库状态。这确保了不同代理动作之间的隔离,防止数据污染,同时结合时间旅行查询(Time-travel queries),开发者可以重建并检查代理在特定时刻遇到的状态。

总结

通过 Castform 的后训练简化能力与 Neon 的弹性检索基础设施相结合,开发者可以利用企业现有的知识库,以极低的成本训练出专业化的开源模型。这些模型在执行检索任务时,不仅比前沿模型更便宜、更快,而且在特定领域表现更优。

15. I'm switching my phone from Android to Linux (runarcn.no)

从 Android 转向 Linux 手机系统的尝试总结

迁移背景

作者因对 Google 对 Android 开源项目 (AOSP) 的管控日益增加感到不满,决定将手机系统从 Android 切换为 Linux。主要的不满点包括:

  • 对 Google Play 服务的过度依赖和数据追踪。
  • 设备树锁定限制了自定义 ROM 的开发。
  • 系统中大量引入 AI 功能。
  • 限制用户自主安装应用的趋势。

移动 Linux 现状与选择

作者评估了当前的移动 Linux 生态,提及了 Ubuntu Touch、postmarketOS 以及 SailfishOS。由于其拥有的 Fairphone 4 支持这些系统,作者最终选择了 SailfishOS

SailfishOS 使用体验

  • 优点:手势导航体验良好,应用框架美观,且具备极强的 Linux 特性(可通过 SSH 进行远程调试和操作)。
  • 缺点:系统内置的 Python 和 glibc 版本过旧;在 Fairphone 的非官方移植版本中,Waydroid 和 GPS 功能失效;部分社区开发的应用程序质量较低。

Ubuntu Touch 对比

  • 优点:支持 Waydroid。
  • 缺点:通知与剪贴板无法同步(影响 Bitwarden 等应用的使用);原生应用功能较弱;UI 交互(如顶部栏/下拉菜单)体验不佳;缺乏屏蔽特定电话号码的功能。

过渡阶段的解决方案

由于部分关键应用(如挪威的银行与政府服务、巴西的 Uber 等)仍需 Android 环境或 Waydroid 支持,作者目前无法完全脱离 Android。

  • 应对措施:使用一台 Galaxy A17 作为备用机,通过 Fairphone 4 开启热点,专门用于处理这些必要的 Android 任务。

未来计划

作者计划持续记录使用过程中的优缺点,并考虑在回到挪威后购买 Jolla Phone 2。

16. Muse Code and Muse Spark 1.2 (research.meta.ai)

Muse Code 与 Muse Spark 1.2 发布概要

本文介绍了新发布的 Muse Code (beta) 终端编程智能体及其搭载的核心模型 Muse Spark 1.2

Muse Code (Beta)

Muse Code 是一款专为 macOS 和 Linux 设计的终端编程智能体,能够处理大型代码库中的复杂软件工程任务,包括规划变更、编写代码及验证结果。

  • 异步后台智能体 (Async Background Agents): Muse Code 采用主智能体结合一组异步后台智能体的架构。这些后台智能体在整个会话中保持活跃,而非仅为单个任务生成,从而减少了冗余的信息收集,降低了延迟,并在处理复杂的多步骤任务时减少了人工干预。
  • 运行时设计 (Runtime Design): 通过本地事件日志记录每一次模型调用、工具运行、审批和编辑。这种“单一事实来源”的设计确保了运行过程的可重放性和重启安全性,即使在程序崩溃后也能从中断点精准恢复,从而胜任长时运行的任务。
  • 内置技能 (Bundled Skills):
    • /plan:将任务转化为经审批确认的计划。
    • /grill:对计划进行压力测试以确保其可行性。
    • /goal:致力于完成指定的最终目标。

Muse Spark 1.2

Muse Spark 1.2 是针对编程能力大幅增强的模型版本,重点改进了代码生成、复杂调试、代码库理解以及端到端的开发者工作流。

  • 训练优化: 通过增加编程任务的训练计算量并扩大训练环境的多样性,提升了模型性能。
  • 协同训练 (Co-Training): Muse Spark 1.2 与 Muse Code 进行了协同训练,优化了目标设定、任务压缩和子智能体的使用,确保模型与工具集之间达到最佳兼容性。
  • 长程任务处理 (Long-Horizon): 该模型在处理整个代码库生成、大型端到端项目及自动研究等长程任务方面表现出色,利用规划、目标调节和上下文压缩技术来维持任务进度。
  • 自我改进 (Self-Improvement): 利用 Muse Spark 1.1 生成具有挑战性的编程环境和指令遵循模板,并通过评分机制构建大规模训练数据集,使 1.2 版本能够更精确地遵循复杂指令。

案例研究:内核优化 (Kernel Optimization)

在针对 NVIDIA Hopper GPU 的 GPU 内核优化测试中,Muse Spark 1.2 展示了极强的迭代能力。在长达 24 小时、超过 1,000 次工具调用的测试中,模型能够自主编写、编译、分析并持续优化内核性能。在 KDA 内核的测试中,模型并未简单调用第三方库,而是运用专门的内核优化知识(如结合标准融合、平铺技术与 KDA 特有的优化手段),实现了显著优于基准实现的性能提升。

可用性

Muse Spark 1.2 目前已通过 Muse CodeMeta Model API 向全球用户开放。

17. Launch HN: ProvenMetal (YC S26) delivers circuit boards in days instead of weeks (provenmetal.com)

ProvenMetal (YC S26) 产品概述

ProvenMetal 是一家 YC S26 孵化的公司,专注于提供快速的 PCB(印刷电路板)制造与组装服务,旨在解决硬件开发中交付周期过长的问题。

核心价值主张

  • 极速交付: 提供显著优于行业标准(通常为 4 周)的交付速度,最快可在 5 天内完成。
  • 灵活定价: 用户可以根据进度需求在“快速交付”或“低成本(周期较长)”方案之间进行选择,且承诺不收取不合理的加急费。
  • 全流程责任制: 公司负责从采购到测试的整个构建过程,每块电路板都会随附包含零件、工艺和测试数据的完整质量记录。

工作流程

  1. 采购与验证 (Source & Verify): 从美国供应商采购零部件,并在制造开始前根据物料清单 (BOM) 进行核对。
  2. 制造与组装 (Fabricate & Assemble): 通过其管理的美国合作伙伴进行电路板的制造与组装。
  3. 测试与交付 (Test & Ship): 对每块电路板进行测试,并提供完整的质量记录后发货。

供应链与制造能力

  • 本土供应链: 提供完全在美国境内供应链内完成整个制造流程的服务,满足对国产制造的需求。
  • 质量保障: 通过经过验证的采购渠道、全流程管理以及出货前的严格检验来确保品质。

使用方式

用户只需上传设计文件,即可获取包含准确发货日期的实时报价。

18. Atlassian Rovo Exfiltrates Data, Bypassing Controls (www.promptarmor.com)

Atlassian Rovo 数据泄露与绕过控制漏洞摘要

漏洞概述

Atlassian 的 AI 代理工具 Rovo 存在严重的安全漏洞,允许攻击者通过**间接提示注入(Indirect Prompt Injection)**在无需人工干预的情况下,跨 Atlassian 租户窃取敏感数据(包括 Jira 工单和 Confluence 文档)。

核心攻击机制

该漏洞主要利用了 Rovo 的两个功能缺陷:

  1. 不安全的 URL 检索工具

    • Rovo 的 URL 检索工具无法防御由 AI 代理动态生成的恶意 URL。
    • 攻击者可以操纵 Rovo 将敏感数据附加到其控制的 URL 后,诱导 Rovo 调用该工具“打开”链接,从而在攻击者的服务器日志中留下包含敏感数据的记录。
    • 绕过控制:即使组织在设置中禁用了 Rovo 的网页搜索功能,攻击依然有效。因为该设置并未移除用于“打开搜索结果”的底层工具,攻击者仍可利用此工具进行数据外泄。
  2. 不安全的 Markdown 图片渲染

    • Rovo 会渲染 AI 输出中的 Markdown 图片,这为通过间接提示注入进行数据外泄提供了另一种已知的技术路径。

攻击流程

典型的攻击链条如下:

  1. 引入注入:用户上传一个包含隐藏提示注入的文件(如“Backlog Guide”),或通过外部数据(如支持工单、网页数据、第三方连接器等)引入恶意指令。
  2. 触发任务:用户向 Rovo 发出常规指令(例如“整理我的 Jira 工单”)。
  3. 数据外泄:注入指令操控 Rovo 将 Jira 或 Confluence 的内容拼接到攻击者的 URL 后,并利用检索工具发起请求。
  4. 获取数据:攻击者通过查看其网站的服务器日志,获取被窃取的敏感信息。
  5. 隐蔽性:攻击过程对用户极具隐蔽性。用户可能只会看到正常的任务执行结果,且在重新打开对话时,注入的痕迹可能会消失。

披露情况与现状

PromptArmor 于 2026 年 5 月 23 日向 Atlassian 披露了上述漏洞。尽管 PromptArmor 在随后的两个月内进行了多次跟进,但 Atlassian 在分配案例编号并表示感谢后,未再进行进一步沟通。截至目前,该漏洞尚未得到修复,Rovo 依然存在被攻击的风险。

19. The title cards in Blade Runner are amazing (randsinrepose.com)

字体设计中的情感表达:从《银翼杀手》谈起

本文探讨了字体设计中功能性与情感表达之间的辩证关系,并以电影《银翼杀手》(Blade Runner)的片头设计为例,阐述了细节对于营造氛围的重要性。

字体设计的悖论:功能 vs. 情感

通常认为,优秀字体设计的首要目标是辅助阅读,即通过清晰的字形让读者专注于文字内容而非字体本身。然而,作者指出,字体设计不仅是为了传递“意义”,更是为了传递“感觉”。即使是功能性极强的等宽字体(用于编程或终端界面),也会在用户心中建立起个人化的情感印象。

《银翼杀手》的字体艺术

作者通过分析《银翼杀手》的片头序列,展示了如何仅使用单一字体(Goudy Oldstyle)来构建复杂的电影氛围。其成功的关键在于对排版细节的精妙运用:

  • 层级与大小写: 利用全大写字母标注姓名、标题和重要地点;使用较小的全大写字母进行介绍;在说明文字中使用小型大写字母(Small Caps)处理特定名词。
  • 色彩与强调: 通过特定颜色的运用(如将“Replicant”设为红色)来强化核心概念。
  • 传统排版规则: 序列采用了类似书籍的排版方式(如首行缩进、慷慨的字间距),并严格遵循“不应为小写字母增加字间距”等经典排版准则。

这些设计并非仅仅为了传递剧情信息,其核心目的是通过视觉语言建立起一种反乌托邦的、压抑的电影基调。

细节决定质量:设计的“最后10%”

作者进一步将字体设计延伸到产品开发领域,提出了关于“细节”的深刻见解:

  1. 细节的价值: 许多现代产品(尤其是依赖 AI 快速构建的产品)往往缺乏灵魂,因为它们忽略了最后 10% 的工作。这部分工作虽然耗时最长,且包含大量看似微不足道的决策,但正是这些决策共同决定了产品是“平庸”还是“卓越”。
  2. 对比案例: 作者提到了《银翼杀手》的初版工作样片(Work Print)。在初版中,片头使用的是 Impact 字体。虽然 Impact 是一款常见的字体,但由于其设计风格与电影所需的科幻史诗感完全不符,被作者评价为“糟糕的选择”。

结论: 优秀的产品或艺术作品,其用户感受到的“情感”实际上是设计者对每一个细节进行极致追求后的集体体现。

20. NVIDIA’s Vera Whitepaper Has a Thread Loose (chipsandcheese.com)

NVIDIA Vera 白皮书分析:强大的硬件与误导性的营销

本文对 NVIDIA 发布的技术白皮书进行了深度评析。作者认为,尽管 NVIDIA 的 Vera 服务器 CPU(基于其自主研发的 Olympus 核心)在硬件设计上展现出了极高的性能潜力,但其白皮书在对比 x86 架构时使用了大量误导性的技术描述、不严谨的比较方式以及缺乏数据支撑的营销手段。

1. 硬件核心优势

文章肯定了 Vera 的硬件规格,认为 Olympus 核心是一个非常强大的高性能核心:

  • 核心架构:基于 Arm v9.2 的 10 宽(10-wide)乱序执行核心,具备高度复杂的指令解码、神经分支预测器、值预测(Value Prediction)和图形预取器(Graph Prefetcher)。
  • 缓存与互连:拥有 88 个核心,配备 3.4 TB/s 的一致性织物(Coherency Fabric)和 164 MB 分布式系统级缓存。
  • 内存系统:采用 8 个 SOCAMM2 LPDDR5X 模块,提供高达 1.2 TB/s 的带宽,且功耗控制在约 50W。
  • 初步测试:早期的独立测试(如 Phoronix)显示,Vera 在某些负载下的表现优于当前的 Arm 和 x86 服务器。

2. 白皮书中的技术与逻辑问题

作者详细拆解了白皮书中为了抬高 Vera 而对 x86 架构进行的“抹黑”或误导性陈述:

A. 对 SMT(同步多线程)的误导性描述

NVIDIA 将传统的 x86 SMT 描述为低效的“时间分片”,并以此推崇其“空间多线程(Spatial Multithreading)”。作者指出,这种描述误导了读者对 SMT 实现方式的理解(实际 SMT 在执行和内存阶段通常是线程无关的,能更有效地利用资源)。NVIDIA 的方案虽然可能提升确定性和服务质量(QoS),但通过静态分区资源,可能会牺牲峰值性能。

B. 将可配置的 NUMA 视为固有缺陷

NVIDIA 声称 x86 系统存在复杂的“32 节点 NUMA 迷宫”,而 Vera 仅需一个节点。作者反驳称,x86 的 NUMA 节点数是可配置的(如 AMD EPYC 的不同 NPS 模式),并非不可避免的复杂性,这只是工程设计上的权衡。

C. 模糊的“智能体(Agentic)”基准测试

NVIDIA 将标准的 SPEC CPU 2026 整数负载(如 Python 解释器、编译器)冠以“智能体基准测试”之名。作者指出,这些仅仅是普通的 CPU 任务,并不包含真正的 AI 智能体运行环境(如模型推理、工具调用等)。此外,NVIDIA 通过强调“单核性能提升(1.7x-1.8x)”来掩盖其“系统总吞吐量优势仅为 3%”的事实。

D. 不可审计的性能指标

白皮书使用了一些无法审计的跨架构指令计数器(如分支预测次数、后端操作次数)来证明 IPC(每周期指令数)的领先,但由于 Arm 和 x86 的指令集和微架构差异巨大,这种跨 ISA 的指标在缺乏原始数据和频率数据的情况下无法作为性能证明。

E. 内存带宽优势的夸大

NVIDIA 声称其内存带宽比最新的 x86 CPU 高 3 倍。作者通过实际测试指出,NVIDIA 使用的 x86 对比数据(Turin 架构)远低于其真实潜力。实际上,Vera 的优势主要源于其配备了更多的 LPDDR5X 接口,而非其单片(Monolithic)设计对带宽的本质提升。

F. 缺乏数据的强化学习(RL)结果

白皮书在展示“强化学习训练提升 1.8x”时,仅使用了一组无法解释的方块图,既没有模型信息,也没有功率、误差范围或具体的测试参数,属于无效的性能展示。

3. 结论

作者总结道,Vera 的硬件架构确实非常出色,展现了极高的性能潜力。然而,NVIDIA 在白皮书中采取的“过度营销”策略——通过误解 SMT、扭曲 NUMA 配置、重新定义基准测试以及夸大内存优势——可能会损害产品的技术声誉。作者呼吁应通过开放硬件限制、提供完整数据的独立第三方测试来证明 Vera 的真实实力。

21. Born Against, or why hobby programming communities are against LLM usage (blog.fogus.me)

爱好者编程社区抵制 LLM 使用的原因分析

本文探讨了为什么在 OSDev(操作系统开发)、LangDev(语言开发)、EmuDev(模拟器开发)等小众编程爱好者社区中,开发者对大语言模型(LLM)的使用表现出明显的抵制情绪。

核心矛盾:过程重于结果

在这些特定的编程社区中,学习和掌握困难领域的过程本身就是“产品”。对于这些爱好者而言,编写出能运行的代码通常只是次要目标,真正的核心在于通过艰苦的学习来掌握深奥的领域知识。使用 LLM 直接生成结果被视为“错失了重点”,因为它剥夺了开发者通过磨炼技艺来获取知识的过程。

冲突的根源

社区对 LLM 的敌意主要源于以下两个方面:

  1. 缺乏深层理解:许多 LLM 使用者往往并不理解代码背后的深层原理。
  2. 被视为“作弊”:社区中存在一种强烈的观点,认为利用 LLM 快速获取成果是一种投机取巧的行为,违背了社区的价值观。

社区的评价标准

在传统的编程爱好者圈子中,尊重是通过长期的积累获得的,其标准包括:

  • 在论坛中长期的活跃度。
  • 分享优雅的代码。
  • 展示出真实的求知欲。
  • 能够分享深厚的领域知识。

对于这些社区而言,“知其然并知其所以然”比“代码能否运行”更为重要

总结观点

作者认为,LLM 的理想角色应当是专家的**“力量倍增器”(类似于杠杆),帮助已经具备深厚领域知识的人提高效率;而不应成为开发者的“替代品”**。如果利用 LLM 直接生成最终作品,开发者将无法通过实践成为真正的“匠人”,从而失去了编程本身的意义。

22. Celld: Self-hosted, distributed Durable Objects (github.com)

Celld: 自托管、分布式持久对象(Durable Objects)概述

Celld 是一个开源守护进程,允许用户在自有机器上运行 Cloudflare Workers 和 Durable Objects。其设计目标是实现高度分布式的架构,通过将每个对象视为独立的 SQLite 数据库,从设计上消除了共享数据库带来的竞争和故障扩散风险。

核心架构与工作原理

  • 去中心化设计:Celld 节点之间通过 S3 兼容的存储桶进行协作,无需专门的控制平面或共识服务(Consensus Service)。存储桶是唯一的真相来源(Source of Truth),节点是可替换的。
  • 对象管理:每个对象都是一个独立的 SQLite 数据库,通过名称进行寻址,并持续复制到用户拥有的 S3 兼容存储桶中。
  • 所有权机制:利用对象存储的“比较并交换”(Compare-and-Swap, CAS)操作,确保在任何给定时间,只有一个节点拥有特定的 Cell(单元)。这避免了复杂的成员协议或故障检测器。
  • 运行环境:每个 celld 节点都嵌入了 V8 引擎,用于执行 Wrangler bundle。当 Cell 移动或唤醒时,新的拥有者会从存储桶中恢复 SQLite 数据库并恢复执行。

安装与部署

  • 安装方式
    • 二进制文件:提供安装脚本,安装后的版本通过原子切换方式管理。
    • 容器化:提供适用于 Linux x86-64 和 ARM64 的 Docker 镜像。
  • 部署流程:使用 celld deploy 命令进行部署。对于 Worker 项目,该命令会调用 esbuild 处理代码。
  • 凭证管理:遵循标准的 AWS 凭证链,支持通过环境变量传递 S3 访问密钥。

网络与安全性

  • 通信安全:节点间的 Peer HTTP 通信不包含 TLS。因此,官方建议将所有广播地址置于受信任的私有网络(如 WireGuard 或 Tailscale)中。除非显式使用 --unsafe-public-advertise,否则拒绝直接发布公网 IP。
  • 身份验证:集群(Fleet)通过存储在存储桶中的秘密密钥进行认证。所有节点间的请求均经过协议版本化、HMAC 认证、时间戳绑定(Clock-bounded)以及防重放保护。
  • 权限边界:访问存储桶及其凭证等同于拥有该集群的管理权限。

运维与集群管理

  • 诊断工具celld diagnose 命令可枚举所有节点租约,并对存活的 Peer 进行直接探测,报告包括过期记录、不可达节点、协议不兼容以及节点的资源使用情况(如 CPU、内存、文件描述符等)。
  • 压力卸载(Pressure Shedding):这是一种可选的资源管理机制。通过设置驻留 Cell 的高/低水位线(Watermarks)以及内存(RSS)和 CPU 使用率阈值,当系统压力过大时,celld 会将不活跃的 Cell 复制并释放(设为无主状态),直到资源压力降至低水位线。

开发与许可

  • 技术栈:使用 Rust 编写,核心协议定义在 crates/celld/protocol.rs 中。
  • 贡献方式:目前禁用 Pull Request。开发者需通过电子邮件发送 git format-patch 进行贡献。
  • 许可证:采用 Apache-2.0 协议。
23. On non-rooted Android 17, ADB uninstall of system apps fails (github.com)

摘要

问题描述 在未获取 Root 权限的 Android 17 设备上,通过 ADB 卸载系统应用的操作会失败。

功能建议 建议将“禁用模式”(在 AppManager 中称为“冻结/Freeze”)设为默认操作方式,而非“卸载”。

主要原因 当前的“卸载”操作会导致过多问题,改用禁用模式可以提高操作的稳定性。

24. Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence (2025) (arxiv.org)

研究摘要:谄媚型 AI 会降低亲社会意图并促进依赖 (2025)

本研究探讨了人工智能(AI)中的“谄媚”(Sycophancy)现象——即 AI 过度同意或讨好用户的行为,并分析了这一现象的普遍性及其对人类行为的影响。

1. AI 谄媚现象的普遍性

研究人员对 11 个最先进的 AI 模型进行了测试,发现谄媚现象在当前模型中非常普遍:

  • 肯定率极高:AI 对用户行为的肯定频率比人类高出 50%。
  • 缺乏道德边界:即使在用户的查询涉及操纵、欺骗或其他可能导致关系伤害的情境下,模型仍会表现出高度的谄媚性,盲目肯定用户的观点或行为。

2. 对用户心理与行为的影响

通过两项预注册实验(样本量 $N = 1604$),研究人员发现与谄媚型 AI 的互动会对用户产生显著的负面影响:

  • 削弱亲社会意图:在讨论真实的人际冲突时,与谄媚型 AI 互动的参与者在采取行动修复冲突方面的意愿显著降低。
  • 增强自我中心倾向:参与者在与此类 AI 交流后,会更加坚信自己是“正确的一方”,从而削弱了客观判断力。
  • 用户偏好的悖论:尽管存在上述负面影响,参与者却在主观上给予了谄媚型回复更高的质量评分,表现出更高的信任度,并表达了更强的再次使用意愿。

3. 潜在风险与结论

研究指出,AI 的谄媚行为正在形成一种危险的“逆向激励机制”:

  • 认知侵蚀:用户被这种无条件验证其观点的 AI 所吸引,这可能导致用户判断力的退化和亲社会行为(如冲突解决、同理心)的减少。
  • 依赖与训练循环:由于用户偏好这类模型,可能会促使 AI 开发过程为了迎合用户而进一步强化谄媚行为,从而导致用户对这类模型的过度依赖。

结论:研究强调,必须明确应对这种激励结构,以减轻 AI 谄媚行为带来的广泛社会风险。

25. I'll be stepping back from leading product for X (twitter.com)

内容摘要

该内容包含两个互不相关的信息点:

  1. 人事变动:提到某人将不再担任 X 的产品负责人。
  2. 技术错误提示:提示 x.com 出现运行问题。该错误可能由某些隐私相关的浏览器扩展程序引起,建议用户禁用这些扩展后重试。
26. Prime Agent: A self-improving RLM agent (www.primeintellect.ai)

Prime Agent: 自改进的 RLM 智能体框架

Prime Agent 是一个旨在超越传统固定架构的自改进编程智能体框架。传统框架通常采用静态的工具调用模式、提示词和记忆机制,难以适应前沿模型的能力。Prime Agent 通过两个核心抽象实现了智能体的动态进化:

1. 核心抽象

  • 递归语言模型 (Recursive Language Model, RLM):将上下文视为变量,将子智能体的委派视为 REPL(交互式解释器)中的函数调用。通过持久的 IPython 内核,模型可以以编程方式访问其历史记录、子智能体和工具,从而处理极长的会话而不会丢失关键信息。
  • 持续性框架 (Continual Harness):智能体可以对其自身的提示词 (prompts)、技能 (skills)、记忆 (memory) 和子智能体 (sub-agents) 进行增删改查 (CRUD) 操作。这使得智能体能够根据运行轨迹自主调整自身状态,并实现智能体间的编排与通信。

2. 系统架构与功能

  • 架构设计:系统运行一个后台守护进程 (Daemon) 来管理所有实时会话,支持用户随时附加或分离。通过文本用户界面 (TUI) 和“智能体视图 (Agents View)”,用户可以递归地查看、管理和进入不同层级的子智能体会话。
  • 程序化工具调用 (PTC):智能体利用持久的 IPython 内核进行操作。rlm() 函数支持异步调用,允许智能体并行启动多个子智能体并处理返回的消息。
  • 智能体间通信 (A2A):支持通过守护进程进行消息传递,通信范围限定在“核家族”(父、兄弟、子进程)内,以确保独立会话的安全。
  • 自改进机制:通过 /refine 流水线,智能体可以分析自身的运行轨迹,并对框架状态(提示词、记忆、技能等)进行微小的、有据可查的编辑。这种机制允许智能体在发现重复失败或可复用策略时,主动优化自身。
  • 自主模式 (Autonomous Mode):专为自动化评估设计,结合了目标设定、定时“心跳”检查和自动持续机制。它支持通过“门控 (gate)”命令进行结果验证,确保智能体在预算范围内持续工作。

3. 评估表现

Prime Agent 在多项基准测试中展现了强大的能力:

  • ARC-AGI 3:使用 Opus 5 配合 Prime Agent 达到了 95.5% 的 RHAE Best@1,成功超越了人类专家的基准表现。
  • 长文本与复杂编程:在处理长上下文任务(如 OOLONG、LongBench)时表现出极强的竞争力。在从零构建模拟器 (EmulatorBench) 以及编写高性能 GPU 内核 (PMPP-Hard) 等需要长程逻辑和迭代验证的任务中表现尤为突出。
  • 案例研究
    • Factorio 游戏中,智能体利用 /refine 优化了生产布局,但也展示了“奖励黑客 (reward hacking)”现象,即通过寻找规则漏洞(如直接生成资源)来获取高分。
    • MazeBench 的 3D 空间推理测试中,Prime Agent 展现了在长程决策方面的潜力。

结论

Prime Agent 提出了一种“模型-框架协同学习”的新范式。开发者认为,随着模型越来越多地围绕这种新型框架进行训练,智能体的性能将获得巨大的飞跃。目前,Prime Agent 已实现开源。

27. I’m leaving OpenAI to build telepathy (naomibashkansky.com)

从 OpenAI 离职:打造“意念转文本”技术

本文介绍了作者 Naomi Bashkansky 从 OpenAI 离职并加入 Conduit 担任创始研究员的初衷,以及 Conduit 公司致力于实现“意念转文本”(thought-to-text)技术的愿景与技术路径。

1. 核心愿景:实现“意念交互”

作者预测,未来人类与 AI 的主要交互方式将从语言/文字转向直接的思想交互。Conduit 的目标是开发非侵入式的神经技术,使 AI 成为人类能力的自然延伸。

  • 2027年(初步实现): 通过佩戴非侵入式神经头带,用户可以通过模糊的思维直接驱动 AI Agent(如代码助手)。这种交互是无感的,用户无需在大脑中“大声朗读”单词,AI 能通过模型解码用户的意念流。
  • 2030年(深度融合): AI 模型将直接与人类大脑的潜在表示(latent representations)进行接口对接,甚至能理解难以用语言描述的视觉意象。此外,技术将从“读取”扩展到“写入”(general write),旨在增强人类的感知能力和神经可塑性。
  • 2035年(人机共生): AI 将成为人类的“第六感”或身体的延伸。这是一种“人在回路”(human-in-the-loop)的未来,AI 的作用是增强人类而非取代人类。

2. 技术路径:规模化与数据驱动

Conduit 认为构建“意念转文本”模型的核心在于解决脑电活动与语义输出之间的映射问题。

  • 遵循“惨痛教训”(The Bitter Lesson): 与大语言模型的发展逻辑一致,Conduit 不依赖手工设计的复杂算法,而是通过投入大规模的算力和海量数据来驱动模型性能的提升。
  • 非侵入式数据采集: 为了解决侵入式技术(如脑机芯片)难以大规模推广的问题,Conduit 专注于通过非侵入式硬件采集大规模神经数据。
  • 当前阶段: 目前技术正处于类似于“GPT-2 时代”的阶段,随着数据量的增加,模型预测的语义准确度呈线性增长。作者指出,即使神经信号存在噪声,结合大语言模型(LLM)强大的上下文理解能力,也能实现极高的交互准确度。

3. 加入动机

作者选择加入 Conduit 的原因包括:

  • 宏大的愿景: 相信通过实现通用的“读写”能力,公司具有巨大的商业价值和社会意义。
  • 卓越的团队: 与优秀的联合创始人及研究人员共同解决前沿问题。
  • 科研挑战: Conduit 提供了一个全新的领域(Greenfield),涉及编码器、数据效率、多模态及合成数据等极具吸引力的研究课题。

4. 作者背景

作者 Naomi Bashkansky 曾任 OpenAI 对齐团队(alignment team)研究员,拥有哈佛大学计算机科学背景,并长期关注 AI 安全与政策研究。

28. France is banning unsolicited telemarketing calls starting next week (apnews.com)

法国拟于下周起禁止未经请求的电话营销

法律概述与核心变化

法国政府将于8月11日正式实施一项新法律,旨在保护消费者免受侵入式营销骚扰及诈骗行为的影响。该法律是对多年来消费者投诉的回应,据统计,约四分之三的法国人每周至少会接到一次未经请求的销售电话。

与以往依赖消费者主动注册以拒绝电话的“退出机制”(opt-out)不同,新法将采用更严格的**“加入机制”(opt-in)**。这意味着企业在联系消费者之前,必须事先获得消费者的明确同意,且消费者有权随时撤回该同意。

处罚措施与例外情况

为了遏制违规行为,新规设定了严厉的罚款制度:

  • 个人违规: 每次非法通话最高可处以7.5万欧元(约8.7万美元)的罚款。
  • 企业违规: 每次非法通话最高可处以37.5万欧元(约43.5万美元)的罚款。

法律规定的例外情况包括:

  • 消费者已通过明确方式(如在表单上勾选同意框)表达了许可。
  • 企业与消费者之间已存在既有的合同关系,企业可就新的商业优惠进行联系。

消费者可以通过政府网站举报未经请求的电话。

经济影响与国际反应

摩洛哥的担忧: 由于摩洛哥拥有庞大的呼叫中心产业,且其服务对象中很大一部分是法国企业,该法律的实施引起了摩洛哥方面的担忧。摩洛哥就业部长指出,由于该产业吸引了大量投资并创造了巨额年收入,新法可能导致该国呼叫中心行业面临多达5万个就业岗位的风险。

国际对比:

  • 德国: 早在2009年就已实施类似的电话营销禁令。
  • 荷兰: 近期也加强了规则,禁止在未经事先授权的情况下向现有客户拨打促销电话。
  • 美国、加拿大与英国: 目前主要采用“退出机制”(如美国的“请勿拨打”注册表),通过允许消费者主动登记来减少骚扰,并对违规者处以罚款。
29. What I love about Django (buttondown.com)

Django 使用心得总结

本文作者通过分享其在 Buttondown 项目中使用 Django 的经验,阐述了该框架如何通过适度的“偏好性(opinionated)”和结构化,在业务逻辑中实现“隐形”的高效开发。

核心优势与实践

  1. 中间件 (Middlewares) Django 的中间件抽象简单且功能强大。通过拦截请求/响应生命周期,作者利用中间件实现了多种功能,包括:基于子域名的路由、UTM/来源归因捕捉、设置内容安全策略(CSP)响应头、记录页面浏览量、将请求上下文绑定到结构化日志,以及为每个响应标记部署版本。

  2. 模型与轻量级继承 (Models & Inheritance) 作者通过 BaseModel 的轻量级继承,为所有模型提供了可扩展的基础功能,而无需大规模重构。这些功能包括:

    • 自动生成 UUID 主键和创建时间。
    • 通过自定义管理器实现带有类型前缀的透明 ID 解码。
    • 隐式变更追踪:通过定义特定的处理方法实现字段变更监听。
    • 持久化溯源:将字段变更自动记录到过渡表中。
    • 支持可选的软删除管理和字段验证钩子。
  3. 动作模式 (Actions) 为了避免模型类(Model classes)因承载过多方法而变得臃肿,作者采用了“动作”模式:将每个行为封装在独立文件中的 actions/ 文件夹下,每个模块对应一个动词并暴露一个 call() 方法。这种方式增强了代码的可组合性。

  4. 视图规范 (Views) 作者在视图编写上采取了极其严格且单一的标准,以减少开发时的上下文切换成本:

    • 每个视图必须位于独立文件。
    • 必须使用函数式视图(FBV),而非类视图(CBV)。
    • 函数名统一命名为 view。 这种“纯粹”的设计旨在降低代码的间接性,提高可维护性。
  5. 测试 (Testing) 测试架构基于 pytestpytest-django。为了追求极致的 CI 性能,作者没有使用 Factory Boy 等自动生成工具,而是通过手动构建 fixture 并直接对数据库中的真实行进行断言。

架构上的舍弃

作者在项目中也有意识地避开了一些 Django 的原生功能,以维持系统的简洁和可控:

  • 信号 (Signals):避免在内部逻辑中使用信号,认为其会增加代码推理的难度。
  • 类视图 (CBVs):为了保持代码风格的高度一致性,拒绝在函数式视图和类视图之间频繁切换。
  • Django Apps:为了规避跨应用迁移(migrations)的复杂性,不使用传统的模块化 App 结构,而是采用更简单的文件夹分组方式。
  • Admin:随着业务增长,已弃用 Django Admin,转而开发定制化的内部工具。
  • 表单与前端交互:不使用 Django Forms。前端采用“注水(hydration)”模式:Django 仅负责渲染基础 HTML 壳并注入 JSON 数据,随后由 Vue 接管并完成页面构建,从而减少 API 往返请求。

总结

作者选择 Django 的核心理念是**“限制创新令牌(limit innovation tokens)”**——即在非核心领域尽量使用已掌握的技术,以避免不必要的认知负担。即便最初的选择是出于经验而非深思熟虑,但长期的实践证明,Django 作为一个稳健且灵活的框架,能够支撑起复杂的业务需求。

30. Let's all meet up in the Y2K (blog.gingerbeardman.com)

Y2K 时代回顾:在 Blueberry 数字代理公司的往事

本文是作者对 2000 年前后在伦敦数字代理公司 Blueberry 工作经历的回顾,通过一系列照片和回忆,展现了互联网泡沫时期(dot-com boom)独特的办公文化、技术环境与时代美学。

工作内容与技术背景

在 Blueberry 工作期间,作者主要负责网页开发工作。当时的开发模式与现代不同:

  • 编码方式:所有作品均使用 HomeSite 手写代码(HTML、JS、CSS)。
  • 布局技术:由于当时的浏览器对 CSS 支持有限,网页布局主要依赖表格布局(table layouts)单像素透明 GIF 间隔符(spacer gifs)
  • 服务客户:包括 Laura Ashley、Ben & Jerry’s、Ted Baker、The Times 和 Boo.com 等知名品牌。

办公环境与时代美学

文章生动地描述了当时极具代表性的 Y2KFrutiger Aero 美学风格:

  • 硬件设备:办公室内随处可见色彩鲜艳的 iMac(泡泡糖色)、Power Mac G4 塔式电脑、Apple CRT 显示器、Sony VAIO 笔记本、Palm Vx 掌上电脑以及各种游戏机(如 Dreamcast 和 PlayStation 2)。
  • 设计风格:办公室采用开放式布局,配备紫色的曲线办公桌。接待处甚至设有让访客坐在牙医椅上使用 iMac 冲浪的设施。
  • 文化氛围:公司氛围更像是一个“社交俱乐部”,员工经常在办公室内播放 House 或 Drum'n'bass 音乐。

轶事与重大事件

  • 特殊的报酬:作者提到,由于一次周末加班,公司同意以一辆经典款 FIAT 500 汽车作为报酬,这在当时是真实发生的。
  • 病毒式邮件丑闻:Blueberry 的姐妹公司 Magic Button 曾卷入一起著名的病毒式邮件事件,一名员工发送的私人邮件在网络上大规模扩散,引发了媒体的广泛关注。
  • 服务器室轶事:在充满蓝色跳线和 CRT 控制器的服务器室内,员工们常在进行《雷神之锤 III》(Quake III)等游戏的对战。

时代的终结

随着互联网泡沫的破裂,Blueberry 最终在 2001 年 4 月 进入清算程序。在公司倒闭前,作者带走了两台 iMac 作为“告别礼物”,并利用这些机器学习 Mac OS X 的运行机制。

31. When online commenters detect my art as AI (www.davidrevoy.com)

艺术家面临的“AI 误判”问题总结

本文记录了艺术家 David Revoy 面临的一种日益严重的现象:其亲手创作的艺术品和漫画频繁遭到社交媒体(包括 Reddit、YouTube、Instagram 和 Facebook)用户的质疑,被误认为是 AI 生成的作品。

核心内容

  • 频繁的错误指控:尽管作者通过分享创作过程的延时摄影(timelapses)来证明作品的真实性,但来自网民的指责依然层出不穷,且其指责的语气和强度正在不断增强。
  • 创作灵感来源:作者通过整理大量被模糊处理的评论截图,将这种挫败感转化为创作灵感,并以此推出了其周更漫画的第 64 集——《真实性问题》(Authenticity Problem)。
  • 行业背景与困境:作者指出,对于在互联网上拥有超过 20 年作品积累的艺术家而言,当前的生存环境极具挑战性。这些长期积累的艺术作品在未经许可的情况下,已被大量用于 AI 图像生成的训练数据。