2026-08-21

20 篇热帖

1. Aaron Swartz was prosecuted for scraping, while Meta does it without consequence (blog.curiousquail.com)

数据抓取行为中的法律双重标准:Aaron Swartz 与 Meta 的对比

本文通过对比 Aaron Swartz 与 Meta 在数据获取行为中所面临的法律后果,批判了当前社会在对待数据抓取和版权问题上的双重标准。

Aaron Swartz 案例

RSS 协议的共同创建者 Aaron Swartz 曾因从 JSTOR 下载约 70GB 的学术文章而遭到法律系统的严厉起诉。他面临的指控极其沉重,包括高达 35 年的监禁、100 万美元的罚款以及资产没收。这种极端的法律压力最终导致 Swartz 选择自杀。文章指出,Swartz 的行为初衷是为了知识的传播与存档。

Meta 案例

相比之下,Meta(原 Facebook)被指控通过 BT 下载了超过 80TB 的盗版书籍,用于训练其人工智能(AI)模型。尽管 Meta 目前正面临出版商的版权诉讼,但作者认为,其面临的后果可能仅仅是象征性的经济处罚,而其 AI 模型仍将继续为其创造巨额利润。与 Swartz 不同,Meta 的行为旨在开发并利用专有技术牟取商业利益。

核心观点

文章通过这两个案例的对比,揭示了法律在处理个人行为与科技巨头行为时的显著差异:

  • 目的差异:Swartz 旨在促进知识的公开与存档,而 Meta 旨在通过利用版权内容来驱动商业利润。
  • 后果差异:法律对致力于知识传播的个人施加了毁灭性的惩罚,而对利用版权数据进行盈利的科技巨头则表现出极高的容忍度。
2. AI companies destroy physical books – let's scan rare books before it's too late (annas-archive.gl)

AI 公司销毁实体书的行为及其对知识保存的威胁

AI 公司的破坏性行为与动机

根据 Anna’s Archive 的报告,多家 AI 公司正通过中间人大量收购二手书籍,在将其数字化用于模型训练后随即销毁。其中,Anthropic 的“Project Panama”项目被曝光,该公司投入数千万美元购买并扫描数百万册纸质书,以获取 2022 年前未经机器处理的原始训练数据,随后将这些书籍全部销毁。

这种销毁行为背后的主要动机包括:

  1. 防止竞争:确保竞争对手无法扫描并使用这些书籍进行训练。
  2. 规避法律风险:通过物理销毁减少潜在的版权争议。
  3. 降低成本:销毁书籍的成本低于进行高质量、无损的长期保存。

知识垄断与文明风险

这种行为导致了严重的后果:知识正被永久地垄断在私有公司的服务器中。虽然 AI 承诺让知识更易获取,但其手段却在拆解人类知识最坚实的物理载体。

此外,文章指出了一项紧迫的风险:随着 AI 生成内容逐渐占据互联网内容的半数以上,如果人类最后的一批纸质知识也被 AI 吸收并销毁,互联网将陷入由 AI 自身语言构成的循环,人类文明的真实记忆可能面临消失的危险。

Anna’s Archive 的行动呼吁

为了对抗这种知识垄断和文化遗产的流失,Anna’s Archive 正在发起全球志愿行动,旨在建立一个“数字亚历山大图书馆”,以保存人类文明的记忆。

行动重点:

  • 志愿者任务:呼吁全球志愿者扫描并上传各类材料,包括书籍、期刊、报纸、杂志、古籍及各类稀有文献。
  • 激励与支持
    • 对于小规模的扫描与上传,提供荣誉认可及 Anna’s Archive 的终身会员资格。
    • 对于大规模的扫描任务,可以提供扫描费用的报销及其他奖励。

核心愿景: Anna’s Archive 的目标是在出版商完全封锁知识、AI 公司彻底销毁书籍以及互联网被 AI 生成内容淹没之前,尽可能完成全球出版物的数字化存档,从而打破知识垄断,确保后代能够自由获取人类文明的财富。

3. The August 17 outage, and the work ahead (github.blog)

GitHub 8月17日服务中断事件总结与后续工作计划

事件概述

2026年8月17日,GitHub 遭遇了持续 7 小时 47 分钟的服务中断。此次故障影响了包括 github.com、身份验证、GitHub Actions、API、拉取请求(Pull Requests)、Issue 以及 Copilot 在内的多项核心服务。这是 GitHub 在 8 月份发生的第二次重大故障(此前在 8 月 6 日发生了 Actions 故障)。

原因分析

调查显示,此次中断的核心原因是容量故障,而非代码或配置变更:

  • 直接诱因:当流量达到新的峰值时,位于美国中部数据中心的一个关键基础设施组件未能实现有效扩容。
  • 连锁反应:由此产生的容量压力蔓延至整个系统,导致身份验证失败并中断了多项服务。
  • 恢复挑战:在恢复过程中,部分 Copilot 服务触发了客户端的重试循环(retry loop),产生了额外的流量压力,团队必须先缓解这种行为才能安全地恢复流量。
  • 背景因素:GitHub 的业务负载增长迅速,月提交量(commits)已从 4 月份的 14 亿增长至 29 亿。

已采取措施与未来规划

为了提高系统的可靠性,GitHub 正在围绕增加容量、提高效率和消除架构瓶颈三个重点方向进行工作。

1. 基础设施与扩容

  • 硬件投入:已新增超过 300 万个 CPU 核心、120 PB 高速存储以及显著的网络容量。
  • 云端迁移:加速向 Azure 迁移。目前 Azure 已承载约 58% 的平台负载及 50% 的 Git 操作(此前 5 月份仅为 12%)。
  • 架构升级:正在开发一种新的架构,旨在使读取容量随读取者数量线性增长,从而支持超大规模的单体仓库(monorepos)。

2. 运维与稳定性工程

  • 隔离与解耦:正在隔离关键系统并消除系统间的共享依赖,以降低故障发生的概率并限制故障的影响范围。
  • 流程优化:投入更多资源用于加强测试、优化发布流程、提升可观测性和改进告警机制。
  • 针对性改进(基于 8 月 6 日及 17 日事件)
    • 防止重试风暴:在服务间交互中实施统一的重试限制、重试预算和可变超时机制,以防止级联负载压力。
    • 优化告警机制:重新审查低优先级 CPU 和内存告警,以便更早识别可能在流量激增期间失效的组件。

结论

GitHub 承认目前的运维实践未能跟上业务增长的步伐。公司承诺将通过提升平台的扩展性和可靠性,来履行对开发者的服务承诺并重新赢得社区的信任。

4. Watching TikTok and Instagram deactivates the cognitive control network: Study (www.rathbiotaclan.com)

观看短视频会抑制大脑认知控制网络:研究综述

浙江大学近期发表于《NeuroImage》(2026年1月)的一项研究表明,观看令人愉悦的短视频(如 TikTok 或 Instagram 上的内容)会暂时抑制大脑中负责认知控制的区域。

研究背景与方法

认知控制网络通过平衡即时愉悦与长期目标来帮助个体做出决策,其功能障碍与抑郁、焦虑、ADHD 及成瘾行为密切相关。短视频平台通过算法驱动的连续、低努力消费模式,可能对这一系统产生影响。

研究团队通过功能性磁共振成像(fMRI)结合质子磁共振波谱(¹H-MRS)技术,对 56 名年轻受试者进行了实验。受试者在 MRI 扫描仪内观看不同类别的短视频,研究人员根据受试者的观看行为将视频分为“喜欢”(完整看完)和“不喜欢”(观看过半前跳过)两类。

核心研究发现

1. 认知控制区域的去激活

研究发现,当受试者观看“喜欢”的视频时,大脑认知控制网络的核心区域——背侧前扣带回 (dACC)背外侧前额叶皮层 (dlPFC) 表现出显著的活动下降(去激活)。

  • 对比分析:在观看“不喜欢”的视频时,dlPFC 仍表现出一定的抑制,但程度远低于“喜欢”视频;而 dACC 的活动则保持在基线水平附近。
  • 对照组:作为控制区域的视觉皮层在观看视频时均表现出活跃,证明这种去激活现象是认知控制区域特有的,而非由于观看视频产生的普遍效应。

2. 神经化学因素的影响

研究进一步探讨了神经递质对这种抑制程度差异的影响:

  • 谷氨酸 (Glutamate):受试者 dACC 的静息态谷氨酸浓度越高,在观看视频时 dACC 和 dlPFC 的活动受抑制程度就越小。
  • GABA:GABA 浓度与视觉皮层的激活相关,但与 dACC 或 dlPFC 的活动没有显著关系。

3. 功能连接性

在观看视频期间,dACC 与 dlPFC 之间的功能连接性高于基线,且在观看“喜欢”的视频时,这种连接性的增强更为显著。研究者认为,这种增强可能反映了两个区域的共同调节,而非传统意义上的高强度冲突驱动。

研究解释与意义

研究人员强调,这种脑区去激活并不代表认知能力的受损,而可能是一种“适应性转变”。这种模式反映了大脑从高强度的监控任务转向了低努力、自动化的处理模式,类似于观看电影或玩游戏时产生的“心流”(flow)状态。

研究局限性

作者在文中列出了以下局限性:

  • 测量范围有限:仅测量了 dACC 的神经化学成分,未涉及 dlPFC。
  • 缺乏成瘾评估:未通过临床量表评估受试者的短视频使用习惯或成瘾程度。
  • 样本局限:样本仅限于年轻健康的成年人,结果可能无法推广至其他年龄段。
  • 因果关系不明:研究采用相关性设计,无法确定谷氨酸水平与脑部活动抑制之间的因果关系。
  • 短期观察:研究仅捕捉了单次实验结果,无法得知长期观看短视频是否会对认知功能产生持续性影响。
5. Japan tried to build an operating system for the world, the US intervened (www.xda-developers.com)

日本 TRON 项目:一个被美国干预而折戟的桌面系统,与一个无处不在的嵌入式帝国

项目背景与技术架构

TRON 项目(The Real-time Operating system Nucleus)由东京大学研究员坂村健于 1984 年发起。这是一个极具雄心的日本国家级技术战略,旨在构建一套从微控制器、个人电脑到电信交换机的全栈式、垂直集成的计算架构。

该项目包含五个子架构:

  • ITRON:用于嵌入式实时系统。
  • BTRON:用于个人电脑桌面系统。
  • CTRON:用于大型机和电信交换。
  • MTRON:用于跨系统协调。
  • STRON:实时内核的硬件实现。

TRON 不仅设计了操作系统,还设计了配套的 TRON VLSI CPU、专门的键盘布局以及字符编码系统 TRON Code。TRON Code 支持多平面字符切换,理论容量达 150 万字符,在处理中日韩(CJK)字符及罕见历史字符方面,其能力在当时远超 Unicode。

BTRON:超前的超媒体文档模型

BTRON 的设计理念在 20 世纪 80 年代极具前瞻性,其核心思想是将用户可见的基本单元从“文件”或“应用程序”转变为“带类型的文档部分”(typed document part)。

  • 文档驱动而非文件驱动:文档由不同类型的“部分”组成(如文字、表格、图像),各部分通过“带类型的链接”连接。应用程序不再是文件的拥有者,而是特定数据类型的处理器。
  • 文件系统模型:采用“实实体/伪实体”(real-body/pseudo-body)模型,以有向图而非传统的树状目录结构管理数据。这允许文件在不重复占用的情况下存在于多个位置,实现了极高的互操作性。 这种高度结构化的数据交换和文档集成理念,与数十年后出现的现代知识管理工具(如 Obsidian、Roam)不谋而合。

美国干预与 BTRON 的陨落

尽管技术领先,但 BTRON 的推广在 1989 年遭遇了重创。当时,美国贸易代表办公室(USTR)在年度贸易壁垒报告中将 TRON 列为“不公平贸易壁垒”,指出日本政府在教育电脑和电信网络采购中通过支持 TRON 来排挤美国供应商。

虽然美国并未实施实质性制裁,但该报告对 TRON 造成了严重的声誉打击。日本制造商担心与 TRON 关联会影响其在美国市场的业务,从而纷纷撤回对 BTRON 的开发支持。

此外,关于 BTRON 的失败还存在一种争议性的说法:软银创始人孙正义可能利用了这一贸易压力来破坏 BTRON。据称,孙正义当时正通过进口美国软件来建立业务,若 TRON 成为日本学校的标准,将直接冲击其商业利益。项目创始人坂村健本人也曾暗示,TRON 的破坏者并非美国公司,而是利用美国贸易程序进行名誉打击的日本人。

ITRON:隐形的全球基础设施

虽然 BTRON 在桌面市场失败了,但其嵌入式分支 ITRON 却取得了巨大的成功。

由于 ITRON 具备小巧、实时、确定性强且免版税的特点,它在无需图形界面的嵌入式领域迅速普及。它被广泛应用于:

  • 数码相机(如开启数码相机革命的 Casio QV-10)。
  • 汽车控制单元(如丰田的发动机控制系统)。
  • 移动电话、家电及工业自动化设备。

据统计,全球约 60% 的嵌入式设备仍在使用基于 TRON 的操作系统。ITRON 后来通过与 Java 的结合(JTRON),进一步扩展了其在数亿台设备中的应用规模。如今,TRON 已成为 IEEE 标准,其技术遗产虽在桌面端不可见,却作为全球数字基础设施的重要基石,运行在无数人们难以察觉的设备之中。

6. Show HN: Huzzah – a novel approach to coding with AI (www.danielvaughn.dev)

Huzzah:一种全新的 AI 编程范式

Huzzah 是一个实验性的代码编辑器,旨在解决当前 AI 编程助手(Coding Agents)在开发流程中的核心痛点,并提出了一种全新的开发范式。

当前 AI 编程工具的局限性

作者指出,传统的基于对话的 AI 编程工具存在以下三个主要问题:

  1. 人类意图缺失:Prompt(提示词)通常是瞬时的,对话结束后,人类的核心意图往往没有可靠的记录,导致难以追踪设计初衷。
  2. 指令效率低下:现有的 AI 对话多为“命令式”(Imperative),需要通过冗长的步骤描述变更过程,这不仅耗费大量 Token,也效率低下。
  3. 信息密度不足:自然语言包含大量社交性辞令,而非纯粹的信息,将其作为机器指令显得冗长且繁琐。

Huzzah 的核心理念

Huzzah 试图通过改变 Prompt 的性质来解决上述问题。其核心转变如下:

特性 传统 AI 编程助手 Huzzah
形式 长篇自然语言 伪代码 (Pseudocode)
模式 命令式 (Imperative) 声明式 (Declarative)
生命周期 瞬时性 (Transient) 持久化 (Persistent)

工作流程与实现

在 Huzzah 中,开发者的工作流不再是与聊天框对话,而是编写并维护伪代码文件(.hz 文件):

  1. 编写伪代码:开发者在 .hz 文件中编写简洁的伪代码来表达逻辑意图(例如:循环逻辑、数据结构定义、函数功能描述)。
  2. 自动生成:Huzzah 根据伪代码自动生成实际的可执行源代码。
  3. 增量更新:当需要修改功能时,开发者只需更新伪代码文件。Huzzah 会捕获伪代码的变化(Diff),并将其作为 Prompt 引导 LLM 重新生成受影响的源代码。

主要优势

  • 设计导向:编写伪代码的过程更接近于软件架构设计,能更好地引导开发者思考代码的形状。
  • 天然文档:持久化的伪代码本身就是一份高可读性的开发文档,记录了人类的真实意图。
  • 简洁高效:伪代码比自然语言更精炼,减少了 Token 消耗。
  • 跨语言潜力:由于伪代码是抽象的,理论上可以作为基础,生成针对不同编程语言或环境的代码。

局限性与挑战

尽管具有潜力,但 Huzzah 目前仍处于实验阶段,存在以下局限:

  • 规模化问题:在大规模项目中的表现尚不明确。
  • 适用场景:更适合从零开始的新项目(Greenfield),而非维护复杂的现有代码库。
  • 知识门槛:开发者需要具备一定的领域专业知识才能写出有效的伪代码。
  • 技术挑战:处理跨文件依赖以及缺乏 LSP(语言服务协议)等 IDE 特性仍是难题。
7. Why aren't smart people happier? (2022) (www.experimental-history.com)

为什么聪明人并不一定更快乐?

本文探讨了一个心理学上的悖论:既然智力被定义为解决问题、规划和学习的能力,为什么拥有高智商的人往往并不比普通人更幸福?

核心矛盾:智力与幸福感的脱节

尽管智力在预测学业成就和职业发展方面具有很强的能力,但多项元分析和大规模研究(如英国的全国性研究及通用社会调查数据)表明,智力与幸福感之间并没有显著的正相关关系。在某些情况下,高智商人群的幸福感甚至略低于平均水平。

问题的根源:对“智力”定义的误解

作者认为,问题的关键在于查尔斯·斯皮尔曼(Charles Spearman)提出的“通用智力”理论。斯皮尔曼观察到,学生在不同学科(如数学和法语)的表现往往具有相关性,并据此认为存在一种深层的通用心理能力。

然而,作者认为斯皮尔曼的结论在解释力上存在偏差。当前的智力测试实际上衡量的是一种特定类型的解决问题能力,即**“定义明确的问题”**。

两种问题的区分

作者将人类面临的问题分为两类:

  1. 定义明确的问题 (Well-defined problems)

    • 特征:变量关系稳定、问题与答案明确、边界清晰、过程可重复。
    • 示例:数学题、逻辑推理、棋类游戏、标准化测试(如匹配同义词、计算面积)。
    • 现状:智力测试和人工智能(AI)在这一领域表现卓越。
  2. 定义模糊的问题 (Poorly defined problems)

    • 特征:规则不稳定、边界模糊、不可重复、答案高度主观。
    • 示例:如何获得幸福、如何建立长久的关系、如何应对养老、如何过上理想的生活。
    • 现状:这类问题需要的是“智慧”(Wisdom)或对复杂现实的洞察力,而非单纯的逻辑运算。

结论与启示

  • 技能错位:IQ测试衡量的是解决“定义明确问题”的能力,而“如何生活”是一个“定义模糊的问题”。擅长解决前者并不意味着能够解决后者。
  • 人工智能的局限:AI在处理大规模数据和规则明确的任务(如预测蛋白质折叠、下棋)上具有统治力,但在面对缺乏明确定义和规则的“人类问题”时,依然无法胜任。
  • 社会价值的失衡:现代社会过度推崇解决“定义明确问题”的能力(如学术成就、职业技能),却忽视了处理“定义模糊问题”的能力(如生活智慧、情感调节)。

作者最后指出,如果想要获得真正的幸福,人们不应仅仅致力于通过优化和成就来解决那些“定义明确”的琐事,而应学习如何应对那些关于生命意义和生活质量的、定义模糊的终极挑战。

8. Consumer Rights Wiki (consumerrights.wiki)

Consumer Rights Wiki 概览

本文档概述了 Consumer Rights Wiki 的最新更新动态以及其提供的分类消费者工具资源。

维基百科更新与功能

Consumer Rights Wiki 通过持续的系统升级,不断优化编辑体验、提升安全性并增强社区协作能力。

编辑与用户功能

  • 反馈机制:为每篇文章增加了“提供反馈”按钮,反馈内容会发送至 Discord 频道,并同步至文章的讨论页。
  • 个人影响力面板:用户可在个人页面开启“Your impact”面板,查看总编辑量、最后编辑时间、最长编辑连续天数、60天活跃图表以及所编辑文章的浏览量。
  • 隐私与安全
    • 引入了匿名编辑的临时账户机制,隐藏编辑者的 IP 地址(后端仍保留 IP 以供管理)。
    • 增加了退出登录的确认提示,防止误操作。
    • 实施了后端反垃圾邮件功能,并限制了非确认用户编辑模板的权限。
  • 技术升级
    • 升级至 MediaWiki 1.46 版本,提升了性能与安全性。
    • 支持上传 .odt.ods 文件。
    • 启用了 InstantCommons,允许直接在文章中使用 Wikimedia Commons 的媒体文件。

管理与维护功能

  • 管理员工具:新增了“封锁模式”(Lockdown mode),可临时禁用账号注册及非确认用户的编辑权限;增加了批量回滚(Mass rollback)功能,方便管理员同时撤销单一用户的多项编辑。
  • 奖励系统:管理人员可以通过特定界面手动创建并授予用户奖励,奖励将显示在用户页面底部。

社区与项目

  • 新项目:推出了 Project Laws(旨在收集全球消费者权利相关法律)和 Project Maintain(旨在整理维基日常维护任务)。
  • 社区互动:加强了 Discord 与 Zulip 的频道桥接;定期举办每月一次的 Zoom 社区交流活动。

消费者工具分类汇总

维基提供了一系列经过分类的实用工具,旨在帮助用户保护自身权益:

  • 广告与追踪拦截:包括 Pi-hole、uBlock Origin 及 Adnauseum。
  • 反诈骗资源:用于检查信息泄露(Have I Been Pwned)、金融投诉(CFPB)及恶意软件扫描(VirusTotal, Triage)。
  • 网页存档工具:涵盖 Wayback Machine、Ghost Archive、SingleFile 及针对 YouTube 视频的 PreserveTube 等。
  • 企业问责与产品召回:提供 BBB 投诉查询、美国 SaferProducts.gov、FDA 召回数据库及欧盟 Safety Gate。
  • 法律与投诉:包括 Consumer Reports(产品评测)、Ripoff Report(投诉数据库)及 ClassAction.org(集体诉讼查询)。
  • 维修与开源设计:如 iFixit 维修指南和 Open Source Ecology 设计。
  • 价格与产品透明度:针对 Amazon 的价格追踪工具,如 CamelCamelCamel 和 Keepa。
  • 隐私与监控保护:用于退出数据经纪人名单(SimpleOptOut, EasyOptOuts)及分析 Android 应用隐私风险(Exodus Privacy)。
  • 订阅与暗黑模式追踪
    • 订阅管理:Trim。
    • 服务条款分析:Terms of Service; Didn't Read (TOSDR) 和 PrivacySpy。
    • 识别欺骗性设计:Deceptive Design 及相关的 Dark Pattern Games。
    • 注:部分服务为付费订阅制。
9. I should have loved biology (2020) (jsomers.net)

文章摘要:我本该热爱生物学 (I should have loved biology)

本文由 James Somers 撰写,探讨了生物学教育的现状、生物学的本质及其与计算机科学的内在联系,并对未来的生物学学习工具提出了愿景。

1. 生物学教育的缺失

作者指出,传统的生物学教育往往将科学简化为枯燥的名称、化学式和结论的堆砌(如高尔基体、克雷伯斯循环等),却忽略了生物学背后的“探索感”和令人惊叹的本质。教材往往只给出结论,却不解释科学家是如何通过实验(如 Oswald Avery 发现遗传物质是核酸而非蛋白质的过程)得出这些结论的。这种缺乏问题导向的教学方式,削弱了学科的魅力。

2. 生物学作为一种“程序”

作者受 Douglas Hofstadter 的影响,将细胞视为“递归自修改的程序”。他认为,从 DNA 到 RNA 再到蛋白质的表达过程,非常类似于一种复杂的 Lisp 程序,其中源代码包含了地球生命所需的所有指令。这种视角将生物学从单纯的生物事实提升到了信息处理和逻辑架构的高度。

3. 物理本质:结构决定功能

作者强调,生物学的核心在于“结构与功能的耦合”。生命活动并非抽象的流程图,而是基于物理实体的相互作用:

  • 形状与交互:蛋白质的形状决定了其功能,分子间的相互作用如同“锁与钥匙”。
  • 动态运动:细胞内是一个极度拥挤且快速变化的环境,分子的运动主要受随机扩散支配。
  • 物理控制:基因表达的调节(如转录)并非抽象开关,而是物理上的可及性问题(如 DNA 缠绕在组蛋白上的松紧程度)。

4. 方法论的重要性

对于学习者而言,理解生物学的“方法论”比死记硬背单个事实更为重要。作者提到,现代生物学的研究高度依赖于一系列标准化的技术手段,如:

  • RNA 测序 (RNA-seq):捕捉细胞在特定时刻的表达状态。
  • 蛋白质印迹法 (Western blot):检测特定蛋白质的存在。
  • 流式细胞术 (Flow cytometry):对细胞进行分类和计数。 掌握这些方法是理解科学论文和建立生物学知识框架的基础。

5. 对未来学习工具的愿景

作者认为,由于生物学具有极高的复杂性和分形特征(类似计算机系统中的全局可变状态),直观的视觉化工具对于理解至关重要。他提出了以下需求:

  • 易用的可视化与协作工具:开发类似于 Adobe Illustrator 或 BioRender 的软件,让研究者能更轻松地绘制复杂的生物过程,并支持像维基百科一样的协作编辑。
  • 交互式模拟:呼吁开发类似于 Minecraft 或物理模拟器的工具,让学习者可以通过交互式、三维的模型来“玩”生物学,从而在直观的感官体验中理解微观世界的运作机制。

核心观点总结

生物学不应被视为死记硬背的学科,而应被视为一门关于物理结构、信息程序和实验方法的复杂科学。通过建立物理直觉和掌握研究方法,学习者才能真正领略生命的奥秘。

10. DeepSeek-v4-flash-vision-exp (api-docs.deepseek.com)

DeepSeek-v4-flash-vision-exp 模型技术文档摘要

概述

deepseek-v4-flash-vision-exp 是一个多模态视觉模型,支持在文本输入的同时处理图像。该模型能够执行描述图片、读取截图文字、分析图表等任务。支持的图像格式包括 JPEG、PNG、GIF 和 WebP(通过文件实际内容检测格式)。

图像输入方式

模型支持三种图像提供方式,均采用 OpenAI 兼容的 Chat Completions 格式(content 为块数组):

  1. Base64 编码图像(内联):将图像编码为 data: URL 直接嵌入请求中。适用于本地文件,但需注意编码后的数据计入 48 MiB 的请求体限制中。
  2. 外部图像 URL:提供公开可访问的 http(s) 链接。要求 URL 长度不超过 8192 字符,图像文件不超过 32 MiB,且下载必须在 60 秒内完成。
  3. Files API 引用:通过 Files API 上传图像后,在请求中通过 file_id 进行引用。这是复用图像或处理大文件的最佳选择,单图支持最高 64 MiB,且不受 32 MiB 的单图限制。

图像处理细节

细节级别控制 (detail)

用户可以通过 detail 字段调整图像处理方式:

  • low:图像将被降采样至 512×512,处理速度更快且成本更低,适用于对细节要求不高的场景。
  • high / original / auto:保持原始分辨率(auto 目前等同于 original)。

Token 使用量

图像会根据尺寸自动缩放:

  • 小于约 384×384 的图像会按比例放大。
  • 较大的图像会按比例缩小,使总像素数接近 800×800
  • 由于自动缩放机制,每张图像的 Token 消耗上限约为 384 个。

技术限制汇总

项目 限制值
支持格式 JPEG, PNG, GIF, WebP
请求体最大容量 48 MiB
单张图像最大尺寸 (Base64 / URL) 32 MiB
单张图像最大尺寸 (Files API) 64 MiB
单次请求最大图像数 600 张
图像最大维度 每边 8192 px (若请求包含 $\ge$ 15 张图像,则降至 4096 px)

使用限制与注意事项

  • 消息角色限制:图像仅允许出现在 user 消息中。在 systemassistant 消息中使用图像会导致 400 错误。
  • 模型限制:仅限指定的视觉模型支持图像,其他模型将返回错误。
  • API 兼容性
    • Anthropic API:支持通过 /messages 端点发送图像,使用 image 块及 source 对象(支持 base64urlfile 类型)。
    • Responses API:通过 input_image 部分携带图像,支持 detail 字段控制。
11. Ox Alpha (openrouter.ai)

摘要

由于提供的正文内容为空(仅包含标题“Ox Alpha”),无法提取关键信息或生成摘要。

12. Copyright does not protect AI-generated content in EU (mathstodon.xyz)

欧盟版权法不保护纯 AI 生成内容

在欧盟,完全由人工智能(AI)生成的作品不受版权保护,因为欧盟的版权法建立在严格的“以人为本”原则之上。

核心观点

  • 版权与责任的区别:专家 Daniel J. Gervais 指出,如果用户在由 ChatGPT 或 Claude 等工具生成的内容上署名,这种行为仅被视为一种“来源标记”,意味着用户愿意为该内容承担法律责任,但这并不意味着用户拥有该内容的版权。
  • 创造性贡献的认定标准:慕尼黑地方法院的判例显示,AI 生成的标志(Logo)不享有版权保护。法律认定,仅仅通过输入提示词(Prompting)或在 AI 提供的多个选项中进行筛选,并不足以构成法律意义上的人类创造性贡献。
  • 对商业的影响:对于企业而言,这一法律现状具有双重性。由于纯 AI 生成的内容难以获得排他性的法律保护,这会对企业的品牌建设和内容策略产生深远影响。
13. AI companies destroy physical books – let's scan rare books before it's too late (annas-archive.pk)

AI 公司销毁实体书的行为及其对知识保存的威胁

AI 公司的破坏性行为与动机

根据 Anna’s Archive 的报告,多家 AI 公司正通过中间人大量收购二手书籍,在将其数字化用于模型训练后随即销毁。其中,Anthropic 的“Project Panama”项目被曝光,该公司投入数千万美元购买并扫描数百万册纸质书,以获取 2022 年前未经机器处理的原始训练数据,随后将这些书籍全部销毁。

这种销毁行为背后的主要动机包括:

  1. 防止竞争:确保竞争对手无法扫描并使用这些书籍进行训练。
  2. 规避法律风险:通过物理销毁减少潜在的版权争议。
  3. 降低成本:销毁书籍的成本低于进行高质量、无损的长期保存。

知识垄断与文明风险

这种行为导致了严重的后果:知识正被永久地垄断在私有公司的服务器中。虽然 AI 承诺让知识更易获取,但其手段却在拆解人类知识最坚实的物理载体。

此外,文章指出了一项紧迫的风险:随着 AI 生成内容逐渐占据互联网内容的半数以上,如果人类最后的一批纸质知识也被 AI 吸收并销毁,互联网将陷入由 AI 自身语言构成的循环,人类文明的真实记忆可能面临消失的危险。

Anna’s Archive 的行动呼吁

为了对抗这种知识垄断和文化遗产的流失,Anna’s Archive 正在发起全球志愿行动,旨在建立一个“数字亚历山大图书馆”,以保存人类文明的记忆。

行动重点:

  • 志愿者任务:呼吁全球志愿者扫描并上传各类材料,包括书籍、期刊、报纸、杂志、古籍及各类稀有文献。
  • 激励与支持
    • 对于小规模的扫描与上传,提供荣誉认可及 Anna’s Archive 的终身会员资格。
    • 对于大规模的扫描任务,可以提供扫描费用的报销及其他奖励。

核心愿景: Anna’s Archive 的目标是在出版商完全封锁知识、AI 公司彻底销毁书籍以及互联网被 AI 生成内容淹没之前,尽可能完成全球出版物的数字化存档,从而打破知识垄断,确保后代能够自由获取人类文明的财富。

14. Stop eating Lady Gaga's Oreos (www.experimental-history.com)

文章总结:停止食用 Lady Gaga 的奥利奥

这篇文章通过对比 20 世纪 90 年代与当下的文化现象,探讨了“商业化”与“艺术完整性”之间关系的深刻转变,以及为何现代社会对明星的过度商业行为表现出极高的容忍度。

1. 时代的变迁:从“出卖灵魂”到“过度商业化”

  • 90 年代的反消费主义: 在 1990 年代,艺术完整性与商业成功被视为对立面。文章以 Pearl Jam 乐队为例,他们在走红后拒绝拍摄音乐录影带、拒绝采访,甚至剔除潜在的热门单曲,以维护摇滚乐的“街头信誉”。当时,“出卖灵魂”(selling out)是一个严重的社会污名。
  • 当下的超商业主义: 如今,这种污名已消失。明星与品牌的深度联动(如 Lady Gaga 的限定版奥利奥、Drake 的赌博推广、Ice Spice 的 Dunkin' Donuts 合作)不仅被广泛接受,甚至受到粉丝的追捧。

2. 文化转变的核心驱动力

文章提出了两个主要理论来解释这种转变:

  • 流行主义(Poptimism)与批评的衰落:
    • 随着“流行主义”的兴起(即认为流行艺术与严肃艺术具有同等价值),原本严格区分艺术与平庸作品的文化标准被削弱了。
    • 互联网的发展削弱了专业艺术评论的作用,使得大众消费者的审美取代了专业评论家的判断。当人们不再区分“艺术”与“娱乐”时,艺术与广告之间的界限也随之模糊。
  • “大置换”(The Great Switcheroo):
    • 尽管公众对亿万富翁(富人)的认可度极低,但对名人的认可度却非常高。
    • 作者认为,这是因为在当前的“注意力经济”下,成名比致富看起来更具有可行性。普通人可能无法成为亿万富翁,但通过社交媒体成为“网红”或“影响力人物”似乎是有可能的。

3. 注意力经济与粉丝心理

  • 身份认同的错觉: 因为成名被视为一种可触及的阶级跃升路径,粉丝不再将明星视为遥不可及的权贵,而是将其视为“暂未成名的自己”。
  • 狂热粉丝文化(Stan Culture): 这种心理促使粉丝形成具有高度防御性的群体(如 BTS Army),他们不仅消费明星的产品,还通过刷榜、打击批评者等行为来“维护”明星,并将这种商业支持行为误认为是在“为自己的声音发声”。

4. 结论与呼吁

作者认为,当艺术沦为商业帝国的附属品,甚至仅仅是广告的载体时,它就不再是艺术,而是一种披着音乐外衣的金融工具。作者呼吁:

  • 重新划定界限: 必须重新建立艺术与娱乐、艺术与广告之间的界限。
  • 重拾“严肃性”: 文化精英应当重新追求艺术的严肃性,将艺术置于个人财富和粉丝数量之上,而不是将艺术仅仅作为实现商业目的的手段。
15. The Lost Treasure of Sid Meier's Pirates (remapradio.com)

《Sid Meier's Pirates!》的历史与设计意义总结

《Sid Meier's Pirates!》(海盗!)是 Microprose 公司于 1987 年推出的突破性作品。在当时,该公司主要以飞行模拟器(如《Gunship》)和硬核战略战争游戏闻名,而《海盗!》的出现彻底改变了公司的品牌形象。

独特的类型与机制

尽管在当时被称为“动作冒险”游戏,但《海盗!》在机制上与同时期的《塞尔达传说》或《银河战士》等作品完全不同。它并不包含平台跳跃元素,其核心的剑斗系统设计极其独特:

  • 战斗系统:玩家通过模拟击刺(快)、劈砍(高伤害)和格挡,并结合高、中、低三个攻击高度进行战斗。
  • 操作逻辑:该系统最初映射在 Commodore 64 等电脑常用的八方向摇杆或键盘数字键上,其操作逻辑更接近一种变体的节奏游戏或格斗游戏,而非标准的动作游戏。

设计哲学:不受类型束缚

该游戏最显著的特征是其“模糊的类型边界”。它并非单纯的 RPG、经济策略或开放世界游戏,而是通过一系列基于主题的系统构建了一个“发条式”的运行世界:

  • 主题驱动机制:游戏不仅仅是将海盗元素作为装饰,而是将海盗题材转化为世界运行的规则。例如,它模拟了从波托西到西班牙的白银贸易路径,并模拟了角色随时间推移在战斗中体力下降的生理过程。
  • 任务驱动:游戏通过随机化的寻亲任务,将玩家置于寻找失散家族成员的叙事目标中。
  • 时代背景:由于 20 世纪 80 年代游戏设计的行业规范尚未定型,Sid Meier 能够摆脱既定框架的束缚,从第一性原理出发去构建游戏机制。

行业地位与历史遗忘

《海盗!》的设计风格在当时并非孤例(如 Cinemaware 公司的作品也尝试过跨类型的叙事与机制结合),但它成功地为 Microprose 奠定了新的身份。

然而,这一时期的 PC 游戏历史在集体记忆中显得较为模糊。主要原因包括:

  1. 市场份额:在 1980 年代后期,PC 游戏市场仍属于小众领域,普及率远低于任天堂的 NES 和 Game Boy 等家用机。
  2. 技术更迭:随着 PC 市场的整合以及像《德军总部 3D》这类定义时代的作出现,早期的 PC 游戏文化逐渐淡出主流视野,更多地依赖于弃置软件(abandonware)网站或廉价收藏集才得以留存。
16. Codex on AWS bedrock bug causing 10x charges (github.com)

Codex 在 AWS Bedrock 上因缓存机制缺失导致高额费用的问题报告

问题概述

在使用 Codex CLI 调用 Amazon Bedrock Mantle 上的 openai.gpt-5.6-sol 模型进行智能体(agentic)编码工作负载时,由于无法启用 GPT-5.6 Sol 的**显式提示词缓存(explicit prompt caching)**机制,导致产生了海量的“缓存写入(cache-write)”Token,从而使成本大幅上升。

环境配置

  • Codex CLI 版本: 0.147.0
  • 提供商: 原生 amazon-bedrock
  • 端点: Bedrock Mantle Responses API (us-east-1)
  • 模型: openai.gpt-5.6-sol

观测到的生产使用情况

根据 2026-08-05 至 2026-08-08 的使用数据估算:

  • 请求总数: 3,656 次
  • 缓存写入 Token: 1.7194 亿
  • 缓存写入估算成本: $1,182.09
  • 总估算成本: $1,386.46

其中,缓存写入成本约占模型总支出的 85%。此外,本地会话测试显示,尽管产生了大量缓存写入 Token,但“缓存读取(cached_input_tokens)”为零,意味着缓存未能被有效复用。

原因调查

虽然 Codex 已经输出了会话范围的 prompt_cache_key,但目前的 HTTP 和 WebSocket 响应请求中缺少以下关键字段:

  1. prompt_cache_options
  2. prompt_cache_breakpoint

由于内置的 Amazon Bedrock 提供商配置仅暴露了传输和身份验证设置,无法进行请求体的结构化转换,因此用户无法通过 config.toml 进行配置。而根据 AWS 文档,针对具有长稳定指令/工具定义的智能体工作负载,必须使用显式缓存模式才能实现成本优化。

建议的改进措施

为解决该问题,报告提出了以下需求:

  1. 支持序列化: 为支持 GPT-5.6 的响应提供商增加 prompt_cache_options 的序列化支持。
  2. 增加字段: 在受支持的输入内容块中增加类型化的 prompt_cache_breakpoint 字段。
  3. 自动化策略: 提供提供商/模型能力检测机制,并在 Codex 测量的稳定指令/工具前缀末尾实施安全的放置策略。
  4. 增强遥测: 在每轮使用的遥测数据中展示缓存读取和写入情况,以便用户诊断高额的完整前缀重写成本。

结论范围

该问题并非指所有的缓存写入都是缺陷(例如冷启动或提示词分叉是正常的),核心问题在于原生 Bedrock Codex 缺乏利用文档所述的显式缓存机制来处理稳定前缀(stable-prefix)案例的能力。

17. We Rebuilt the Linux MicroVM Stack on Apple Silicon (encore.dev)

摘要

本文标题为《我们在 Apple Silicon 上重构了 Linux MicroVM 技术栈》(We Rebuilt the Linux MicroVM Stack on Apple Silicon),由 Encore 发布。

核心内容:

  • 技术主题:探讨了在 Apple Silicon 架构上重构 Linux MicroVM(微型虚拟机)技术栈的相关工程实践。
  • 相关资源:Encore 提供通过 Discord、GitHub 和 YouTube 进行交流的渠道,用于获取产品更新及工程深度解析。
18. It is a sign of the times that Amazon gets to call this fair use (observationalepidemiology.blogspot.com)

关于亚马逊通过破坏性扫描获取 AI 训练数据的争议

根据 404 Media 的调查报告,亚马逊正在通过一种破坏性的方式大规模获取书籍,将其转化为人工智能(AI)训练数据。

核心调查发现

  • 处理流程:调查人员通过在稀有书籍中放置追踪设备,发现这些书籍最终被运往亚马逊位于内华达州拉斯维加斯的 VGT3 仓库。在该仓库,员工会通过切断书籍装订线的方式进行快速扫描,随后书籍本身会被销毁。
  • 对稀有资源的破坏:被扫描的书籍不仅包含普通书籍,还涉及大量稀有、具有历史价值或特定语言价值的文献。
  • 价值取向的冲突:文章指出,AI 公司仅将书籍视为“串联在一起的文字内容”,而忽略了实物书籍所承载的货币价值、历史价值、知识价值以及情感价值。

模式对比:破坏性扫描 vs. 保护性数字化

文章将亚马逊的做法与 Internet Archive(互联网档案馆) 的模式进行了对比:

  • 亚马逊/谷歌模式(工业化/破坏性):侧重于速度与成本效益。通过拆解装订或破坏书籍物理结构来实现大规模、自动化的快速数字化。
  • Internet Archive 模式(保护性/人文):秉持“普及所有知识”的使命,采用“逐页扫描”的方法。通过专业的“抄写员”(scribe operators)进行人工操作,在实现数字化的同时,完整保留书籍的物理完整性,确保书籍本身不被破坏。

作者观点

作者认为,亚马逊在拥有雄厚资源的情况下,依然选择牺牲书籍的物理保存价值来追求 AI 训练的速度和低成本,这是一种价值观的选择。作者批评这种行为本质上是对知识产权的侵犯,并将这种为了追求短期效率而牺牲长期价值的做法,与企业在能源、金融和产品开发等其他领域的不可持续行为相类比。

19. Small, native web tricks worth remembering (htmlcat.net)

HTMLcat:值得记住的原生 Web 小技巧摘要

HTMLcat 是一个旨在分享实用原生 Web 特性的系列资源。

内容结构

每个条目均采用结构化呈现方式,包含以下核心要素:

  • 平台特性:介绍一个实用的 Web 平台功能。
  • 代码示例:提供一个简短的示例代码。
  • 注意事项 (Caveat):说明使用该特性时必须注意的关键点。

使用建议与警告

由于部分特性可能属于实验性功能或支持范围有限,开发者在应用时应遵循以下原则:

  1. 检查兼容性:务必核实相关特性的支持标签(Support label)。
  2. 设置备选方案 (Fallback):确保在特性不受支持时仍能正常运行。
  3. 进行实际测试:使用真实浏览器和辅助技术(Assistive technology)进行完整测试。
20. SpacetimeDB: a short technical review (strn.cat)

SpacetimeDB 技术评论摘要

本文对 SpacetimeDB 2.0 版本进行了技术分析,重点探讨其独特的架构设计、性能基准测试的有效性以及由此带来的技术权衡。

核心架构:全栈式数据库 + 应用服务器

SpacetimeDB 的核心理念是将应用逻辑直接运行在数据库内部。开发者编写的应用程序代码被编译为 WebAssembly (Wasm),并通过 Wasmtime 运行时在数据库实例中执行。这种模式将数据库与应用服务器合二为一,旨在消除传统架构中应用与数据库之间的网络延迟。

基准测试的争议性

作者指出,SpacetimeDB 的基准测试存在“不公平比较”的问题。其测试展示了极高的每秒查询数 (QPS),但这主要是因为其应用逻辑运行在内存中,避免了网络往返。将其与需要通过网络进行查询的分布式关系型数据库进行对比,掩盖了其架构在处理复杂分布式事务和高可用性方面的差异。

存储引擎设计

SpacetimeDB 的存储实现具有以下显著特征:

  • 内存驱动与全局锁:其底层是一个内存中的哈希表,并使用单个全局读写锁(parking_lot::RWMutex)进行并发控制。
  • 线性一致性:由于所有写操作(Reducers)都在持有全局锁的情况下按顺序执行,因此系统可以轻易实现线性一致性。
  • 串行执行环境:在执行用户编写的 WebAssembly 代码(Reducers 或 Views)时,会持有全局锁。这意味着:
    • 写操作:在 Reducer 执行期间,无法进行任何其他读写操作。
    • 读操作:在 View 执行期间,无法进行任何写操作。
    • 限制:由于处于关键路径(Critical Section),Reducer 严禁执行 HTTP 请求等耗时或具有副作用的操作,否则会阻塞整个数据库。

持久性与可靠性

SpacetimeDB 并非完全的磁盘驱动型数据库,其持久化机制如下:

  • 异步 WAL:系统使用预写日志 (WAL),但日志是异步刷入磁盘的(默认间隔约 50ms)。
  • 一致性权衡:由于 WAL 刷盘是异步的,系统在默认情况下主要针对“半临时”数据设计。虽然提供了 withConfirmedReads 标志来读取已同步到磁盘的数据,但这会引入显著的延迟。

技术权衡与适用场景

架构权衡

  • 垂直扩展限制:SpacetimeDB 并非分布式系统,其扩展性完全受限于部署实例的单机 CPU 和 RAM 容量。
  • 内存依赖:由于数据存储在内存中,一旦数据集超过物理内存容量,系统将无法工作。
  • 定位:作者认为 SpacetimeDB 的本质更接近于一个“功能更强大的 Redis”,而非传统意义上的高性能关系型数据库。

适用场景

  • 游戏后端:其最初设计用于 MMORPG(如 BitCraft),在处理对实时性要求高但对瞬间数据丢失容忍度一定的游戏状态时非常有效。
  • LLM 与 Agentic Coding:虽然官方宣称其适合 LLM 场景,但作者持保留意见。由于 Wasm 代码在全局锁保护下运行,LLM 生成的低效或阻塞代码极易导致整个数据库实例的性能崩溃或不可用。