2026-08-05

24 篇热帖

1. In Memory of My Wife, Elise Cawley, with Thanks for 36 Wonderful Years (writings.stephenwolfram.com)

Elise Cawley(1961–2026)纪念摘要

逝世与相遇:作者Stephen Wolfram的妻子Elise Cawley在心脏手术恢复期间,因突发心血管事件骤然离世。他们于1990年9月17日在纽约通过共同朋友相识,Elise当时是一位腼腆但才华横溢的纯数学家。作者此前出于隐私很少提及家庭,但Elise的离世让他决定向世人讲述这位与他共度36年的非凡人物。

个人特质与智慧

  • Elise是一位主题化思考者,能轻松触及事物本质。她视真理、美、家庭与四个孩子为生命主题,并坚信真理与美最终统一。
  • 她兼具强大的理智、善良与甜美,但在坚持自认的真理时又执着而坚定。
  • 她虽精通抽象数学,但本质上是人文主义者,以人文视角思考世界,反对冰冷的现代主义,钟情于古典主义的人文联结。
  • 她晚年越来越关注数学基础,持柏拉图主义真理观,惋惜二十世纪转向形式化方法的趋势。
  • 她充满活力与自发性,同时对智识与美学有最高标准的追求。她深刻关怀周围的人,无论是礼物还是空间设计,都投入大量创意与心血直至完美。

学术生涯与成就

  • 早年经历:1961年出生于伊利诺伊州乌尔班纳,在马里兰州哥伦比亚市长大,是顶尖学生。就读于MIT,深受拓扑学课程启发,确立了概念性纯数学兴趣。后在马里兰大学获得数学与物理学学位。
  • 研究生与早期研究:获得赫兹基金会奖学金,于伯克利大学攻读数学博士,论文《光滑马尔可夫分割与环面自同构》展现了她将优雅主题思想与精湛技术结合的能力。毕业后收到多所大学邀请,选择前往巴黎高等科学研究所进行博士后研究,期间对Teichmüller空间和热力学形式(Gibbs理论)产生浓厚兴趣。
  • 职业发展:曾在石溪大学和芝加哥大学任教,并在芝加哥大学与同事共同创立了面向量化分析师的金融数学专业硕士项目,该项目非常成功并延续至今。

家庭生活与建筑设计

  • 1994年与作者结婚,育有四子女(Alexander, Catherine, Christopher, Elizabeth)。孩子是她生命的核心,她为每个孩子建立了独特的关系,助力他们各自成长。
  • 她主导设计并建造了位于马萨诸塞州康科德的家庭住宅。运用数学(如数论、圆堆积)和美学原理,结合最新CAD工具,打造了一座融合个性、美感、优雅与创意的建筑杰作。她多年不断更新其室内设计,使其保持鲜活。

社区参与与晚年

  • 深爱康科德的小镇氛围,积极参与当地生活,乐于运用自己的知识和洞察力帮助朋友。
  • 曾为斯坦福在线高中的社区顾问小组成员长达十余年,并加入赫兹基金会董事会,都是核心贡献者。
  • 晚年喜爱西南地区和徒步旅行,与住在亚利桑那州的弟弟关系亲密。
  • 孩子们相继离家后,她准备开启人生新篇章,考虑重返Gibbs理论研究、深入数学哲学写作,并思考高等教育的目标和言论自由的重要性。

与作者的关系及影响

  • 两人从未直接合作智识项目,但作者常向她分享工作,她能毫不费力地看出深层主题并解释给作者听。
  • 她欣赏作者的“计算不可约性”概念,并认同其工作揭示了科学的局限性,与她的人文主义世界观契合。在“观察者”和“规则空间”等观念上,她比作者更早看到其哲学与形而上学意涵。
  • 在数学基础问题上,两人曾有长期辩论。作者最终承认Elise关于数学本质(非纯粹形式化公理体系)的观点是正确的。她还提出了关于数学核心抽象概念(点、数)以及物理与数学区别(引入时间概念)的深刻主张。

逝世与遗留:Elise在术后恢复期间,通过视频欣慰地参加了孩子的庆祝活动后不久便猝然长逝。她本期待着即将到来的孙辈、孩子的毕业以及人生的新阶段。她的离世是所有人的巨大损失,她将被深深怀念。

2. All of Winona Police Department's Flock cameras cut down and stolen (www.valleynewslive.com)

事件概述

8月1日,明尼苏达州威诺纳市(Winona)警察局(WPD)运营的全部8台Flock车牌识别摄像头被锯断并盗走,警方怀疑这是一起协同盗窃案。此外,布法罗县(Buffalo County)位于密西西比河大桥上的2台同类摄像头也以相同方式被盗。

发现过程与财务损失

  • 发现过程:一名巡警发现摄像头连续24小时未发送警报,经现场检查确认摄像头已从电线杆上被切断盗走,仅留下立杆。
  • 财务损失:每台摄像头价值约3,000美元,WPD直接经济损失约24,000美元,该费用将由警局预算承担。

设备分布与技术功能

  • 安装位置:WPD的8台摄像头分布在城市的四个关键高速公路出入口(61号公路与Bundy大道、43号公路与Homer路、14号公路与Knapp Valley车道、61号与14号公路交汇处),每个位置各安装2台。
  • 技术功能:Flock Safety摄像头为自动车牌读取设备,可捕捉车牌图像及车辆的品牌、型号和颜色。警方主要利用该技术调查肇事逃逸案件和寻找失踪人员。
  • 数据管理:摄像头采集的数据归警察局所有,并在30天后进行永久删除。

社会背景与争议

此类针对Flock摄像头的破坏和盗窃事件在全美多地社区均有发生,呈现出全国性趋势。同时,该技术也引发了公民自由倡导者的批评,他们认为这扩大了政府监控范围,并对数据可能与第三方公司或联邦机构共享表示隐私担忧。

调查进展

目前警方尚未锁定任何嫌疑人,案件仍在进一步调查中。警方呼吁掌握相关线索的民众与威诺纳市警察局联系。

3. Mistral's Shieldstral: 3B open-weights model for multimodal moderation (mistral.ai)

Mistral Shieldstral: 3B 开源多模态审核模型

Shieldstral 是一个 3B 参数开源多模态安全分类器,其核心创新在于将内容审核重新定义为基于策略自适应的问题解答任务。它通过接受纯文本策略在推理时输入,无需重新训练即可适应不同应用场景,在性能上可媲美甚至超越其7倍大小的模型。

核心创新与特点

  • 策略自适应审核:传统模型将固定的有害类别编码在权重中,而 Shieldstral 允许在推理时通过自然语言提问(如“此内容是否宣扬针对受保护群体的暴力?”)来定义审核策略。模型根据 yes/no 的概率输出一个校准过的连续安全分数,从而统一了提示分类、响应审核、拒绝检测和毒性检测等任务。
  • 强大的性能与效率:尽管仅有 3B 参数,但在文本安全、拒绝检测、策略适应性和多模态基准测试中,其表现与高达 7 倍大小的开源护栏模型相当或更优。它可在单个 16GB NVIDIA GPU 上高效运行。
  • 灵活的多模态接口:单一模型架构和界面可处理纯文本、纯图像以及图文混合内容,覆盖提示、响应和提示-响应对等多种场景。
  • 开源与可用性:模型权重在 Apache 2.0 许可下发布,可供下载使用。

技术构建方法

其强大的性能源于精心设计的数据构建与训练流程,旨在解决四个关键问题:

  1. 统一异构数据:将不同来源、不同标签体系(从二元到多标签)的安全数据集,通过统一的“指令-查询-文档”格式和多样化的措辞进行标准化,并为不同数据源校准严格程度,使模型学习到校准的决策边界。
  2. 教授区分能力,而非死记硬背:避免让模型只记住固定的策略标签。相反,通过构建容易混淆的相似策略对比组,并利用 LLM 生成仅违反其中一项策略的对比文本对,训练模型精准区分内容违反的是哪个特定策略。这种能力使其能泛化到用户自定义的新策略。
  3. 基于图像的安全性:针对视觉安全数据稀缺的问题,结合有限的审核数据集与通用图像数据集作为高质量负样本,并通过视觉-语言重排序器过滤图文对,减少错误标签和幻觉。
  4. 合并互补检查点:使用 LoRA 微调并最终通过 SLERP 合并三个关键检查点:一个基于公共数据校准的检查点、一个通过生成数据获得细粒度策略区分能力的检查点,以及基础指令模型。合并后同时保留了策略校准性、适应性和指令遵循能力。

应用与前景

Shieldstral 代表了向上下文自适应审核迈出的重要一步,避免了强迫所有产品遵循单一、僵化的分类体系。未来,团队将持续推进多语言覆盖、长文档处理和更广泛的多模态安全支持。

4. Waymo in Dallas (waymo.com)

Waymo宣布在达拉斯向所有人开放全自动驾驶叫车服务。自今年2月服务上线以来,已有近15万乘客通过兴趣名单体验了Waymo的安全出行。目前Waymo正在达拉斯Love Field机场航站楼进行全自动驾驶测试,并计划在达拉斯高速公路上进行测试,这是向公众开放这些路线的最后一步。

达拉斯社区将Waymo视为扩展区域内无障碍和可靠交通选择的重要资源。德克萨斯州癫痫基金会的CEO Chris Justl表示,Waymo自动驾驶车辆为癫痫患者及有出行限制的医疗群体开辟了安全独立出行的新途径。

用户可通过下载Waymo应用即可叫车体验全自动驾驶服务。

5. Thanks FedEx, This Is Why We Keep Getting Phished (2024) (www.troyhunt.com)

这篇文章主要讲述了作者Troy Hunt收到的一则看似是钓鱼诈骗的FedEx短信,但经过详细调查后,发现这竟然是FedEx官方发送的真实通知。文章通过这一具体案例,揭示了当前网络钓鱼泛滥的背景下,即使是合法的商业通知也可能因设计不当而难以与骗局区分,从而凸显了“人为因素”在安全防线中的关键作用。

核心内容与发现:

  1. 事件起因: 作者收到一条声称包裹需支付关税和税费的FedEx短信。由于该短信包含多项常见钓鱼特征(如拼写错误、使用紧急语气、包含陌生支付域名bpoint.com.au等),他在社交媒体上的投票显示,87%的参与者认为这是一条诈骗信息。
  2. 深入调查:
    • 钓鱼特征分析: 文章详细列举了短信中的七大“可疑”迹象,包括“FedEx”拼写错误、不寻常的包裹编号、刻意制造的紧迫感、大小写不规范的用语、未注明货币、指向非FedEx官网的支付链接以及错误的联系方式。
    • 官方验证困境: 作者尝试通过FedEx官网验证信息,但找不到相关税费说明。他还发现短信中的支付链接(由澳大利亚联邦银行提供的BPOINT服务)存在严重的参数篡改漏洞,可以任意修改金额和客户信息。
    • 短信不一致: 随后收到的第二条FedEx短信质量更差,支付链接甚至不完整,无法点击。
  3. 真相大白: 在致电FedEx官方客服(通过官网找到的号码,而非短信中的号码)后,作者确认该笔税费是真实的。最终,FedEx发送了一封附有详细发票(包含作者完整的购买订单信息)的电子邮件,证实了短信通知的合法性。
  4. 核心悖论与警示:
    • 官方模仿诈骗: 文章最讽刺的发现在于,FedEx官方发送的通知,在形式上完美模仿了诈骗信息,导致用户(包括作者和广大网友)无法轻易区分。
    • 安全系统缺陷: 调查还暴露了第三方支付服务(BPOINT)的参数篡改漏洞,这本身就是一个严重的安全问题。
    • 依赖“人为控制”: 作者指出,虽然有ACMA等机构的技术拦截措施,但诈骗短信数量巨大。因此,培养用户识别诈骗模式的能力(如警惕紧急要求、语法错误、可疑链接等)变得至关重要。然而,当正规企业也采用这些“诈骗模式”时,这种依赖用户判断的安全防线就失效了。
  5. 结论: 文章最后指出,在AI驱动的诈骗日益复杂的今天,FedEx的这种做法无异于“帮助”诈骗者,使得识别合法通知变得比以往任何时候都更加困难。这凸显了企业在设计客户沟通时,必须严格遵守安全和反诈骗的设计规范,否则将加剧整个生态系统的混乱和风险。
6. Civilian plane crash in New Mexico tied to military GPS blocking (www.wired.com)

文章讲述了2025年5月美国新墨西哥州一架民用医疗救援飞机因军方GPS干扰训练坠毁的事件,揭示了无人机战争与电子对抗对民用航空安全构成的日益严重的威胁。

事件经过

  • 一架双发医疗救援飞机从罗斯韦尔起飞,前往鲁伊多索接患者。
  • 起飞后,飞行员发现GPS信号丢失,无法使用现代导航系统。
  • 他们被迫改用传统的无线电导航方式,但因经验不足且夜间能见度低而迷失方向。
  • 飞机最终撞上卡皮坦山脉,机上四人全部遇难。

背景原因

  • 美国空军第746测试中队在白沙导弹靶场进行为期两周的“NAVFEST”电子战演习,旨在测试GPS干扰与反干扰技术。
  • 联邦航空管理局曾警告演习期间400英里范围内的GPS信号可能受到影响。
  • 该事件是美国首例已知因GPS干扰导致的民用飞机致命事故,但非孤立事件。过去一年,美军至少进行了10次类似训练。

影响与行业现状

  • 全球多地(如中东、黑海、波罗的海)已频繁发生GPS干扰,民用航空被迫适应,但安全冗余度降低。
  • 飞行员对仪器读数的信任度下降,叠加恶劣天气、机组经验不足等因素,事故风险增加。
  • 航空业依赖GPS导航,且防撞系统等关键设备也易受干扰,而行业应对技术变革的速度缓慢。

深层挑战

  • 无人机与反无人机技术陷入“猫鼠游戏”,电子战演习成为常态,但反制措施常“误伤”民用导航。
  • 行业专家强调,反无人机技术需精确“外科手术式”干扰,而非“大锤”式粗暴干扰,因民用与军用空域高度重叠。
  • 文章暗示类似事故可能仅是开端,并提及同年7月一架巴基斯坦货机在GPS干扰区坠海,疑似与电子战有关。

未来展望

  • 随着无人机战争扩大,民用航空可能长期面临“温和但不断增长的风险”。
  • 航空安全重大改进往往依赖灾难推动,但行业需更快适应技术威胁。
7. Oxide Computer raises $445M (SEC Form D) (www.sec.gov)

Oxide Computer Co. 根据美国证券交易委员会(SEC)的Form D文件,完成了一笔总额约4.45亿美元的证券发行。

发行方信息

  • 名称: Oxide Computer Co.
  • 注册地: 特拉华州
  • 成立时间: 超过五年
  • 行业分类: 其他科技
  • 总部地址: 加利福尼亚州埃默里维尔

主要相关人士 以下人员均与发行方地址一致:

  • Steven Tuck: 执行官、董事
  • Bryan Cantrill: 执行官、董事
  • Seth Winterroth: 董事
  • Gaetano Crupi: 董事
  • Scott Orn: 执行官

证券发行细节

  • 豁免条款: 依据Rule 506(b)豁免(对合格投资者的私募)
  • 证券类型: 股权
  • 发行总额: $444,999,052
  • 已售金额: $444,999,052
  • 剩余待售: $0
  • 首次销售日期: 2026年7月20日
  • 发行期限: 不超过一年
  • 最低投资额: $0
  • 投资者人数: 15名

其他关键信息

  • 公司收入或净资产范围未披露。
  • 未使用经纪人或经销商进行销售。
  • 无销售佣金或中介费。
  • 募集资金未用于支付给公司高管、董事或发起人。
  • 本次发行不是与业务合并(如并购)相关。
  • 文件由公司总裁Steven Tuck于2026年8月4日签署。
8. I am retiring from fulltime writing (& pseudonymity) to launch Guardian Angel (twitter.com)

文章标题摘要:I am retiring from fulltime writing (& pseudonymity) to launch Guardian Angel

主要点

  • 宣布退休:作者决定从全职写作和使用笔名的工作中退休。
  • 新项目启动:退休目的是为了启动名为“Guardian Angel”的新项目或计划。
  • 内容不可用:提供的文章内容显示帖子不可访问,需要登录或注册才能查看详情,因此无法获取进一步细节。

关键细节

  • 作者身份:从URL(/gwern/status/)推断,作者可能为gwern,但未在内容中明确说明。
  • 项目名称:“Guardian Angel”被提及,但具体性质、目标或背景信息未提供。
  • 变动范围:涉及职业转变,从写作转向新事业,但无具体时间表、原因或实施细节。

总结

基于提供的内容,文章标题表明作者将结束全职写作和笔名身份,专注于启动“Guardian Angel”项目。由于帖子不可用,无法获取更多上下文或详细信息。

9. Web Security is Too Hard (textslashplain.com)

Web Security is Too Hard 文章摘要

事件概述

文章作者 Eric Lawrence 在 Cloudflare 推出新产品“Wallet”时,尝试申请偏好用户名(@ericlaw),但在授权过程中发现页面设计酷似同意钓鱼攻击。关键疑点包括:

  • 入口站点位于 cloudflare.pay,而非用户已信任的 cloudflare.com 域名。
  • 域名 .pay 注册门槛低(仅需20美元),易被仿冒。
  • 权限页面的绿色对勾图标易被误解为安全标识,实则需悬停查看详情。
  • Cloudflare 的聊天 AI 甚至建议用户谨慎授权,加剧了用户的不信任感。

经过调查,作者确认这是 Cloudflare 的合法新产品,但界面设计存在严重误导性。后续 Cloudflare 改进了 UI,使其更清晰地显示域名关系。

主要问题分析

  1. 域名使用不当:开发者在未受严格审核的 .pay 域名上托管功能,而非受信任的 .com 域名,增加钓鱼风险。
  2. 安全 UI 设计缺陷:关键安全信息(如域名关系)未明确展示,绿色对勾图标易被误用。
  3. 举报机制缺失:权限页面未提供“报告可疑请求”的链接,用户无法直接反馈问题。
  4. 权限设计违规:AI 助手默认请求超出最小权限的访问控制,违背安全最佳实践。

教训总结

给开发者:

  • 使用受信任域名:应用和内容应托管在可信域名下(如 cloudflare.com/pay),避免使用新域名。
  • 明确展示安全信息:在用户进行安全决策时,在可信位置显示相关安全细节。
  • 提供便捷举报途径:在权限请求页面内嵌入举报功能。
  • 遵循最佳实践:避免手势劫持(GestureJacking),确保权限屏幕清晰无误。
  • 测试举报流程:确保安全报告渠道有效且受监控。

给用户:

  • 保持警惕,点击前思考,遇疑虑时等待核实。

给安全从业者:

  • 勿责怪受害者:用户面临的安全环境极其复杂,需保持同理心。

核心观点

该事件凸显了网络安全性与用户体验之间的矛盾。即使是信誉良好的公司,也可能因界面设计误导用户,间接助长钓鱼风险。这反映了当前网络环境对普通用户而言仍过于复杂,亟需开发者严格遵守安全设计准则。

10. libexpat now funded by the City of Munich for up to 6 months (blog.hartwork.org)

libexpat 现获慕尼黑市资助,可支持长达6个月的维护

2026-08-04

libexpat 是一个快速流式 XML 解析器。它与 libxml2 一样,是目前使用最广泛的用 C 语言(特别是 C99)编写的自由软件 XML 解析器之一。它跨平台并采用 MIT 许可证。

2026年8月1日 起,该项目的“安全休假”正式结束,且作者 Sebastian 将获得报酬,可以全职投入 libexpat 的维护工作,为期最长6个月。这得益于慕尼黑市在其“开源休假”计划框架下提供的资助。

这意味着什么? 在过去的近10年中,维护 libexpat 一直是作者在其作为软件工程师的本职工作、家务、社交生活及休闲之余的兼职任务。现在,作者首次被雇用,在有限的时间内将 libexpat 的维护作为自己的“常规工作”。

未来6个月的核心优先级包括:

  1. 修复当前已知的5个未解决的安全漏洞。
  2. 添加对 XML 1.0r5 的支持。
  3. 进一步提升项目的健壮性和可维护性。

昨天和今天的大部分时间已用于修复由 Mozilla 发现的一个漏洞。

雇佣细节: 作者目前以常规工作合同形式受雇于 digitial@M,合同期最长6个月,双方均有权提前解约,工作地点为远程居家办公。作者表示项目有大量工作要做。他仍然不会接受未经验证的 AI 生成提交内容,但对于其他所有贡献:如果您想投入智力去寻找 libexpat 中更多的漏洞并发送给作者,未来几个月将是让问题在合理时间内得到修复的最佳机会。排队理论和物理定律仍然适用。

最后,作者表示祝自己好运,并附带了一个技术求助:如果有人成功将基于 Clang 的 MinGW 与 AddressSanitizer 和 Wine 结合使用且在启动时不崩溃,请告知方法并通过电子邮件联系他。

11. Why some people mow a lawn better than others (pudding.cool)

实验背景与核心问题

本文基于一项包含30,954名参与者的“割草”路径规划游戏实验。该问题在计算机科学中被称为“覆盖路径规划”(Coverage Path Planning),与著名的“旅行商问题”(TSP)密切相关。研究旨在探讨人类在解决此类路径规划问题时的表现、决策过程及所用策略。

实验结果与人类表现

  • 整体高效:尽管参与者探索出了14,589种不同路径,但中位数效率仍高达91%(与最优解相差5步以内),16%的人实现了完美路径。
  • 规模影响较小:与TSP研究中“节点越多人类表现越差”的结论不同,当草坪面积增大、障碍物增多时,人类的优化效率依然稳定在90%左右。这主要得益于草坪具备内在结构,而非TSP中的随机节点分布。

优秀玩家的关键策略

表现优异的玩家(如文中的Sarah)主要运用了以下启发式策略:

  • 预判与避免回溯:优秀玩家能提前识别“死胡同”区域并将其留到最后清理,从而避免无效的回溯步骤。
  • 问题分解(Decomposition):将大面积草坪拆分为更易管理的小区块逐个清理,避免全局规划带来的认知超载。
  • 模式压缩(Compression):在多个关卡中建立心理模型,识别复杂布局的规律并快速适应。
  • 蛇形走位:直觉性地采用连续的蛇形转向模式,以优化覆盖效率。

思考时机的决定性作用

数据分析表明,思考的总时长与最终表现的相关性极低(R²仅为4.9%)。优秀玩家并非思考得更久,而是在关键时刻思考

  • 优秀玩家:在起始阶段和关键岔路口(如判断先清理开阔区还是复杂区)投入更多时间进行全局规划,而在开阔区域则快速通过。
  • 较差玩家:往往在开局快速移动,直到陷入死胡同或边缘时才被迫停下思考并回溯,属于被动“反应”而非主动“规划”。

结论

人类在面对复杂的路径规划问题时,能够通过优秀的启发式策略将注意力集中在关键决策上,忽略无关紧要的选择。利用问题的内在结构进行分解和模式识别,是人类在无法穷举所有路线时,依然能高效找到最优解或近似最优解的核心原因。

12. We finally learned to center a div, then browsers added sidebars (seg6.space)

浏览器侧边栏环境下的真正窗口居中方案

传统CSS居中的局限性

  • 传统方法:使用绝对定位 + transform: translate(-50%, -50%)
  • 现代方法:CSS Grid的 place-items: center 变得极其简单
  • 问题出现:当浏览器显示侧边栏时,简单的居中实际上是在网页视口内居中,而非浏览器窗口内居中

技术挑战分析

  • 侧边栏会减少网页视口宽度,但网站仍按视口尺寸居中
  • 用户希望布局在浏览器窗口的视觉中心,而非剩余空间的中心
  • 开发者工具停靠位置(如右侧)会进一步影响可用宽度计算

解决方案演进

第一阶段:基础JavaScript修正

  • 使用 window.innerWidth(网页视口宽度)和 window.outerWidth(浏览器窗口宽度)
  • 计算浏览器界面占用的总宽度:browserChrome = outerWidth - innerWidth
  • 通过CSS自定义属性应用位移补偿

第二阶段:处理开发工具停靠问题

  • 当开发者工具停靠在侧面时,outerWidth - innerWidth 包含左右两侧的界面元素
  • 需要知道界面占用的左右分配比例才能正确计算

第三阶段:利用指针事件定位

  • 关键发现:受信任的指针事件提供:
    • event.screenX:相对于屏幕的坐标
    • event.clientX:相对于网页视口的坐标
  • 通过差值计算网页视口在浏览器窗口中的实际位置
  • Firefox直接提供视口位置API
  • Chromium需要通过指针事件逐步修正

最终实现方案

  • 创建名为"center, actually"的浏览器扩展
  • 功能特点:
    • 自动尝试识别页面中需要居中的元素
    • 允许用户手动选择目标元素
    • 通过CSS变换应用精确的窗口居中修正
    • 避免在空间不足时隐藏内容

设计理念

  • 方案采用用户自主选择模式(opt-in),而非网站自动应用
  • 尊重不同网站的布局需求差异
  • 解决了长期存在的"视觉居中"与"几何居中"不一致问题
13. Helsinki Hacker News Meetup (calpaterson.com)

赫尔辛基 Hacker News 聚会摘要

这是一个面向赫尔辛基地区 Hacker News 用户的非官方咖啡晨聚活动,与 Y Combinator 创业加速器无关。

加入条件 为保证活动聚焦于发帖用户(而非仅读者),申请者需满足以下条件:

  • 拥有非绿色名称(non-greenname)的 Hacker News 账户。
  • 账户声望(karma)达到 64 点或以上。
  • 若已被小组成员本人认识,则可免除上述限制。 申请需通过填写 Google 表单完成。

组织与活动安排

  • 小组通过 WhatsApp 群进行协调,具体会议时间和地点将在群内公布。
  • 活动约每 6-8 周举行一次。
  • 会议通常在周日上午 10 点至中午 12 点,于赫尔辛基市中心的咖啡馆举行,偶尔也会组织啤酒聚会。
  • 组织者为 Cal Paterson 和 Oleg Podsechin。
15. AI fuels more than half of cybercrime in Africa as scams surge – Interpol (www.africanews.com)

非洲网络犯罪与人工智能:国际刑警组织2026年评估报告摘要

根据国际刑警组织(INTERPOL)发布的《2026年非洲网络威胁评估报告》,人工智能(AI)正驱动非洲一半以上的网络犯罪,导致攻击速度更快、更具欺骗性且规模更大。

核心发现

  • AI深度卷入犯罪:报告数据显示,非洲大陆记录的网络犯罪案件中,有55% 使用了人工智能。
  • 犯罪规模与损失:网络犯罪已演变为高度组织化、跨境化的产业。2025年,相关财务损失从2024年的1.92亿美元激增至4.84亿美元,主要归因于AI驱动的欺诈、窃取登录凭证和复杂的社会工程攻击。
  • 主要威胁形式网络诈骗仍是非洲最普遍的网络威胁。犯罪分子越来越多地利用AI、社交媒体平台和移动支付服务来瞄准受害者。
  • 犯罪设施化:接受调查的国家中,有72% 报告在其境内存在诈骗中心,其中西部和南部非洲最为集中。

AI如何改变犯罪模式

报告警告称,人工智能正在深刻改变网络犯罪的运作方式:

  • 深度伪造与骚扰:深伪技术和AI生成内容被越来越多地用于数字性勒索和网络骚扰活动。一个技术合作伙伴检测到约60万起与此类手段相关的性勒索案例。
  • 高度仿真的商业邮件欺诈(BEC):骗子使用AI生成极为逼真的电子邮件,模仿可信联系人进行诈骗。
  • 创造合成身份:犯罪分子不仅窃取个人信息,还将真实数据与伪造细节结合,创造出全新的合成数字身份。这些虚假身份据报已被用于开设银行账户、获取移动贷款、注册SIM卡,并能规避部分生物识别验证系统。
  • 跨境作案:一些位于非洲的网络犯罪团伙利用分布在多个国家的基础设施来隐藏活动,专门针对欧洲和北美的企业和个人。

地区威胁差异

报告指出,非洲不同地区面临的网络风险各有侧重:

  • 东非:主要威胁是移动支付欺诈和针对关键基础设施的勒索软件攻击。
  • 西部和中部非洲:商业邮件欺诈和浪漫诈骗高发,同时影响企业和个人。
  • 南部非洲:其先进的数字连接性使之成为国际犯罪网络寻求最大化破坏的理想目标。

应对挑战与进展

报告揭示了应对工作中的短板,同时也指出了一些积极努力:

  • 协作与能力缺口:银行、电信公司和执法机构之间协作薄弱,缺乏实时信息共享,使得犯罪分子能快速转移赃款并利用多司法管辖区漏洞。许多非洲执法机构对AI驱动的网络威胁准备不足。
  • 立法与行动:尽管面临挑战,非洲国家也在采取行动。2025年,17个国家引入或更新了网络犯罪立法。国际联合行动也取得了成果,例如“Serengeti 2.0”等四大行动导致超过1500人被捕,查获数百台电子设备,并追回了超过1亿美元的犯罪所得。

总结而言,报告描绘了一幅非洲网络犯罪快速升级的图景,其核心驱动力是人工智能的广泛应用。这导致了更复杂的犯罪手法和巨大的经济损失,同时凸显了加强区域与国际合作、提升执法能力以及信息共享机制的迫切需求。

16. Pi's Minimalism Is Its Advantage (earendil.com)

Pi的极简主义是其优势

核心设计哲学

Pi是一个刻意选择极简主义的代码工具,开箱仅有4个工具,系统提示和工具定义总计低于1000个token。其理念是:大多数工作可通过基础功能完成,如需更多功能,用户可自行构建。

性能与成本优势

证据表明,Pi的设计不仅更简洁,也更便宜、性能更好。即使在未添加特定工作流扩展前,原生Pi已能产出行业领先的结果。

案例研究

Databricks:任务成本分析

Databricks研究比较不同编码工具在实际任务中的性能与成本关系。结果显示:

  • 当与Opus 4.8模型结合时,Pi的总体通过率最高,且成本显著低于Claude Code和Codex。
  • 不同工具对同一模型的成本影响极大(某些情况下超过2倍),但质量保持一致。
  • Pi的“上下文纪律”:每轮发送的上下文量减少约3倍,能更好地管理上下文,以更少的运行次数完成任务。

Shopify:可扩展性优于臃肿

Shopify通过Pi的可扩展性,仅通过提示Pi创建扩展,便构建了pi-autoresearch——一个用于编码代理优化的自主循环工具。

  • 该扩展成为重要的内部生产力工具,带来了显著的性能提升,如单元测试速度提升300倍、React组件挂载速度提升20%。
  • 关键点:Pi不预装这些工具,而是提供极简的扩展性基础,让用户能基于自身工作流轻松构建所需功能。

为何极简设计现在更有效

  • 前沿模型现已能很好地理解并作用于终端式环境,因此工具与模型的“原生性”优势减弱,重点转向如何高效处理上下文、避免冗余。
  • Pi通过减少提示开销和重复上下文,提供更清洁的接口,从而降低成本、提升性能。
  • Pi的上下文纪律同样适用于本地模型:本地模型上下文窗口通常较小,重新预填充耗时,Pi稳定提示前缀的做法能有效避免不必要的重新预填充,使其成为本地模型的理想工具。

总结

Pi证明,通过极简设计、严格的上下文管理和可扩展性,可以同时实现更低成本、更简洁和更高性能。

17. IP and DNS Leaks in WebKit Affecting Proxy Browsers and iCloud Private Relay (mysk.blog)

WebKit中影响代理浏览器和iCloud Private Relay的IP与DNS泄漏

在iOS和macOS上基于WebKit的浏览器可通过代理服务器路由所有网络流量,这是iOS上代理浏览器(如Tor浏览器和Psylo浏览器)的运作方式。然而,发现了三个WebKit功能会绕过配置的代理,直接从设备发送流量,从而暴露用户的真实网络地址。这些泄漏同样影响苹果的iCloud Private Relay。所有问题已在Psylo 1.3.1中修复。

泄漏点详情

  1. DNS预取(DNS prefetching):通过HTML标签<link rel="dns-prefetch">,浏览器会提前解析主机名。此过程通过设备的正常DNS路径进行,而非代理,导致用户的真实DNS服务器被暴露。自iOS 26.0起可用。
  2. WebAuthn相关来源请求(WebAuthn Related Origin Requests):当页面请求的凭据rpId与自身来源不同时,操作系统凭据服务会直接从设备获取验证文件,从而暴露设备的真实IP地址。自iOS 18.0起可用。
  3. WebTransport:调用new WebTransport(url)会打开直接的HTTP/3连接,完全绕过代理,使服务器看到设备的真实IP地址。自iOS 26.4起可用。

影响范围

  • 所有iOS浏览器必须使用WebKit,因此任何依赖WKWebsiteDataStore.proxyConfigurations进行代理的浏览器均受影响,包括所有iOS Tor浏览器和Psylo浏览器。
  • 苹果的iCloud Private Relay也易受攻击,因为这些泄漏发生在WebKit标准页面加载过程之外,Private Relay的代理路径未覆盖。
  • VPN不受影响,因为它在系统级别隧道化整个设备流量。

背景与发现

调查始于一位Psylo用户报告的DNS泄漏,仅在某些网站发生。深入检查后,不仅发现了DNS泄漏,还找到了两个额外的IP地址泄漏。这些泄漏存在于WebKit中,绕过了代理设置。

修复措施

Psylo 1.3.1中已实施以下缓解措施:

  • 阻止dns-prefetch提示,防止设备解析攻击者控制的主机名。
  • 默认禁用WebTransport和WebAuthn。
  • 用户可通过每个silo的切换选项重新启用这些功能,以平衡隐私和功能需求。

开发团队已联系Tor Project和Onion Browser开发者通报问题。用户可通过访问leaks.psylo.app测试泄漏情况。

18. DuckDB – Data power tools for your laptop, now in Clojure (2023) (techascent.com)

DuckDB – 为你的笔记本提供数据利器,现已集成至Clojure (2023)

本文介绍了将高性能嵌入式分析型数据库DuckDB集成到Clojure函数式数据科学生态系统(特别是tech.ml.dataset (TMD)平台)中的进展、用例及优势。

背景与需求

  • tech.ml.dataset (TMD) 是一个内存中、列主序的数据处理平台,是函数式数据科学的核心工具。当数据过大无法装入内存时,可以通过采样、筛选子集或借助nipyarrowparquet进行持久化来应对。
  • 然而,当处理大型(如~100GB)、具有关系性质的CSV文件集时,现有工具可能变得笨重。开发者常会陷入复杂的分布式集群(如Spark)方案,但本地磁盘和处理器已足够强大,无需如此复杂。

DuckDB的集成与演进

  • 早期尝试(2021年):通过GitHub issue引入DuckDB,并完成了基于其C语言绑定的初步集成。但早期版本存在限制:查询结果需一次性加载到内存中,且缺乏高性能的数据追加/插入系统。
  • DuckDB的改进:过去两年,DuckDB的C接口提供了批处理(batched)的插入和查询系统,使其能够高效处理非常大的连接(join)操作。
  • 当前状态:通过Clojure中的TMD接口,现在可以充分利用DuckDB先进的向量化SQL执行引擎。

实际应用示例

文章以一个50GB、包含4亿行交易数据的CSV文件为例进行了演示。

  1. 数据加载:使用DuckDB命令行工具将CSV导入数据库,耗时约2分钟,生成一个包含索引在内的18GB数据库文件。
  2. 从Clojure访问
    • 通过tmducken库初始化DuckDB,连接到数据库。
    • 执行SQL查询SELECT COUNT(*) FROM data,仅需约10毫秒即可返回4亿行的计数。
  3. 创建新表并关联查询
    • 生成一个约3.5万行的SKU颜色数据集,并插入DuckDB。
    • 执行一个涉及4亿行交易表与颜色表的内连接(INNER JOIN)查询,生成14亿行结果,耗时约2.5秒
    • 基于此连接执行聚合查询(统计2021年3月每种颜色的销售数量),耗时约1秒
  4. 大规模数据集的流式/归约处理
    • 对于不适合用单个SQL表达式处理的计算,可以通过duckdb/sql->datasets函数以分块(dataset)流的形式返回结果,并使用Clojure的reduce进行处理,此过程不会耗尽内存
    • 示例中,按时间顺序遍历某个SKU的所有交易记录并执行归约操作,耗时约1秒
    • 支持**零拷贝(zero-copy)**查询路径,理论上可进一步降低内存开销。

DuckDB的特性与优势

  • 索引:自动为数值数据创建最小-最大索引(BRIN索引),显著提升查询性能,且基本不增加存储空间。对唯一键或主键列会自动创建ART索引。
  • 可移植性:使用标准C++11编写,易于移植到不同平台(如快速为Mac M1芯片构建版本)。
  • 开源与许可:采用MIT许可证,拥有活跃的开源社区。
  • 与TMD的互补性:DuckDB为TMD提供了强大的外部存储和关系查询引擎,使得在笔记本电脑上高效管理和处理大型数据集成为可能,避免了依赖昂贵分布式集群方案的需求。

总结

DuckDB的集成极大地增强了Clojure在本地处理大规模关系型数据的能力,使小团队也能进行高效的数据处理,体现了高质量、高效计算工具在实现数据处理民主化方面的价值。

19. Position: LLMs Can't Jump (openreview.net)

由于您提供的内容是 OpenReview 平台用于身份验证的提示页面,并非学术文章“Position: LLMs Can't Jump”的正文,因此无法基于此内容进行实质性总结。

该页面的主要内容和功能如下:

  1. 验证要求:提示用户需要完成一项检查才能继续访问 OpenReview 网站。
  2. 解决方法:提供了两种绕过此检查的选项:完成上方的验证,或使用已有的 OpenReview 账户登录。

建议: 要获取文章“Position: LLMs Can't Jump”的准确内容,您需要先通过上述验证步骤。成功访问后,方可阅读文章全文以进行总结。

20. How Cops Are Trying to Hide Their Use of Flock (www.404media.co)

美国爱荷华州沃佩洛县警方明确指示,逮捕嫌疑人时不得透露使用了Flock自动车牌识别系统。其政策文件规定:“不要向车辆乘员提及ALPR(自动车牌读取器)的使用”,“除非绝对必要,否则不要在报告或投诉中提及ALPR的使用”。如需在报告中解释,建议使用“利用县资源”等模糊表述。

此做法凸显了Flock公司所宣称的“透明”与其客户实际操作间的矛盾。尽管Flock声称重视“问责制”和“治理”,并提供审计工具,但其在全美数千城镇的部署与使用政策却极不一致。一些执法部门被联邦调查局和司法部告知,应“在允许范围内尽可能模糊”地说明使用Flock的原因,以避免公开记录查询。

许多城镇在缺乏充分公众监督的情况下与Flock签订合同,实质上将居民悄然纳入了全国性监控网络。沃佩洛县警方负责人表示,无需告知调查对象其方法来源,以防止罪犯学会规避。这种隐藏使用的行为,让人联想到过去执法部门对“黄貂鱼”手机基站模拟器等监控技术的保密做法,甚至不惜为此撤销案件。

文章指出,警方的做法与Flock公司倡导的透明性背道而驰,引发了关于执法监控技术使用规范、政策一致性及公众知情权的争议。

21. Three Six Mafia – Data about "6/6/6 dating" (2024) (divingintheshallowend.com)

三六黑手党:关于“6/6/6约会”的数据剖析

本文以统计学方法,幽默地分析了网络流传的“三六法则”——即男性约会需满足年收入6位数、身高6英尺、阴茎6英寸——的严苛程度与各要素间的补偿关系。

核心方法与数据基准

作者将“排他性得分”定义为1 - 百分位数,用于衡量满足某一条件的稀有程度。

  • 身高:基于美国20-30岁男性数据(均值μ=70英寸,标准差σ=3英寸)。6英尺(72英寸)位于第75百分位,排除75%的人群,排他性得分(ES)为25%
  • 阴茎长度:基于成年男性勃起长度数据(均值μ=5.166英寸,标准差σ=0.654英寸)。6英寸位于第90百分位,排他性得分(ES)为10%
  • 收入:2014年美国收入数据经对数变换后近似正态分布(均值μ=10.8,标准差σ=0.758)。10万美元年薪的排他性得分为17%

假设以上三者独立,同时满足所有“三六”条件的基准混合排他性得分(BES) 为: $$BES = 25% \times 10% \times 17% = 0.425%$$ 即在100个随机男性中,可能仅有0.4人同时满足所有条件。作者将此0.425%称为“浅薄常数”。

指标间的补偿关系分析

通过固定其中一或两个指标,可计算出达到相同0.425%基准所需其他指标的临界值,并揭示了非线性补偿关系:

  1. 身高与长度的补偿(收入固定10万美元):

    • 一英寸阴茎长度的价值远高于一英寸身高,因其在分布曲线中移动的标准差更大。
    • 当阴茎长度极长(如6.5英寸,ES很高)时,所需身高降至常数,形成“性感流浪汉山谷”——即身高与收入变得几乎无关。
  2. 身高与收入的补偿(长度固定6英寸):

    • 当身高极高(如6英尺4英寸)时,收入要求急剧下降,形成类似的“山谷”。
  3. 收入与身高的补偿(长度固定):

    • 可绘制热力图显示,在平均身高和长度下,达到基准需要约25万美元收入。
    • 极端高个子或“优势巨大”者所需收入可低至近千美元;而身材平均者需极高收入补偿。

对三个具体问题的回答

基于上述框架,文章得出了以下具体结论:

  1. 身高5‘3”但收入20万以上能否约会?

    • 可以,但需阴茎长度ES达到13.7%,即约5.88英寸。
  2. 需要多高才能补偿“微阴茎”(假设3.5英寸)?

    • 相比于理想“三六”男性,需将身高ES提升至0.25%,对应身高约75.9英寸,即需增高近3英寸。
  3. 是否存在一个阴茎长度,使身高和收入都变得无关?

    • 存在。当阴茎长度的单独排他性得分达到0.425%时,即长度约为6.89英寸,其本身已足够稀有,无需其他条件补偿。

总结

本文通过统计建模,量化了“三六法则”的严苛性(仅0.425%男性完全符合)以及各指标之间的复杂补偿关系。其核心发现是:阴茎长度在提升“排他性”上效率最高,其次是身高,收入则相对效率较低;且各指标存在阈值效应,当某一指标极端优秀时,其他条件可大幅放宽。 作者强调此为娱乐性数据分析,旨在探索数据与社会概念,并提供了可下载的Excel模型供读者自行计算。

22. The Warp Agent CLI (www.warp.dev)

Warp Agent CLI 摘要

Warp Agent CLI 是一款独立的命令行 AI 代理工具,旨在为开发者在任何终端环境(如 Ghostty、iTerm 2、VS Code 及系统内置终端)中提供卓越的多模型代理体验。它基于 Warp 终端基础设施构建,重点解决了传统代理 CLI 与 Shell 集成不佳的问题。

核心架构与功能

  • 多路复用架构:采用类似 tmux 的架构,在代理会话中管理 pty 连接,原生感知终端的输入与输出(Blocks),提供更深度的交互体验。
  • 持久会话与远程代理:允许在代理会话中自由切换目录,且无需在远程机器上安装二进制文件即可运行代理,非常适合多仓库项目和权限受限的云环境。
  • 控制交互式应用:代理能够运行并控制全屏和交互式终端应用(如 sqlite、python、vim、gdb 和 htop),支持在 REPL 中交互式调试或生成查询。
  • 无缝输入与自动补全:内置分类器可自动区分 Shell 命令与自然语言提示词,并继承了 Warp 终端的 Tab 键补全功能,提供参数和标志建议。

高级工作流与编排

  • 多代理自动编排:作为编排代理,它能将复杂任务自动分解并委托给子代理。提供原生界面查看各代理状态,支持使用方向键切换会话,并能跨不同模型或框架(如 Claude Code、Codex)进行任务分配。
  • 云代理交接:支持通过斜杠命令将本地 CLI 的工作无缝交接至云端。用户关闭电脑后,仍可通过 Web 界面集中监控和引导云端代理继续工作。

模型路由与成本优化

  • 智能路由:内置前沿模型和美国托管的开源权重模型,可根据任务复杂度自动进行模型路由,实现成本与性能的最优平衡。
  • 高度可定制:提供对自定义模型路由器的一流支持,允许开发者通过配置文件灵活定义特定任务所使用的模型。

安装与配置

  • 跨平台支持:提供 Mac、Linux(终端)和 Windows(PowerShell)的安装方式。
  • 灵活的推理配置:用户可通过购买 Warp 月度订阅(含推理额度)、购买按需临时积分,或添加 OpenAI 兼容的 API 密钥及第三方订阅(如 SuperGrok)来配置推理服务。
24. When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation (arxiv.org)

《当AI基准测试停滞:基准饱和的系统性研究》文章总结

研究背景与问题 人工智能(AI)基准测试是衡量模型进展和指导部署决策的关键机制。然而,基准测试往往会快速“饱和”,导致难以有效区分不同模型的性能差异,从而削弱了其长期评估价值。

研究目的与方法 本研究旨在明确定义“基准饱和”的概念,并对其进行系统性分析。研究团队考察了60个语言模型基准测试,并引入了14个与饱和现象相关的属性来进行全面评估。

核心发现

  1. 饱和现象普遍且随时间加剧:在近一半的受试基准测试中观察到了饱和现象,且基准测试的饱和率会随着其发布时间(年龄)的增加而不断上升。
  2. 影响抗饱和能力的因素:基准测试对饱和的抵抗力(即延缓饱和的能力)主要受“专家策划(expert-curation)”的影响,而与其是否包含“公共测试数据(public test data)”无关。

结论与意义 研究结果表明,通过优化基准测试的设计选择,可以有效延长其使用寿命。这一发现为未来开发更持久、更稳健的AI模型评估方法提供了重要的理论依据和实践指导。

文献元数据

  • 作者团队:由 Mubashara Akhtar、Anka Reuel 等众多研究人员共同撰写。
  • 版本迭代:文章经历了四次版本更新(v1至v4),提交时间跨度为2026年2月至2026年8月。