2026-07-10

11 篇热帖

3. GLM 5.2 is nearly as accurate as a human book keeper (toot-books.pages.dev)

GLM 5.2 模型在季度增值税申报任务中的评估

任务概述
对开源模型 GLM 5.2 在为英国中小企业(SME)准备季度增值税(VAT)申报表的任务上进行了性能评估。增值税申报是英国增值税注册企业的法定义务,通常由外部会计事务所处理,费用约为每季度 750–2,100 英镑。本测试模拟了该合规任务,以检验模型的准确性。

测试结果

  • GLM 5.2 在 68 分钟内处理了 59 笔交易,通过命令行工具(CLI)输入会计软件。
  • 生成的增值税申报表整体基本正确,关键数值(Box 5)仅与人工结果相差 7 便士(约 10 美分)。
  • 总原始 token 成本为 2.73 美元

测试方法

  • 基准数据来自真实公司(Vineyard Finance)2026 年第一季度的账目,由人工准备并验证。
  • 模型运行在隔离的 GCP 实例中,可访问互联网和会计软件,但无法接触真实答案。
  • 评分基于会计软件最终状态的 6 项标准:交易类型、会计科目、增值税处理方式、增值税金额、反向征收增值税及发票附件。

错误分析

  • 总计 354 项评分点中,模型有 20 项错误,分布在 18 笔交易中。
  • 最严重的错误:对创始人股份(10,000 英镑)的会计处理有误。模型记入“资本账户”而非正确的“未缴股本”,可能引发法律和审计问题。
  • 其他错误
    • 14 笔交易混淆了“零税率”与“免税”增值税类别(实际影响小,但专业会计师通常不会犯此错误)。
    • 3 笔交易在分割交易中错误处理增值税(例如,对同一笔服务重复计提增值税)。
  • 模型在 3 月未重复“零税率”错误,表明其处理存在随机性。

模型正确处理的方面

  • 除一笔交易外,均正确分类至会计科目。
  • 始终正确关联发票。
  • 能正确处理复杂交易(如银行间转账、伪装为卡消费的转账、同日同金额交易等)。

结论与展望

  • GLM 5.2 已能近乎完美地完成基础记账任务,尤其在复杂交易处理上表现突出,接近人类专业记账员水平。
  • 记账自动化正成为已解决的问题,当前重点应放在构建适配工具(如产品化封装)以服务中小企业。
  • 作者正在开发相关产品(toot-books.com),并寻求合作。
4. Interview with Mitchell Hashimoto about Ghostty and Zig (alexalejandre.com)

Mitchell Hashimoto(Vagrant、Terraform 等工具的创立者)如今正致力于开发终端模拟器 Ghostty 与 Vouch。他在采访中分享了对终端生态、Zig 语言与开源维护的深层思考。

Ghostty 的起源
离开 HashiCorp 后,他希望重拾技术功底,聚焦 GPU 编程、单机系统编程与学习 Zig。在做了 15 年 CLI 工具后,他发现自己并不真正了解终端模拟器的工作原理,于是打算写一个能跑 vim 并自我编译的玩具项目。但深入了解后,他发现市面上缺少一个兼顾速度、丰富功能与原生跨平台体验的终端。Ghostty 最初只是与朋友的私享项目,因好用而逐渐在私密测试中流传开来。

终端的未来与 API 设计
Hashimoto 不主张把终端做成浏览器式的超级应用平台。他认为基于文本的应用应长于快速实现、易于交互和组合(Unix 哲学),而非复刻桌面或浏览器的全部功能。当前最大的障碍是 PTY 基于非结构化字节流的带内信号。他赞赏 PowerShell 的结构化数据思路。

在设计新终端 API 时,他主张充分借鉴已有主流平台的前车之鉴——如浏览器的 DOM、Apple 的 Cocoa/SwiftUI、Windows 的 Win32、Linux 的 GTK/Qt——而非闭门造车。他最想引入两项协议:一是 n-screen API,允许程序在后台创建无限多个屏幕并叠加,甚至让终端应用的原生标签页变成真正的窗口标签;二是 按钮协议,类似 OSC 8 超链接,让按钮点击事件能穿透历史回滚区,解决主屏应用(如 Claude Code)在内容滚入历史后交互失效的问题。

他也曾实验过用 Wayland 取代整个 PTY 协议,但最终放弃。他指出现代终端缺乏真正有品味的标准组织,愿景散乱。未来或许可以造一种不叫“终端”的全新文本应用承载层,再叠加兼容层跑遗留程序。

开源维护与用户预期
Hashimoto 明确表示:开源维护者对使用者零义务,许可证的“按原样提供、无担保”就是契约。但他仍会努力做好软件。他主张在“用户问题”与“愿景推进”之间保持平衡:若每天只修 issue,软件会变稳定但僵化;若全盘接受 PR,则会失去统一愿景。优秀的解决方案应优雅地一次性解决多个问题,而非堆叠补丁。他强调“功能丰富”不等于“臃肿”:不用的功能只占用少量磁盘/内存,不应在运行时产生成本。若用户对某个功能极度排斥,欢迎直接 fork——开源的核心是自由与权利,而不是稳定或问责。如果要求有人对缺陷负责,那就应该去购买商业软件。

Zig 与语言观
他理解并接受 Zig 尚未 1.0 的状态。作为下游用户,他欣赏 Andrew Kelley 在必要时不惜破坏向后兼容的决断,如 0.15 对 writer 接口的重构就让 API 变得更好。Zig 仍在持续打磨编译速度,甚至为此移除语言特性。Hashimoto 认为 1.0 可能还要数年,但借助 AI,大规模语言迁移的成本正在被削弱——虽然 Zig 社区本身反 AI,这颇具讽刺意味。

在库与 API 设计上,他建议广泛涉猎不同生态(如 Java 的 builder 模式等),吸收最顺手的概念;同时坚持“名词”很重要,API 的语义应围绕用户真实场景构建。

质量、速度与工具观
他认为做出好产品的前提是深度使用自己开发的软件,并具备超越单一用户需求的整体视野。企业规模一大,这种品味往往流失。他用 AI 做快速原型和概念验证,但绝不直接上线,会再亲手重写以保证质量。他强调:最终交付的代码必须自己读懂,并对用户抱有同理心。

学习建议
他建议学计算机不应纠结于具体学 C 还是 Zig,而应透过语言理解计算机如何工作:CPU 调度、内存、缓存、文件系统等。另一种方法是阅读高级语言的标准库实现,了解那些被忽略的底层细节。语言只是工具,背后的原理才是核心。

5. Parental device use and the adolescent-caregiver attachment bond (www.frontiersin.org)

研究背景与目的
本研究旨在探讨青少年对主要照顾者因设备使用而分心(即“技术干扰”technoference或“手机冷落”phubbing)的感知,及其与 caregiver-adolescent 依恋不安全之间的关联。鉴于过往文献多关注青少年自身设备使用对健康的影响,而较少考察照顾者在场时使用设备对亲子关系的作用,作者在美国一般青少年群体(N = 600,年龄 12–17 岁)中验证了“设备依恋干扰量表”(Device Attachment Interference Scale, DAIS),并检验其与“亲密关系经验-关系结构量表”(ECR-RS)所测依恋模式的关联。研究假设:青少年感知到的照顾者注意力可得性越低(DAIS 得分越高),其不安全依恋水平越高。

研究方法
研究通过 Qualtrics 于 2025 年 8 月招募青少年。DAIS 原含 15 个条目,测量青少年对照顾者设备使用行为及其情绪评价的频率感知。作者将样本随机分为两部分,分别进行探索性因子分析(EFA, n = 200)与验证性因子分析(CFA, n = 400),并以 ECR-RS 评估青少年对母亲样人物(n = 450)及父亲样人物(n = 125)的焦虑型与回避型依恋。

主要发现

  • 量表结构:EFA 与 CFA 结果支持 DAIS 为单维结构(12 个条目),内部一致性良好(α = 0.919),单因子模型可解释 53% 的方差;CFA 模型拟度可接受(CFI = 0.931, RMSEA = 0.072)。
  • 依恋关联:回归分析显示,在控制年龄与性别后,DAIS 得分越高,青少年对母亲样人物的回避型依恋(b = 0.630, p < 0.001)和焦虑型依恋(b = 0.819, p < 0.001)均显著更高;对父亲样人物也呈现一致模式(回避型:b = 0.434, p < 0.001;焦虑型:b = 0.990, p < 0.001)。这表明照顾者设备相关分心行为与青少年不安全依恋之间存在稳健关联,并适用于不同性别的照顾者。

讨论与局限
作者指出,本研究为横断面设计,无法确定因果方向,亦不能排除不安全依恋水平较高的青少年更易负面解读照顾者行为(反向因果或共同方法偏差)。此外,DAIS 的部分条目涉及情绪评价,可能与焦虑依恋概念存在重叠;且样本量不足以进行跨照顾者性别的测量不变性检验。未来研究应采用纵向设计、多信息源及行为观察法(如录制亲子互动视频),以厘清作用机制并验证量表的会聚效度与区分效度。

结论
研究结果提示,在数字时代,青少年对照顾者设备使用中注意力可得性的感知是一个与依恋不安全密切相关的家庭关系情境因素。与传统依恋风险因素(如忽视、虐待)不同,设备造成的分心往往是间歇性、社会常态化且完全受照顾者意志控制的行为,但反复发生仍可能损害青少年的依恋安全感。DAIS 有望作为临床与家庭评估工具,用以识别和处理数字设备使用背景下的依恋相关家庭互动问题。

6. AI-generated videos to maximally drive a target brain region (nevo-project.epfl.ch)

未提供正文内容,因此无法提取要点进行摘要。请补充文章正文后再次尝试。

7. Why American ambulance rides are so expensive (davidoks.blog)

美国救护车费用高昂且频繁引发"惊喜账单"(患者在不知情下被网络外服务商收取高额差额),其根源并非运营商贪婪,而是源于1965年确立的、与现实严重脱节的按次付费制度。

历史演变与结构错配 1965年Medicare将救护车服务纳入医保报销时,将其视为普通医疗程序,按每次行程事后付费。彼时救护车多由殡仪馆用灵车兼营,仅提供简单转运,固定成本极低,按次计费尚属合理。然而1960年代后,心肺复苏、便携式除颤器和远程 telemetry 等技术催生了现代急救医疗体系(EMS),行业性质发生根本转变:需要专业培训人员、昂贵车载设备和全天候待命的站点,固定成本飙升,边际成本却极低。救护车服务本质上成为"救援期权"——社会为"随时可得"的保障付费,而非为单次行程付费。但美国法律仍强制其沿用六十多年前的按次收费模式。

成本的极端转嫁 由于 Medicare 和 Medicaid 的全国统一费率远低于实际成本(例如每次运输平均成本约2,673美元,Medicare仅支付约329美元),且法律禁止向这些参保人差额收费;无保险患者又大多无力或拒绝支付。因此,救护车系统维持待命的全部固定成本,以及公共医保带来的巨额亏损,只能转嫁给少数私人保险患者。与普通医疗不同,保险公司无法向救护车"导流"会员(救护车必须响应急救呼叫),故救护车缺乏加入保险网络的动力。约80%的地面救护车以网络外身份计费,保险公司仅按自认合理金额赔付,剩余差额由患者承担——这正是案例中6英里转院产生近3,000美元自付费用的核心机制。

改革困境与可行出路 2020年联邦《无惊喜法案》禁止了医疗系统 almost all 领域的惊喜账单,却不得不将地面救护车排除在外,因为私人保险收费是覆盖全行业固定成本的唯一资金来源,限制收费将直接导致大量服务商破产。纽约州曾要求保险按救护车账单全额支付网络外费用,结果只是将成本转化为更高保费,救护车价格反而上涨13%。

文章指出,根本解法在于让全社会为"救援期权"付费,而非仅靠少数使用者承担。英国、日本等国直接以税收资助急救系统;澳大利亚维多利亚州则通过"Ambulance Victoria"会员制,以约每年70美元的家庭年费提供无限次服务。美国部分地方也已探索类似路径,如农村县以财产税全额资助,或通过水电账单每月预收数美元以替代高额事后账单。在支付结构真正匹配"待命成本"之前,美国救护车系统将继续陷于对使用者收费畸高、却又整体难以为继的困境。

8. EU Commission: addictive design Instagram and Facebook in breach of the DSA (ec.europa.eu)

欧盟委员会在其新闻角(Press Corner)页面中指出,Instagram 与 Facebook 的成瘾性设计违反欧盟《数字服务法》(Digital Services Act, DSA)。该页面属于欧盟委员会官方发布渠道,归类为“亮点、新闻稿和讲话”(Highlights, press releases and speeches),并带有欧盟委员会官方标识。

9. Building a real-time AI tutor for 5-year-olds (www.ello.com)

为5岁儿童构建实时AI辅导系统的工程实践

Ello团队为4-9岁儿童开发AI辅导工具时,核心约束是亚秒级响应:延迟会让儿童注意力流失并停止学习。

放弃标准Agent循环

标准工具循环的首token需要2–3秒,加上执行与音频播放,交互间隔达3-4秒。儿童因此感到无聊,甚至学会“选择性忽略”。

团队构建自定义框架:模型在单次响应中流式输出多个动作,解释器边解析边执行

10. Late Bronze Age Collapse (acoup.blog)

青铜时代晚期崩溃(LBAC)指约公元前1220年至前1170年间,东地中海与中东国家体系发生的一系列遗址毁灭、废弃与衰退。其严重程度超过西罗马帝国崩溃,但并非彻底的文明终结。该领域高度依赖考古证据(如破坏层与火烧遗迹),且随着新发掘不断修正认知。

崩溃的范围与过程 崩溃分布极不均匀,呈现为一系列不均质的破坏与衰退“波浪”。雨水农业区受创最重:希腊的迈锡尼宫殿国家于约前1200—前1180年间相继毁灭,部分城市核心随后废弃;安纳托利亚的赫梯帝国在约前1170年瓦解,首都哈图沙被毁且未重建。北黎凡特的乌加里特约前1190年灭亡,但西顿、比布鲁斯以及雅典、耶路撒冷等城市幸存或延续。埃及新王国虽击退利比亚人与“海上民族”入侵,但经历内战与经济压力后丧失对外投射能力,进入长期衰退。亚述与美索不达米亚的巴比伦则主要表现为收缩,未彻底崩溃。

被否定的旧理论与主要原因 “多利安入侵”说已被考古学否定:线形文字B证明迈锡尼人本就讲希腊语,物质文化无断裂。单一火山灾难(如冰岛赫克拉喷发)的时间也与崩溃核心时段不符。

当前学界共识倾向于多重因素叠加:

  1. 气候干旱:树轮证据显示约前1190年代东地中海异常干燥,导致希腊、安纳托利亚和黎凡特等雨水农业区歉收,削弱高度中央集权国家的财政汲取能力与君主合法性。
  2. 战争消耗:此前各国战争加剧与大规模筑城已耗尽劳动力、粮食储备与公共耐心。
  3. 连锁反应与海上民族:崩溃具有传染性。希腊宫邦解体催生难民流与武装劫掠者;埃及铭文中的“海上民族”(包括可能的希腊人、安纳托利亚人与黎凡特人)实为多民族联盟,反映了区域动荡向外扩散。贸易网络(尤其是青铜所需的锡与维系贵族忠诚的 prestige goods)中断,进一步打击各国税收与军事供给。

长期影响 希腊遭受最沉重打击:大规模石建筑消失,城市萎缩,线形文字B失传,进入“希腊黑暗时代”(约前1100—前750年)。中央国家机器的真空为日后独特的 polis(城邦)制度提供了成长背景。

安纳托利亚与黎凡特经历长期政治碎片化,为新兴势力创造空间:腓尼基城市(推罗、西顿、比布鲁斯)借此机会崛起,重建地中海贸易并向外殖民,其字母经希腊、意大利演变为拉丁字母的基础;南黎凡特则兴起了以色列与犹大王国,其崇拜雅威的宗教最终发展为亚伯拉罕诸教。

总之,LBAC是一次由气候、战争与体系互赖性共同触发的多米诺式危机,重塑了东地中海的政治格局、贸易网络与文字传播,为铁器时代及古典世界奠定了基础。

11. Good Tools Are Invisible (www.gingerbill.org)

好的工具应当是“隐形”的——融入背景、不干扰工作,而非把自身缺陷包装成“有趣的谜题”。作者批评了将工具短板重新定义为“乐趣”的倾向,认为工具制造者的终极目标就是让工具消失于用户的意识中。

文本编辑器的误区

以 Vim 为例,许多人赞美的并非其真正的高效,而是将繁琐操作当成“黑客乐趣”,例如花大量时间录制宏来处理一次性文本重构。作者指出,这类任务在 Sublime 中用多光标或脚本几秒即可完成。他本人使用 Sublime 十五年,正是因为它快捷键与图形系统一致,减少心智负担;多光标在绝大多数批量操作下比宏更直观;且不会在流程中留下大量待解的“谜题”。精通编辑器后,它本应消失于背景;一旦需要绕弯子,它就不再隐形。

工具即身份

工具选择常被当成身份旗帜与部落信号。当工具成为人格的一部分,承认其缺陷就如同否定自己。于是用户不仅容忍缺陷,还会捍卫甚至炫耀它们,导致围绕工具的理性讨论变成宗教论战。

感觉高效 vs 真正高效

解决别扭问题会带来“很聪明”的快感,但这不等于实际产出。真正的衡量标准是墙上时钟时间与出错次数,而非过程中的成就感。许多被狂热推崇的工具若按此检验并不占优。

终端界面与图形界面

有人认为终端应用(TUI)优于图形界面(GUI),理由是 GUI 无法纯键盘操作。但作者指出,这只是多数 GUI 做得不够好,并非 GUI 本身不可行。键盘导航在 GUI 中完全可能,只是开发者未投入精力。把现有工具的局限误认为其本质缺陷,是常见的思维误区。

Linux 桌面的教训

Linux 桌面大众化迟缓,部分原因在于核心用户把折腾配置文件视为乐趣。作者认为,极致可配置性不应是目标,而应只在必要时提供“逃生舱”。工具制造者的责任是提供优秀的默认配置,而非将决策负担转嫁给用户。“高度可配置”往往是拒绝做决定的借口;好默认才是对用户时间的尊重。

学习曲线不是美德

有人声称陡峭的学习曲线能筛选用户,且跨过之后终身受益。但学习曲线是成本,不是优点。这往往是沉没成本谬误的美化:“我花了数月学会,所以它一定值得”。这种心态又把工具本身当成了谜题。

结论

作者并非反对任何特定工具,而是反对一种危险叙事:把局限说成特性、把绕过缺陷的劳苦当成奖赏、把工具升格为身份象征。检验工具的唯一标准,是它能否让你忘记它的存在。最好的工具不是故事最精彩的那一个,而是你在使用中完全意识不到的那一种。