0%

Hacknews Daily Summary - 2026-10-08

今日 Hacker News 首页前五并不按分数排列。前两条和第五条是模型发布:Anthropic 的小模型 Claude Haiku 5.5,以及 OpenAI 把 GPT-6 的交互界面铺到更多 ChatGPT 用户。中间夹着 MIT News 上 Margaret Hamilton 的讣告,404 Media 写的陆龟 Jonathan 基因组,以及一个刚建一天、分数只有十几分的 TypeScript 编译器 Rust 移植。OpenAI 博文直连返回 HTTP 403,下面的页面原文来自 r.jina.ai 转写,并与 Deployment Safety Hub 上 2026-10-07 的系统卡核对。分数和评论数是抓取时的快照。

1. Claude Haiku 5.5

背景介绍
Anthropic 的发布页标注 October 7, 2026,标题是 Introducing Claude Haiku 5.5。页面称它是他们迄今最便宜、最快、也最强的小模型,面向摘要、压缩、数据库查询、分类这类高量、对成本敏感的工作,并适合作为 Opus 5.5 和 Sonnet 5.5 在编程任务上的子代理。页面还把它放到实时客服和浏览器操作这类看重速度的场景。脚注写明:它在各模型的标准速度下是目前最快的,但比开启 Fast Mode 的 Opus 更慢。

价格是这篇的主体。页面写,平均跑下来大约比 Haiku 4.5 便宜 75%。脚注把这个平均数拆开:相对 Haiku 4.5,不超过 10 万 token 的请求降价 90%,超过 10 万 token 的请求降价 50%;在 Haiku 4.5 上,大约 90% 的请求落在前一档。同一脚注还写,Haiku 5.5 换了和 Sonnet 5.5、Opus 5.5 相近的分词器,完成同一件事会多用一些 token,上面的降幅已经把这一点算进去。价目表按每百万 token、并以「10 万 token 以内 / 以上」两档列出:缓存读取 $0.01 / $0.05,缓存写入 $0.125 / $0.625,输入 $0.10 / $0.50,输出 $0.50 / $2.50。对照栏里 Haiku 4.5 是缓存读取 $0.10、写入 $1.25、输入 $1.00、输出 $5.00;Sonnet 5.5 是缓存读取 $0.10、写入 $2.50、输入 $2.00、输出 $10.00。页面说,10 万 token 以内的请求约占上一代 Haiku 请求的 90%,这一档尤其划算。

同一天还有两件配套调整。Sonnet 5.5 的缓存读取从每百万 token $0.20 降到 $0.10,页面估计这会让大多数 agent 任务便宜大约 20%。本周起,Max 和 Team 订阅会得到用在 Claude Platform 上的每月 API 额度:Max 5x 每月 $100,Max 20x 每月 $200,Team 最高 $500,在用户之间共用;额度可用于任何模型。开发者这边,Claude 的 Python 和 TypeScript SDK 增加了仍处 beta 的 computer use 和 browser use。模型 ID 写的是 claude-haiku-5-5,并已在 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 上提供。

它是第一代带可调 effort(Low、Med、High、Xhigh、Max)的 Haiku。页面上的基准是 Anthropic 自己的表,本文没有重跑。知识工作 GDPval-AA v2.1 的 Elo:Haiku 5.5 为 1620,Haiku 4.5 为 735,GPT-6 Luna 为 1437,对照用的 Sonnet 5.5 为 1840。AA-Briefcase v1.1:1578、614、1336、1824。计算机操作 OSWorld 2.1 的离线子集:72.4%、15.7%、48.9%、83.9%。Humanity’s Last Exam 无工具:45.9%、10.2%、表内对 Luna 是破折号、56.9%;有工具:57.4%、18.7%、破折号、64.5%。Terminal-Bench 4.0:39.2%、0.0%、16.4%、70.6%。FrontierCode 1.1(Main):46.4%、破折号、42.4%,Sonnet 5.5 那一格写成 52.1% Xhigh。视觉推理 Chartography、无工具:46.4%、6.4%、29.1%、61.6%。页面接着说,Terminal-Bench 4.0 这类复杂编程仍然更适合 Sonnet 5.5 和 Opus 5.5;Haiku 5.5 适合范围更窄、以前会因为太贵而不跑的工作。

客户引言都标了公司和作者,数字是对方的早期测试,不是本文复测。Asana 的 Aaron Vinh(Staff Software Engineer)写,AI Teammates 的评测里,任务完成延迟下降超过 30%,每个 agent 回合的推理最多快 2.5 倍。HubSpot 的 Ze’ev Klapow(Distinguished Software Engineer)写,模拟门户上的 CRM 任务三次平均 92.8%,是他们在较小模型上见过的最高分;其中一项找过期但含糊记录的审计,Haiku 5.5 最快,命中最高、误报最低。AlphaSense 的 Daniel Campos(Distinguished Engineer)写,Ask in Document 每周大约 800 万次生产调用;400 条查询上,相对 Haiku 4.5 是 0.84 对 0.76。Box 的 Yashodha Bhavnani(VP of AI Products)写,比 Haiku 4.5 高 11 分,延迟大约一半。Rogo 的 Alex Wang(Applied AI)把它放在查 10-K、抽分部收入这种子任务上。Cognition 的 Walden Yan(Co-Founder & CPO)写,Devin Fusion 用它做 sidekick 时 FrontierCode 为 66.2,同时降低成本和延迟,Devin CLI 里可以配 Opus 5.5 做主模型。

对齐一节写,相对 Haiku 4.5,几乎所有对齐评测都更好,不当行为和配合滥用的意愿都更少,细节在 Haiku 5.5 系统卡。网络安全护栏比 Haiku 4.5 更严,但比最近其他模型松一些:允许的防御性任务比 Sonnet 5.5 更宽,仍然拦截渗透测试和更像攻击者会用的手法。生物学护栏与 Sonnet 5、Sonnet 5.5、Opus 5 相同:研究性问题可以,被判断为可能造成伤害的请求会被限制。更宽的生物和网络安全用途可以申请 Life Sciences Verification Program 和 Cyber Verification Program。

主要讨论方向与观点
讨论集中在价格门槛和它适不适合当主力。minimaxir 把价目表念了一遍,认为 10 万 token 的分界太低,而且只加在 Haiku 上,Sonnet 和 Opus 没有;做 agent 很容易越过,做普通生成或分类则划算。他对照的 GPT-6 Luna 是输入 $0.10、输出 $0.50,并在编辑里补了一句,Luna 的门槛大约在 272k。simonw 说自己对 Haiku 4.5 的意见就是它比 Luna 贵 10 倍;现在两者在 10 万 token 以内同价,超过之后 Luna 更便宜,即便 Luna 在 27 万 token 再涨价,仍然低于 Haiku。272k 和 27 万都是这两条评论里的数字,Anthropic 这篇页面没有写 Luna 的分档。simonw 还说,Anthropic 自报的基准都高于 Luna。

simonw 用不同 effort 画了鹈鹕骑自行车。Low 会把车架画错,medium、high、xhigh、max 都画对了。max 花了 5 分 9 秒、3.3826 美分;最便宜的 low 是 0.0936 美分、7 秒。他写,最新的 llm-anthropic 插件直接查 Anthropic 的模型列表,所以不用为这个模型改插件,刷新之后可以用 claude-haiku-5.5。他链了一年前 Haiku 4.5 的鹈鹕,并说那张很差。

chriddyp 贴了 Plotly 的 DataAnalyticsBench:相对 Haiku 4.5 便宜 9 倍、字母等级高两档,并且是默认速度下最快做完这套题的模型。40 道较深的数据分析题花费 $0.38,对照是 Opus 5.5 的 $15 和 Astra 的 $20。他说简单分析都对,需要再看其他变量的统计题不够坚持。相对 OpenAI,他写 GPT-6 Luna 稍好,成本大约是 Haiku 5.5 的 30%;GPT-6.1 Sol 全部答对,但贵 10 倍。这些是该评论里的结果。

jjcm 用图像转 HTML 试复杂界面,结论是不够用,并发现它会把活交给 Opus 5.5。他认为适合小的子代理和范围收得很紧的工作。wyrdcurt 觉得终于有一个便宜、值得用的 Haiku,10 万 token 的门槛偏低,但自己本来也只把小模型用在小任务上。charlesabarnes 和 seaal 都把每月 API 额度当成实际好处:可以在订阅之外的 harness 里做功能,而不必另付 API 或完全依赖端侧模型。charlesabarnes 同时担心,这是在为以后对用户不友好的改动做缓冲。

专有名词解释

  • effort:页面给 Haiku 5.5 的五档是 Low、Med、High、Xhigh、Max。用户用它在成本和能力之间取舍。各档在三张图上的具体分数,正文没有从图表里再抄一遍。
  • 缓存读取 / 缓存写入:价目表里的 cache reads 和 cache writes,单位都是每百万 token。Sonnet 5.5 这次只把读取从 $0.20 降到 $0.10。
  • OSWorld 2.1:页面描述为衡量代理能否操作一台真实计算机、完成长的多步任务。表上的百分比标明是离线子集。
  • Humanity’s Last Exam:页面描述为专家级学术知识和推理测试。表上把无工具和有工具分开,Luna 两格都是破折号。
  • Terminal-Bench 4.0:页面描述为在命令行里完成复杂、多步的专业任务。Haiku 4.5 在这张表上是 0.0%。
  • Claude Platform 月度额度:本周向 Max 和 Team 发放、只能用在 Claude Platform 上的 API 抵扣。页面写可用于任何模型。

HN 讨论:thread · 659 分 · 329 评

2. Margaret Hamilton has died

背景介绍
MIT News 的讣告写,Margaret H. Hamilton 于 9 月 30 日去世,享年 90 岁。讣告称她领导了 MIT Instrumentation Lab 里为 NASA 阿波罗计划编写飞行软件的团队,发表超过 130 篇,并推动软件工程成为单独的学科。她 1959 年到 1970 年代中期在 MIT 工作,之后自己创办软件公司。

履历按讣告的顺序是:1936 年生于印第安纳州 Paoli;1955 年起在密歇根大学读数学,后转入 Earlham College,1958 年取得数学学士、辅修哲学;1959 年随丈夫到波士顿。她先在 MIT 气象系给 Edward N. Lorenz 写天气预报软件,讣告说这是她进入编程的入口,后来的工作也进入了 Lorenz 关于混沌理论的发表。1961 年她到 MIT 林肯实验室,参加美国第一个防空系统 SAGE,为原型机 AN/FSQ-7(XD-1)写软件,并开始关注当时几乎没人做的软件可靠性。1965 年,Instrumentation Lab 登广告招聘「把人送上月球」的软件人员。她应聘后成为该实验室阿波罗项目的第一位程序员,也是项目里的第一位女性程序员。她先做无人任务,再领导载人任务的 onboard 飞行软件。到 1968 年,她是指挥与服务舱团队的助理主任,参与阿波罗软件的人超过 400 名。

讣告用两件事说明她说的防御式编程和优先级调度。女儿 Lauren 四岁时在指令舱模拟器里玩,在「飞行中」启动了发射前程序 P01,模拟器崩溃。Hamilton 在技术文档里加了警告,并提议用软件阻止真实任务里发生同样的事,但被否决,理由是受过训练的宇航员不会犯这个错。1968 年阿波罗 8 号上,Jim Lovell 在飞行中启动了 P01,导航数据消失;她和团队被叫去处理,之后她提议的改动才进了程序。另一件是 1969 年 7 月阿波罗 11 号着陆前,计算机报 1202:一个硬件开关故障让计算机过载,系统可能处理不了着陆。讣告写,她们做过优先级驱动的软件,可以关掉不必要的后台任务、保住关键任务;休斯敦信任这份软件,让任务继续。

实验室后来从 MIT 独立成 Draper Laboratory。1976 年她创办 Higher Order Software,基础是防错和容错。大约十年后创办 Hamilton Technologies,主产品是 Universal Systems Language(USL),一种强调防错和防御式编程的系统建模语言。奖项包括 2003 年 NASA Exceptional Space Act Award、2016 年奥巴马颁发的总统自由勋章、2017 年计算机历史博物馆 Fellow、2019 年 Intrepid Lifetime Achievement Award,以及 2022 年进入 National Aviation Hall of Fame。讣告还写,2015 年她参与开发的阿波罗软件被完整放上 GitHub;2017 年她成为乐高人仔,原型来自 MIT 科学传播者 Maia Weinstock 设计的一套 NASA 女性人物。她遗有女儿 Lauren Hamilton、女婿 Richard Selesnick、两名孙子和四名曾孙。追悼会订在春天,地点是马萨诸塞州剑桥。

Olivier de Weck(阿波罗计划教授、MIT 航空航天系临时系主任)和 Draper 总裁兼 CEO Jerry M. Wohletz 的悼词都在这篇讣告里。关于「软件工程」这个词,讣告引用她 2018 年对《El País》说的话:她开始用 software engineering,是为了让软件和做软件的人得到与硬件及其他工程同等的尊重;起初这被当成笑话。这是她的自述,讣告没有把它写成有文献裁定的「全世界第一次使用」。

主要讨论方向与观点
线程大多是悼念,技术补充不多。diskzero 说大约三十年前见过她和其他 Instrumentation Lab / Draper 的阿波罗一代;当时自己的多媒体 CD-ROM 创业公司,投资方是那批人后来成立的风投。他记得她讲形式化的控制系统,内容超出自己的理解。WarOnPrivacy、marcelo-earth 和 dzonga 都提到那张站在打印出来的代码旁的照片;WarOnPrivacy 链的是 MIT 2016 年的一篇现场报道。

muunbo 写「我记得她创造了 software engineering 这个词」。这是评论者的记忆。讣告里能对上的是上面那段《El País》引语,不是一条独立的词源考证。EvanAnderson 推荐计算机历史博物馆的口述史,并说读完之后,他相信 Steven Levy《Hackers》里那个故事的程序员就是她:有人深夜在 TX-0 上折腾,弄坏了一位学者正在跑的天气模拟,那位学者是 Edward Lorenz。讣告确认她为 Lorenz 写过天气预报软件,没有写 TX-0,也没有写这起夜间事故。TX-0 的对应是评论者听完口述史之后的判断。

schaefer 问原始阿波罗代码还能不能读。dudewhocodes 回复了 chrislgarry/Apollo-11。讣告只说 2015 年被放上 GitHub,没有点这个仓库名。xtajv 另推荐 Frank O’Brien 的 The Apollo Guidance Computer: Architecture and Operation(ISBN 978-1-4419-0876-6),说读起来像主管带着新员工看代码。Kim_Bruning 推荐 timmg 讲 AGC 如何工作的视频。本文没有打开这些外部材料。

专有名词解释

  • Instrumentation Lab / Draper:MIT 当时为阿波罗做 onboard 飞行软件的实验室。阿波罗结束后从 MIT 分出,成为独立的 Draper Laboratory。
  • SAGE:Semi-Automatic Ground Environment,讣告称为美国第一个防空系统。AN/FSQ-7(XD-1)是她在林肯实验室写软件时用的原型计算机。
  • P01:讣告里的发射前程序。模拟器和后来的阿波罗 8 号都出现过在飞行中误启动它的情况。
  • 1202:阿波罗 11 号着陆前计算机发出的警报。讣告的解释是硬件开关故障导致过载;软件按优先级关掉非关键任务后,着陆继续。
  • USL:Universal Systems Language,Hamilton Technologies 的主要产品,讣告描述为面向复杂系统、强调防错的建模语言和方法。
  • AGC:阿波罗制导计算机。评论里用这个缩写指向讲解视频和 O’Brien 的书;具体结构以那些材料为准,这篇讣告没有展开指令集。

HN 讨论:thread · 640 分 · 71 评

3. ‘Jonathan’ is the oldest land animal on Earth

背景介绍
404 Media 这篇由 Becky Ferreira 撰写,页面时间是 2026 年 10 月 7 日下午 2:00,datePublished 为 2026-10-07T18:00:38.000Z。文章说,阿尔达布拉象龟 Jonathan(Aldabrachelys gigantea)大约 1832 年在塞舌尔孵化,查尔斯·达尔文发表《物种起源》时他已经二十多岁;1880 年代和另外三只龟一起,作为礼物送给圣赫勒拿岛的英国殖民总督,此后一直住在那里。文章称他即便在这个经常活过一百岁的物种里也是例外,将近 200 岁。照片说明写,1880 年代和今天的图像来自 Wikimedia Commons 和圣赫勒拿政府(页面拼写为 St. Helene Government)。他现在住在总督府 Plantation House,是岛上的旅游点之一。文章还写,拿破仑死在圣赫勒拿,时间比人们认为 Jonathan 孵化的年份早大约十年。

采样过程来自文章对作者 Stephen Clark 的电话采访。Clark 被写成非营利组织 Kallel Foundation 的衰老研究者、论文作者之一。他 2017 年就联系饲养员;抽血被认为太冒险,于是哄 Jonathan 张嘴做口腔拭子。早期样本不完整、新冠,以及后来限制接触 Jonathan 的新规定,把结果拖了很久。样本最终由美国太空军从圣赫勒拿送到佛罗里达。

文章对研究结果的表述是:相对其他龟(包括一只 36 岁、名叫 Tank 的个体),Jonathan 在大多数衰老通路上有独特基因变异,文章点名 DNA 修复、胰岛素调节、线粒体功能和「低熵」甲基化。Clark 说衰老有很多标志,这项研究还只是开头。文章接着写,一些变异是团队根据其他长寿个体预料到的,包括 DNA 修复、端粒维持和细胞自噬;意外在甲基化组,与线粒体过程有关的那一部分异常「干净」,也就是低熵。文章说他们还做了更年轻龟的甲基化组,其中和一只 5 岁龟相差 189 年。文章的对比是:基因组其余部分的熵与年龄相称,线粒体甲基化组则接近那只 5 岁龟。Clark 说这需要更多研究才能跟上。文章后段把目标写成 Kallel Labs 的公司目标:影响人类的健康寿命和寿命。Foundation 和 Labs 两个名字都出现在这篇报道里,报道没有解释二者的关系。

页面链到的论文是 Science Advances 的 10.1126/sciadv.adw8887。本文没有读 PDF,下面这句来自 Crossref 摘要,和报道不是同一层文字。论文题为 Epigenetic insights into extreme longevity in the world’s oldest terrestrial animal, Jonathan,期刊为 Science Advances 第 12 卷第 41 期;Crossref 记录创建于 2026-10-07,印刷日期为 2026-10-09。摘要写:他们测定了 194 岁的 Jonathan 的基因组和甲基化组;相对其他巨龟(A. gigantea 和 Chelonoidis abingdonii),他在大多数衰老通路上有独特基因变异;与四只从 5 岁幼体到老年的其他阿尔达布拉象龟相比,DNA 甲基化和甲基化熵变化明显;低熵区域富集在线粒体电子传递链和 RNA 代谢相关基因的启动子上。摘要据此建议,这些通路的高保真转录可能对长寿物种很重要,并把模型写成:启动子上保持低甲基化熵,与高效的线粒体产能、RNA 加工和基因组修复连在一起。Crossref 列出 22 位作者,第一作者是 Benjamin Vaisvil(Kallel Foundation 与 Igenbio),Stephen W. Clark 的单位是 Kallel Foundation、Epiphany Biosciences 和 Vanderbilt-Ingram Cancer Center。摘要没有出现 Tank 这个名字,也没有把通路列表写成胰岛素调节或自噬;那些是 404 Media 文章里的说法。

主要讨论方向与观点
评论很少,也没有人声称复核了论文。scun 引用「大多数衰老通路上的独特变异」,把它比成游戏里把点数全加在寿命上。dyauspitr 拿陆生和海洋动物比较:这只最老的陆地动物还没到 200 岁,海里的动物可以到五六百年。两个数字都是这句评论里的说法。repeekad 问为什么是太空军送样本。sublinear 回复:那里很偏远,美国太空军在附近的阿森松岛有行动。这是评论者的解释,文章只写了运送这件事。pil0u 觉得不必为了研究去打扰这只龟。其余是关于《The Leftovers》里 Jarden 的类比,以及「他连兔子都追丢了」这类玩笑。

专有名词解释

  • 阿尔达布拉象龟:Aldabrachelys gigantea。文章和论文摘要都用这个种名称呼 Jonathan。
  • Chelonoidis abingdonii:摘要里用来对照的另一种巨龟,没有在 404 Media 正文里展开。
  • 甲基化组:DNA 上甲基化修饰的全体,影响基因如何被读取。文章说线粒体相关的那一部分熵特别低;摘要把低熵区域具体到电子传递链和 RNA 代谢基因的启动子。
  • 甲基化熵:这里用来描述甲基化模式有多「杂乱」。摘要把较低的熵和更稳定的转录联系在一起,这是论文自己的解释。
  • 端粒 / 自噬:端粒是染色体末端的重复序列;自噬是细胞回收自身组分的过程。两者出现在 404 Media 对「预料之中的变异」的转述里,没有出现在本文所读的 Crossref 摘要里。
  • Plantation House:圣赫勒拿总督官邸。文章写 Jonathan 和同伴长期住在那里。

HN 讨论:thread · 43 分 · 11 评

4. Rust Port of TypeScript (Tsc)

背景介绍
GitHub API 显示 pingdotgg/ts-rust 创建于 2026-10-07T05:17:07Z,抓取时默认分支 main 的最近推送是 2026-10-08T00:58:22Z,语言是 Rust,许可证字段为 MIT,仓库描述是 “An experimental Rust port of the TypeScript 7 compiler (tsc)”。账号显示名是 Ping.gg,简介是 “We build tools for modern devs”,博客为 ping.gg。当时 API 上的星标是 453、分叉 26。README 没有署个人姓名。

README 在一条横线之前是作者自己的话,横线之后作者写明:「下面的一切是我的 LLM 写的,不是我。」横线之上的内容包括:他想知道 LLM 能否把 TypeScript 的编译器、检查器和语言服务移植到 Rust;token 花费超过 42 万美元,但他认为大概 2 万美元就能做成。动机列了四条:测试模型能力、做一个快的 TypeScript 类型检查器、做一个能在 WASM 里高性能运行的检查器,以及玩梗。他称这是早期发布,在测过的每一个真实项目里兼容性是 100%,对绝大多数应用可以当作直接替换,同时让读者去看 Known problems。他又写:「我也没读过这代码的任何一行。」安装命令是 npm install -D tsc-rs,后面跟着 “Be warned, I have no idea if this will actually work.”

花费一段区分了两批模型。他用 OpenAI 的模型做了很久:GPT-5.6 Sol 和 GPT 6 Astra 的 API 标价 token 超过 40 万美元,几个月的 /goal 循环写出超过 130 万行 Rust,兼容性一直没过大约 84%。换成 Opus 5.5 之后,10 小时就有一个能用的 v0。他原以为 Opus 是在 Codex 已有代码上接着写,后来发现不是:Opus 5.5 从头开始,用大约十分之一的时间超过了 Astra。这一段的 Claude 花费他写成大约 24,047 美元的 API 花费、历时两周;他用的是 Claude 账号,相当于每周 200 美元计划额度的 925% 到 983%。42 万美元和 40 万美元都是作者说的 token 标价,不是本文看到的账单。

横线以下、被作者标成模型所写的部分,声称这是微软用 Go 写的 TypeScript 编译器的直接移植。上游是 microsoft/TypeScript(以前叫 typescript-go),钉在提交 673a5f17d713(2026-09-29,TypeScript 7.1.0-dev)。它保留 Go 版的算法、行为和 tsc 命令行、语言服务与 API。npm 包名用 tsc-rs,以免和 typescript 包冲突。平台写的是 Linux x64(静态链接)和 macOS arm64;Windows 和 Linux arm64 还没有。Effect 诊断(代码 377xxx)内置,对应 Effect-TS/tsgo 0.46.1 的规则移植;语言服务的快速修复、重构、悬停和补全没有移植。

同一段里的测试与性能也属于「模型所写」的部分,本文没有重跑。它写:TanStack Query core 和 Hono 的诊断与 Go 版一致;移植的 181,711 个 Go 测试通过;60 个开源项目上,类型检查时间的几何平均大约是 Go 版的一半,而预览包没有用 PGO 和 BOLT,所以比那个测量构建慢。六款应用在 Apple M4 Pro(12 核、48 GB)、macOS 26.5.1 上,用 hyperfine、1 次预热后取 5 次中位数、--noEmit --incremental false。表上的几何平均相对 tsc 6 是:tsc 7 为 7.1 倍,tsc-rs 为 11.4 倍,bun check 为 20.9 倍;相对 tsc 7,tsc-rs 为 1.61 倍,bun check 为 2.95 倍。举例:VS Code 约 375 万行,tsc 6 为 54.56 秒,tsc 7 为 6.84 秒,tsc-rs 为 4.20 秒,bun check 为 1.62 秒。表下写 bun check 在 Sentry 和 tRPC 上会多报其他检查器没有的错误。已知问题包括:某些 monorepo 里 tsc-rs 可能比 tsc 多写出一些文件;tsc -b 在缺少 project reference 时可能报 TS2307;tsc -b --watch 在一些编辑后会以内部错误、退出码 70 停下;编辑器里长时间编辑会慢慢涨内存;tsc-rs --version 打的是所移植的 TypeScript 版本 7.1.0-dev,不是 npm 版本。许可证一节写项目本身是 MIT,并保留所移植代码的许可证:TypeScript 为 Apache-2.0,部分 Go 标准库为 BSD-3-Clause。

主要讨论方向与观点
抓取时只有两条顶层评论。fwlr 把 “The Slop Line” 和那句「下面是 LLM 写的,不是我」单独摘出来,说感谢这个约定。ingen0s 问是不是花了超过 40 万美元。回复都在猜这是标价而不是实付:hedgehog 说实际更可能是几百或几千美元的订阅费;spense 赌是几个月的几份订阅,而不是按 token 直接付钱;colomo 复述 42 万美元的 token,并说他相当确定对方用的是订阅。这些都是猜测。能对上 README 的是作者自己的用词:OpenAI 那段写的是 “API priced tokens”,Claude 那段同时写了大约 24,047 美元的 API 花费,以及 Claude 账号周额度的百分之九百多。

专有名词解释

  • tsc:TypeScript 的命令行编译器。这个仓库的 npm 命令是 tsc-rs,README 说参数与 tsc 相同。
  • typescript-go:README 横线以下对微软原生 TypeScript 编译器的旧称,现仓库为 microsoft/TypeScript,语言是 Go。Rust 移植声称钉在其中一次 7.1.0-dev 提交上。
  • API priced tokens:作者用来描述 GPT-5.6 Sol 和 GPT 6 Astra 那 40 万美元的词,指按 API 标价计算的 token,不是本文核实过的付款记录。
  • The Slop Line:作者在 README 里画的分界。线上是他写的,线下方按他的声明是模型写的。
  • Effect 诊断:横线以下声称内置的 Effect 语言服务规则,只在 tsconfig 配了对应插件时运行。编辑器功能没有移植。
  • PGO / BOLT:README 用来解释「测速用的构建」比 CI 预览包更快的两种优化。预览包没有开它们。

HN 讨论:thread · 11 分 · 5 评

5. GPT‑6 and Intelligent UI for everyone

背景介绍
openai.com 上这篇直连返回 HTTP 403。下面的产品描述来自 r.jina.ai 对同一 URL 的转写。开头写:上个月他们把第一批 GPT-6 给了付费用户,今天把下一代智能带给每周使用 ChatGPT 的超过 12 亿人。12 亿是这篇里的数字。

新能力叫 Intelligent UI。转写写,GPT-6 会按问题把文字、图像和交互元件组织在一起;回答里可以有图形、可点的按钮、表单、图表,以及能在对话里直接用的交互。形式随问题变化:比较可以并排,解释可以是交互图,简单问题仍然可以只给文字。举例包括:周日烤羊腿的时间表可以和菜谱放在一起,公路旅行的站点可以标在地图上并注明哪里值得绕路。转写在 “GPT‑5.6 Instant” 标题下收进了一整份文字版烤羊腿计划(人数、温度、下午日程),随后出现 “GPT‑6 Instant” 标题,但几乎没有跟着的正文,所以并排的视觉界面没有进入这份纯文本。后文还写到可以让 ChatGPT 现做一个工具,例如储蓄计算器、晚餐账单分摊或对话里玩的游戏。

实现一节写:他们做了一套可流式输出的原生组件库,以及一个在模型生成时就处理界面的编译器。组件库提供熟悉的外观,模型决定怎么拼;编译器让界面随生成逐步出现,不用等整段结束。训练上,他们评估界面是否清楚、有用、完整,并让模型学会何时用交互、何时只给文字。文中也写,设计判断和能做的东西都还有改进空间。

速度一节写,推理模型出现之后,难题要等模型想完才开始回答;现在 ChatGPT 可以把思考和回答交错进行。它被训练成考虑用户等待时间,用到当时为止的知识和发现,分段把答案补完,并让全文仍然像一次写完那样连贯。内部评测的说法是:在高价值的日常 agent 任务上,GPT-6 Extra High 开始回答的时间与 GPT-5.6 Medium 相同,总分则好于 GPT-5.6 Extra High。需要网页搜索的问题,GPT-6 Instant 平均比 GPT-5.6 Instant 早 44% 开始回答。同一节还写,GPT-6 更会判断何时检索,在另一项困难问题的内部评测里,也更经常碰到用户问题的关键点。这些百分比和「更好」都是博文里的内部评测,本文没有复现。

安全段落写,GPT-6 在识别现实风险、回答是否诚实、以及遵守用户设定的界限上继续推进,并借用了 Astra 的若干安全进展,以便比 GPT-5.6 Sol 更抗绕过、更遵守护栏、也更清楚自己能做什么。训练按真实使用里的教训做了更新,加强对网络攻击、生物威胁和暴力等高风险滥用的防护。对抗测试里,它对多轮、会适应的攻击抵抗更强。它也被训练成在较高风险场景里安全回答,同时避免无谓拒绝无害请求,并利用对话历史看出单条提示里看不出来的风险。博文把细节指到系统卡。

系统卡页面 GPT-6 Sol and GPT-6 Luna: October 2026 update 可以直接打开,标注 Published October 7, 2026。本文读的是这个 HTML,不是评论里的 PDF 链接。页面写,相对各自的 GPT-5.6 对照,GPT-6 Sol(October)在标准 self-harm 评测上有统计显著的退步;GPT-6 Luna(October)在标准 self-harm、gore 和 sexual content 上有统计显著的退步。人工复查认为违规案例处于边界、总体上仍然安全:两个模型更愿意回答关于自我伤害的信息性问题,同时指向专业资源;按他们的评测,模型不遵从协助自我伤害的请求。对 gore 和性内容,它们更可能接话而不是直接拒绝,但复查到的输出严重度更低。对抗性红队没有按他们的标准发现高严重度风险。页面同时写,这些评测没有计入 Trusted Contact、本地危机热线和针对年轻用户的 Parental Controls 这类系统层措施。图像输入评测里,两者与 2026 年 8 月的 GPT-5.6 Sol / Luna 大体持平,例外是 extremism 视觉评测上的退步;他们复查后认为不安全回答的严重度总体较低。另一处写,在合法请求的有用性上相对先前模型有改进,但在一些安全请求上分数更低;评测还表明它们更少拒绝无害请求,也更少加过长或说教式的保留。

可用性一节写:Intelligent UI 的 GPT-6 今天开始向 ChatGPT Plus、Pro、Business 和 Enterprise 的 Chat 标签全球推出;从明天起扩展到 Free 和 Go。企业是否可用取决于管理员。付费的 Plus、Pro、Business、Enterprise 使用 GPT-6 Sol,Free 和 Go 使用 GPT-6 Luna,两者都为日常对话调过。这次不改动 Work 和 Codex 所用的模型。

主要讨论方向与观点
界面口味分成两边。revolvingthrow 觉得多数人会更喜欢 6 而不是 5.6 的周日烤肉比较,但自己几乎排斥那些留白和清单,感觉被当成小孩。他担心 OpenAI 把 Work 和聊天合并后,这种界面会渗进工作工具;博文写明这次不改 Work 和 Codex。他还失望聊天用的不是 6.1:视觉解释有用,但 6.1 更强,而越来越多人把模型当知识来源。6.0 和 6.1 的对比是这条评论的说法;博文写的是 Sol 与 Luna 的分档,没有用 6.0 / 6.1 这两个名字。mortenjorck 拿 Bartosz Ciechanowski 的手工交互讲解作对照,认为那些仍然会像机械钟相对于塑料石英表一样留下来,同时承认计算机已经能为冷门题目做出能用的交互解释。xpct 更习惯一次只讲几句、来回追问,担心新界面像以前的和弦图一样反复贴同一张、而且很难关掉。jjcm 把它叫做一次性的 “disposable UI” 或 “paper plate UI”,担心该给一句普通回答时也会强行做界面,并想知道对延迟的影响。

ankit_mishra 把系统卡里的退步摘到评论里,认为公司一边在 PDF 里写下这些安全指标下降,一边把发布焦点放在新界面上。上面那些退步和「边界案例、仍然安全、不协助自我伤害」的复查,都在系统卡页面上,不是评论者的转述。virtuosarmo 推测这是为了在 ChatGPT 里放广告,并链到几天前的视觉广告格式页面。本文没有打开那个广告页面,博文正文也没有把 Intelligent UI 写成广告位。giancarlostoro 不喜欢 OpenAI 和 Sam Altman,但觉得发布页的呈现和苹果同一水准,并说自己两年前就认为这些公司该离开纯聊天界面。

专有名词解释

  • Intelligent UI:博文里的名字。模型从一套原生组件里选文字、图形、按钮、表单和图表,编译器边生成边把界面流式显示出来。
  • GPT-6 Sol / GPT-6 Luna:博文写,Chat 里 Plus、Pro、Business、Enterprise 用 Sol,Free 和 Go 用 Luna。Work 和 Codex 的模型这次不变。
  • Extra High / Medium / Instant:博文用来比较开始回答时间的档位。44% 是 GPT-6 Instant 相对 GPT-5.6 Instant、在需要搜索的问题上平均提前开始回答的内部数字。
  • self-harm / gore / extremism 视觉评测:系统卡页面上写出退步的项目。同一页写了人工复查的严重度判断,以及评测没有计入危机热线等系统层措施。
  • Astra:博文说 GPT-6 的安全进展建立在 Astra 的若干安全工作之上,用来对照绕过防护、遵守界限和说明自身限制。博文没有在这篇里定义 Astra 的产品形态。

HN 讨论:thread · 489 分 · 255 评