0%

今日 Hacker News 首页前五并不按分数排列。前两条和第五条是模型发布:Anthropic 的小模型 Claude Haiku 5.5,以及 OpenAI 把 GPT-6 的交互界面铺到更多 ChatGPT 用户。中间夹着 MIT News 上 Margaret Hamilton 的讣告,404 Media 写的陆龟 Jonathan 基因组,以及一个刚建一天、分数只有十几分的 TypeScript 编译器 Rust 移植。OpenAI 博文直连返回 HTTP 403,下面的页面原文来自 r.jina.ai 转写,并与 Deployment Safety Hub 上 2026-10-07 的系统卡核对。分数和评论数是抓取时的快照。

1. Claude Haiku 5.5

背景介绍
Anthropic 的发布页标注 October 7, 2026,标题是 Introducing Claude Haiku 5.5。页面称它是他们迄今最便宜、最快、也最强的小模型,面向摘要、压缩、数据库查询、分类这类高量、对成本敏感的工作,并适合作为 Opus 5.5 和 Sonnet 5.5 在编程任务上的子代理。页面还把它放到实时客服和浏览器操作这类看重速度的场景。脚注写明:它在各模型的标准速度下是目前最快的,但比开启 Fast Mode 的 Opus 更慢。

价格是这篇的主体。页面写,平均跑下来大约比 Haiku 4.5 便宜 75%。脚注把这个平均数拆开:相对 Haiku 4.5,不超过 10 万 token 的请求降价 90%,超过 10 万 token 的请求降价 50%;在 Haiku 4.5 上,大约 90% 的请求落在前一档。同一脚注还写,Haiku 5.5 换了和 Sonnet 5.5、Opus 5.5 相近的分词器,完成同一件事会多用一些 token,上面的降幅已经把这一点算进去。价目表按每百万 token、并以「10 万 token 以内 / 以上」两档列出:缓存读取 $0.01 / $0.05,缓存写入 $0.125 / $0.625,输入 $0.10 / $0.50,输出 $0.50 / $2.50。对照栏里 Haiku 4.5 是缓存读取 $0.10、写入 $1.25、输入 $1.00、输出 $5.00;Sonnet 5.5 是缓存读取 $0.10、写入 $2.50、输入 $2.00、输出 $10.00。页面说,10 万 token 以内的请求约占上一代 Haiku 请求的 90%,这一档尤其划算。

同一天还有两件配套调整。Sonnet 5.5 的缓存读取从每百万 token $0.20 降到 $0.10,页面估计这会让大多数 agent 任务便宜大约 20%。本周起,Max 和 Team 订阅会得到用在 Claude Platform 上的每月 API 额度:Max 5x 每月 $100,Max 20x 每月 $200,Team 最高 $500,在用户之间共用;额度可用于任何模型。开发者这边,Claude 的 Python 和 TypeScript SDK 增加了仍处 beta 的 computer use 和 browser use。模型 ID 写的是 claude-haiku-5-5,并已在 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 上提供。

它是第一代带可调 effort(Low、Med、High、Xhigh、Max)的 Haiku。页面上的基准是 Anthropic 自己的表,本文没有重跑。知识工作 GDPval-AA v2.1 的 Elo:Haiku 5.5 为 1620,Haiku 4.5 为 735,GPT-6 Luna 为 1437,对照用的 Sonnet 5.5 为 1840。AA-Briefcase v1.1:1578、614、1336、1824。计算机操作 OSWorld 2.1 的离线子集:72.4%、15.7%、48.9%、83.9%。Humanity’s Last Exam 无工具:45.9%、10.2%、表内对 Luna 是破折号、56.9%;有工具:57.4%、18.7%、破折号、64.5%。Terminal-Bench 4.0:39.2%、0.0%、16.4%、70.6%。FrontierCode 1.1(Main):46.4%、破折号、42.4%,Sonnet 5.5 那一格写成 52.1% Xhigh。视觉推理 Chartography、无工具:46.4%、6.4%、29.1%、61.6%。页面接着说,Terminal-Bench 4.0 这类复杂编程仍然更适合 Sonnet 5.5 和 Opus 5.5;Haiku 5.5 适合范围更窄、以前会因为太贵而不跑的工作。

客户引言都标了公司和作者,数字是对方的早期测试,不是本文复测。Asana 的 Aaron Vinh(Staff Software Engineer)写,AI Teammates 的评测里,任务完成延迟下降超过 30%,每个 agent 回合的推理最多快 2.5 倍。HubSpot 的 Ze’ev Klapow(Distinguished Software Engineer)写,模拟门户上的 CRM 任务三次平均 92.8%,是他们在较小模型上见过的最高分;其中一项找过期但含糊记录的审计,Haiku 5.5 最快,命中最高、误报最低。AlphaSense 的 Daniel Campos(Distinguished Engineer)写,Ask in Document 每周大约 800 万次生产调用;400 条查询上,相对 Haiku 4.5 是 0.84 对 0.76。Box 的 Yashodha Bhavnani(VP of AI Products)写,比 Haiku 4.5 高 11 分,延迟大约一半。Rogo 的 Alex Wang(Applied AI)把它放在查 10-K、抽分部收入这种子任务上。Cognition 的 Walden Yan(Co-Founder & CPO)写,Devin Fusion 用它做 sidekick 时 FrontierCode 为 66.2,同时降低成本和延迟,Devin CLI 里可以配 Opus 5.5 做主模型。

对齐一节写,相对 Haiku 4.5,几乎所有对齐评测都更好,不当行为和配合滥用的意愿都更少,细节在 Haiku 5.5 系统卡。网络安全护栏比 Haiku 4.5 更严,但比最近其他模型松一些:允许的防御性任务比 Sonnet 5.5 更宽,仍然拦截渗透测试和更像攻击者会用的手法。生物学护栏与 Sonnet 5、Sonnet 5.5、Opus 5 相同:研究性问题可以,被判断为可能造成伤害的请求会被限制。更宽的生物和网络安全用途可以申请 Life Sciences Verification Program 和 Cyber Verification Program。

主要讨论方向与观点
讨论集中在价格门槛和它适不适合当主力。minimaxir 把价目表念了一遍,认为 10 万 token 的分界太低,而且只加在 Haiku 上,Sonnet 和 Opus 没有;做 agent 很容易越过,做普通生成或分类则划算。他对照的 GPT-6 Luna 是输入 $0.10、输出 $0.50,并在编辑里补了一句,Luna 的门槛大约在 272k。simonw 说自己对 Haiku 4.5 的意见就是它比 Luna 贵 10 倍;现在两者在 10 万 token 以内同价,超过之后 Luna 更便宜,即便 Luna 在 27 万 token 再涨价,仍然低于 Haiku。272k 和 27 万都是这两条评论里的数字,Anthropic 这篇页面没有写 Luna 的分档。simonw 还说,Anthropic 自报的基准都高于 Luna。

simonw 用不同 effort 画了鹈鹕骑自行车。Low 会把车架画错,medium、high、xhigh、max 都画对了。max 花了 5 分 9 秒、3.3826 美分;最便宜的 low 是 0.0936 美分、7 秒。他写,最新的 llm-anthropic 插件直接查 Anthropic 的模型列表,所以不用为这个模型改插件,刷新之后可以用 claude-haiku-5.5。他链了一年前 Haiku 4.5 的鹈鹕,并说那张很差。

chriddyp 贴了 Plotly 的 DataAnalyticsBench:相对 Haiku 4.5 便宜 9 倍、字母等级高两档,并且是默认速度下最快做完这套题的模型。40 道较深的数据分析题花费 $0.38,对照是 Opus 5.5 的 $15 和 Astra 的 $20。他说简单分析都对,需要再看其他变量的统计题不够坚持。相对 OpenAI,他写 GPT-6 Luna 稍好,成本大约是 Haiku 5.5 的 30%;GPT-6.1 Sol 全部答对,但贵 10 倍。这些是该评论里的结果。

jjcm 用图像转 HTML 试复杂界面,结论是不够用,并发现它会把活交给 Opus 5.5。他认为适合小的子代理和范围收得很紧的工作。wyrdcurt 觉得终于有一个便宜、值得用的 Haiku,10 万 token 的门槛偏低,但自己本来也只把小模型用在小任务上。charlesabarnes 和 seaal 都把每月 API 额度当成实际好处:可以在订阅之外的 harness 里做功能,而不必另付 API 或完全依赖端侧模型。charlesabarnes 同时担心,这是在为以后对用户不友好的改动做缓冲。

专有名词解释

  • effort:页面给 Haiku 5.5 的五档是 Low、Med、High、Xhigh、Max。用户用它在成本和能力之间取舍。各档在三张图上的具体分数,正文没有从图表里再抄一遍。
  • 缓存读取 / 缓存写入:价目表里的 cache reads 和 cache writes,单位都是每百万 token。Sonnet 5.5 这次只把读取从 $0.20 降到 $0.10。
  • OSWorld 2.1:页面描述为衡量代理能否操作一台真实计算机、完成长的多步任务。表上的百分比标明是离线子集。
  • Humanity’s Last Exam:页面描述为专家级学术知识和推理测试。表上把无工具和有工具分开,Luna 两格都是破折号。
  • Terminal-Bench 4.0:页面描述为在命令行里完成复杂、多步的专业任务。Haiku 4.5 在这张表上是 0.0%。
  • Claude Platform 月度额度:本周向 Max 和 Team 发放、只能用在 Claude Platform 上的 API 抵扣。页面写可用于任何模型。

HN 讨论:thread · 659 分 · 329 评

2. Margaret Hamilton has died

背景介绍
MIT News 的讣告写,Margaret H. Hamilton 于 9 月 30 日去世,享年 90 岁。讣告称她领导了 MIT Instrumentation Lab 里为 NASA 阿波罗计划编写飞行软件的团队,发表超过 130 篇,并推动软件工程成为单独的学科。她 1959 年到 1970 年代中期在 MIT 工作,之后自己创办软件公司。

履历按讣告的顺序是:1936 年生于印第安纳州 Paoli;1955 年起在密歇根大学读数学,后转入 Earlham College,1958 年取得数学学士、辅修哲学;1959 年随丈夫到波士顿。她先在 MIT 气象系给 Edward N. Lorenz 写天气预报软件,讣告说这是她进入编程的入口,后来的工作也进入了 Lorenz 关于混沌理论的发表。1961 年她到 MIT 林肯实验室,参加美国第一个防空系统 SAGE,为原型机 AN/FSQ-7(XD-1)写软件,并开始关注当时几乎没人做的软件可靠性。1965 年,Instrumentation Lab 登广告招聘「把人送上月球」的软件人员。她应聘后成为该实验室阿波罗项目的第一位程序员,也是项目里的第一位女性程序员。她先做无人任务,再领导载人任务的 onboard 飞行软件。到 1968 年,她是指挥与服务舱团队的助理主任,参与阿波罗软件的人超过 400 名。

讣告用两件事说明她说的防御式编程和优先级调度。女儿 Lauren 四岁时在指令舱模拟器里玩,在「飞行中」启动了发射前程序 P01,模拟器崩溃。Hamilton 在技术文档里加了警告,并提议用软件阻止真实任务里发生同样的事,但被否决,理由是受过训练的宇航员不会犯这个错。1968 年阿波罗 8 号上,Jim Lovell 在飞行中启动了 P01,导航数据消失;她和团队被叫去处理,之后她提议的改动才进了程序。另一件是 1969 年 7 月阿波罗 11 号着陆前,计算机报 1202:一个硬件开关故障让计算机过载,系统可能处理不了着陆。讣告写,她们做过优先级驱动的软件,可以关掉不必要的后台任务、保住关键任务;休斯敦信任这份软件,让任务继续。

实验室后来从 MIT 独立成 Draper Laboratory。1976 年她创办 Higher Order Software,基础是防错和容错。大约十年后创办 Hamilton Technologies,主产品是 Universal Systems Language(USL),一种强调防错和防御式编程的系统建模语言。奖项包括 2003 年 NASA Exceptional Space Act Award、2016 年奥巴马颁发的总统自由勋章、2017 年计算机历史博物馆 Fellow、2019 年 Intrepid Lifetime Achievement Award,以及 2022 年进入 National Aviation Hall of Fame。讣告还写,2015 年她参与开发的阿波罗软件被完整放上 GitHub;2017 年她成为乐高人仔,原型来自 MIT 科学传播者 Maia Weinstock 设计的一套 NASA 女性人物。她遗有女儿 Lauren Hamilton、女婿 Richard Selesnick、两名孙子和四名曾孙。追悼会订在春天,地点是马萨诸塞州剑桥。

Olivier de Weck(阿波罗计划教授、MIT 航空航天系临时系主任)和 Draper 总裁兼 CEO Jerry M. Wohletz 的悼词都在这篇讣告里。关于「软件工程」这个词,讣告引用她 2018 年对《El País》说的话:她开始用 software engineering,是为了让软件和做软件的人得到与硬件及其他工程同等的尊重;起初这被当成笑话。这是她的自述,讣告没有把它写成有文献裁定的「全世界第一次使用」。

主要讨论方向与观点
线程大多是悼念,技术补充不多。diskzero 说大约三十年前见过她和其他 Instrumentation Lab / Draper 的阿波罗一代;当时自己的多媒体 CD-ROM 创业公司,投资方是那批人后来成立的风投。他记得她讲形式化的控制系统,内容超出自己的理解。WarOnPrivacy、marcelo-earth 和 dzonga 都提到那张站在打印出来的代码旁的照片;WarOnPrivacy 链的是 MIT 2016 年的一篇现场报道。

muunbo 写「我记得她创造了 software engineering 这个词」。这是评论者的记忆。讣告里能对上的是上面那段《El País》引语,不是一条独立的词源考证。EvanAnderson 推荐计算机历史博物馆的口述史,并说读完之后,他相信 Steven Levy《Hackers》里那个故事的程序员就是她:有人深夜在 TX-0 上折腾,弄坏了一位学者正在跑的天气模拟,那位学者是 Edward Lorenz。讣告确认她为 Lorenz 写过天气预报软件,没有写 TX-0,也没有写这起夜间事故。TX-0 的对应是评论者听完口述史之后的判断。

schaefer 问原始阿波罗代码还能不能读。dudewhocodes 回复了 chrislgarry/Apollo-11。讣告只说 2015 年被放上 GitHub,没有点这个仓库名。xtajv 另推荐 Frank O’Brien 的 The Apollo Guidance Computer: Architecture and Operation(ISBN 978-1-4419-0876-6),说读起来像主管带着新员工看代码。Kim_Bruning 推荐 timmg 讲 AGC 如何工作的视频。本文没有打开这些外部材料。

专有名词解释

  • Instrumentation Lab / Draper:MIT 当时为阿波罗做 onboard 飞行软件的实验室。阿波罗结束后从 MIT 分出,成为独立的 Draper Laboratory。
  • SAGE:Semi-Automatic Ground Environment,讣告称为美国第一个防空系统。AN/FSQ-7(XD-1)是她在林肯实验室写软件时用的原型计算机。
  • P01:讣告里的发射前程序。模拟器和后来的阿波罗 8 号都出现过在飞行中误启动它的情况。
  • 1202:阿波罗 11 号着陆前计算机发出的警报。讣告的解释是硬件开关故障导致过载;软件按优先级关掉非关键任务后,着陆继续。
  • USL:Universal Systems Language,Hamilton Technologies 的主要产品,讣告描述为面向复杂系统、强调防错的建模语言和方法。
  • AGC:阿波罗制导计算机。评论里用这个缩写指向讲解视频和 O’Brien 的书;具体结构以那些材料为准,这篇讣告没有展开指令集。

HN 讨论:thread · 640 分 · 71 评

3. ‘Jonathan’ is the oldest land animal on Earth

背景介绍
404 Media 这篇由 Becky Ferreira 撰写,页面时间是 2026 年 10 月 7 日下午 2:00,datePublished 为 2026-10-07T18:00:38.000Z。文章说,阿尔达布拉象龟 Jonathan(Aldabrachelys gigantea)大约 1832 年在塞舌尔孵化,查尔斯·达尔文发表《物种起源》时他已经二十多岁;1880 年代和另外三只龟一起,作为礼物送给圣赫勒拿岛的英国殖民总督,此后一直住在那里。文章称他即便在这个经常活过一百岁的物种里也是例外,将近 200 岁。照片说明写,1880 年代和今天的图像来自 Wikimedia Commons 和圣赫勒拿政府(页面拼写为 St. Helene Government)。他现在住在总督府 Plantation House,是岛上的旅游点之一。文章还写,拿破仑死在圣赫勒拿,时间比人们认为 Jonathan 孵化的年份早大约十年。

采样过程来自文章对作者 Stephen Clark 的电话采访。Clark 被写成非营利组织 Kallel Foundation 的衰老研究者、论文作者之一。他 2017 年就联系饲养员;抽血被认为太冒险,于是哄 Jonathan 张嘴做口腔拭子。早期样本不完整、新冠,以及后来限制接触 Jonathan 的新规定,把结果拖了很久。样本最终由美国太空军从圣赫勒拿送到佛罗里达。

文章对研究结果的表述是:相对其他龟(包括一只 36 岁、名叫 Tank 的个体),Jonathan 在大多数衰老通路上有独特基因变异,文章点名 DNA 修复、胰岛素调节、线粒体功能和「低熵」甲基化。Clark 说衰老有很多标志,这项研究还只是开头。文章接着写,一些变异是团队根据其他长寿个体预料到的,包括 DNA 修复、端粒维持和细胞自噬;意外在甲基化组,与线粒体过程有关的那一部分异常「干净」,也就是低熵。文章说他们还做了更年轻龟的甲基化组,其中和一只 5 岁龟相差 189 年。文章的对比是:基因组其余部分的熵与年龄相称,线粒体甲基化组则接近那只 5 岁龟。Clark 说这需要更多研究才能跟上。文章后段把目标写成 Kallel Labs 的公司目标:影响人类的健康寿命和寿命。Foundation 和 Labs 两个名字都出现在这篇报道里,报道没有解释二者的关系。

页面链到的论文是 Science Advances 的 10.1126/sciadv.adw8887。本文没有读 PDF,下面这句来自 Crossref 摘要,和报道不是同一层文字。论文题为 Epigenetic insights into extreme longevity in the world’s oldest terrestrial animal, Jonathan,期刊为 Science Advances 第 12 卷第 41 期;Crossref 记录创建于 2026-10-07,印刷日期为 2026-10-09。摘要写:他们测定了 194 岁的 Jonathan 的基因组和甲基化组;相对其他巨龟(A. gigantea 和 Chelonoidis abingdonii),他在大多数衰老通路上有独特基因变异;与四只从 5 岁幼体到老年的其他阿尔达布拉象龟相比,DNA 甲基化和甲基化熵变化明显;低熵区域富集在线粒体电子传递链和 RNA 代谢相关基因的启动子上。摘要据此建议,这些通路的高保真转录可能对长寿物种很重要,并把模型写成:启动子上保持低甲基化熵,与高效的线粒体产能、RNA 加工和基因组修复连在一起。Crossref 列出 22 位作者,第一作者是 Benjamin Vaisvil(Kallel Foundation 与 Igenbio),Stephen W. Clark 的单位是 Kallel Foundation、Epiphany Biosciences 和 Vanderbilt-Ingram Cancer Center。摘要没有出现 Tank 这个名字,也没有把通路列表写成胰岛素调节或自噬;那些是 404 Media 文章里的说法。

主要讨论方向与观点
评论很少,也没有人声称复核了论文。scun 引用「大多数衰老通路上的独特变异」,把它比成游戏里把点数全加在寿命上。dyauspitr 拿陆生和海洋动物比较:这只最老的陆地动物还没到 200 岁,海里的动物可以到五六百年。两个数字都是这句评论里的说法。repeekad 问为什么是太空军送样本。sublinear 回复:那里很偏远,美国太空军在附近的阿森松岛有行动。这是评论者的解释,文章只写了运送这件事。pil0u 觉得不必为了研究去打扰这只龟。其余是关于《The Leftovers》里 Jarden 的类比,以及「他连兔子都追丢了」这类玩笑。

专有名词解释

  • 阿尔达布拉象龟:Aldabrachelys gigantea。文章和论文摘要都用这个种名称呼 Jonathan。
  • Chelonoidis abingdonii:摘要里用来对照的另一种巨龟,没有在 404 Media 正文里展开。
  • 甲基化组:DNA 上甲基化修饰的全体,影响基因如何被读取。文章说线粒体相关的那一部分熵特别低;摘要把低熵区域具体到电子传递链和 RNA 代谢基因的启动子。
  • 甲基化熵:这里用来描述甲基化模式有多「杂乱」。摘要把较低的熵和更稳定的转录联系在一起,这是论文自己的解释。
  • 端粒 / 自噬:端粒是染色体末端的重复序列;自噬是细胞回收自身组分的过程。两者出现在 404 Media 对「预料之中的变异」的转述里,没有出现在本文所读的 Crossref 摘要里。
  • Plantation House:圣赫勒拿总督官邸。文章写 Jonathan 和同伴长期住在那里。

HN 讨论:thread · 43 分 · 11 评

4. Rust Port of TypeScript (Tsc)

背景介绍
GitHub API 显示 pingdotgg/ts-rust 创建于 2026-10-07T05:17:07Z,抓取时默认分支 main 的最近推送是 2026-10-08T00:58:22Z,语言是 Rust,许可证字段为 MIT,仓库描述是 “An experimental Rust port of the TypeScript 7 compiler (tsc)”。账号显示名是 Ping.gg,简介是 “We build tools for modern devs”,博客为 ping.gg。当时 API 上的星标是 453、分叉 26。README 没有署个人姓名。

README 在一条横线之前是作者自己的话,横线之后作者写明:「下面的一切是我的 LLM 写的,不是我。」横线之上的内容包括:他想知道 LLM 能否把 TypeScript 的编译器、检查器和语言服务移植到 Rust;token 花费超过 42 万美元,但他认为大概 2 万美元就能做成。动机列了四条:测试模型能力、做一个快的 TypeScript 类型检查器、做一个能在 WASM 里高性能运行的检查器,以及玩梗。他称这是早期发布,在测过的每一个真实项目里兼容性是 100%,对绝大多数应用可以当作直接替换,同时让读者去看 Known problems。他又写:「我也没读过这代码的任何一行。」安装命令是 npm install -D tsc-rs,后面跟着 “Be warned, I have no idea if this will actually work.”

花费一段区分了两批模型。他用 OpenAI 的模型做了很久:GPT-5.6 Sol 和 GPT 6 Astra 的 API 标价 token 超过 40 万美元,几个月的 /goal 循环写出超过 130 万行 Rust,兼容性一直没过大约 84%。换成 Opus 5.5 之后,10 小时就有一个能用的 v0。他原以为 Opus 是在 Codex 已有代码上接着写,后来发现不是:Opus 5.5 从头开始,用大约十分之一的时间超过了 Astra。这一段的 Claude 花费他写成大约 24,047 美元的 API 花费、历时两周;他用的是 Claude 账号,相当于每周 200 美元计划额度的 925% 到 983%。42 万美元和 40 万美元都是作者说的 token 标价,不是本文看到的账单。

横线以下、被作者标成模型所写的部分,声称这是微软用 Go 写的 TypeScript 编译器的直接移植。上游是 microsoft/TypeScript(以前叫 typescript-go),钉在提交 673a5f17d713(2026-09-29,TypeScript 7.1.0-dev)。它保留 Go 版的算法、行为和 tsc 命令行、语言服务与 API。npm 包名用 tsc-rs,以免和 typescript 包冲突。平台写的是 Linux x64(静态链接)和 macOS arm64;Windows 和 Linux arm64 还没有。Effect 诊断(代码 377xxx)内置,对应 Effect-TS/tsgo 0.46.1 的规则移植;语言服务的快速修复、重构、悬停和补全没有移植。

同一段里的测试与性能也属于「模型所写」的部分,本文没有重跑。它写:TanStack Query core 和 Hono 的诊断与 Go 版一致;移植的 181,711 个 Go 测试通过;60 个开源项目上,类型检查时间的几何平均大约是 Go 版的一半,而预览包没有用 PGO 和 BOLT,所以比那个测量构建慢。六款应用在 Apple M4 Pro(12 核、48 GB)、macOS 26.5.1 上,用 hyperfine、1 次预热后取 5 次中位数、--noEmit --incremental false。表上的几何平均相对 tsc 6 是:tsc 7 为 7.1 倍,tsc-rs 为 11.4 倍,bun check 为 20.9 倍;相对 tsc 7,tsc-rs 为 1.61 倍,bun check 为 2.95 倍。举例:VS Code 约 375 万行,tsc 6 为 54.56 秒,tsc 7 为 6.84 秒,tsc-rs 为 4.20 秒,bun check 为 1.62 秒。表下写 bun check 在 Sentry 和 tRPC 上会多报其他检查器没有的错误。已知问题包括:某些 monorepo 里 tsc-rs 可能比 tsc 多写出一些文件;tsc -b 在缺少 project reference 时可能报 TS2307;tsc -b --watch 在一些编辑后会以内部错误、退出码 70 停下;编辑器里长时间编辑会慢慢涨内存;tsc-rs --version 打的是所移植的 TypeScript 版本 7.1.0-dev,不是 npm 版本。许可证一节写项目本身是 MIT,并保留所移植代码的许可证:TypeScript 为 Apache-2.0,部分 Go 标准库为 BSD-3-Clause。

主要讨论方向与观点
抓取时只有两条顶层评论。fwlr 把 “The Slop Line” 和那句「下面是 LLM 写的,不是我」单独摘出来,说感谢这个约定。ingen0s 问是不是花了超过 40 万美元。回复都在猜这是标价而不是实付:hedgehog 说实际更可能是几百或几千美元的订阅费;spense 赌是几个月的几份订阅,而不是按 token 直接付钱;colomo 复述 42 万美元的 token,并说他相当确定对方用的是订阅。这些都是猜测。能对上 README 的是作者自己的用词:OpenAI 那段写的是 “API priced tokens”,Claude 那段同时写了大约 24,047 美元的 API 花费,以及 Claude 账号周额度的百分之九百多。

专有名词解释

  • tsc:TypeScript 的命令行编译器。这个仓库的 npm 命令是 tsc-rs,README 说参数与 tsc 相同。
  • typescript-go:README 横线以下对微软原生 TypeScript 编译器的旧称,现仓库为 microsoft/TypeScript,语言是 Go。Rust 移植声称钉在其中一次 7.1.0-dev 提交上。
  • API priced tokens:作者用来描述 GPT-5.6 Sol 和 GPT 6 Astra 那 40 万美元的词,指按 API 标价计算的 token,不是本文核实过的付款记录。
  • The Slop Line:作者在 README 里画的分界。线上是他写的,线下方按他的声明是模型写的。
  • Effect 诊断:横线以下声称内置的 Effect 语言服务规则,只在 tsconfig 配了对应插件时运行。编辑器功能没有移植。
  • PGO / BOLT:README 用来解释「测速用的构建」比 CI 预览包更快的两种优化。预览包没有开它们。

HN 讨论:thread · 11 分 · 5 评

5. GPT‑6 and Intelligent UI for everyone

背景介绍
openai.com 上这篇直连返回 HTTP 403。下面的产品描述来自 r.jina.ai 对同一 URL 的转写。开头写:上个月他们把第一批 GPT-6 给了付费用户,今天把下一代智能带给每周使用 ChatGPT 的超过 12 亿人。12 亿是这篇里的数字。

新能力叫 Intelligent UI。转写写,GPT-6 会按问题把文字、图像和交互元件组织在一起;回答里可以有图形、可点的按钮、表单、图表,以及能在对话里直接用的交互。形式随问题变化:比较可以并排,解释可以是交互图,简单问题仍然可以只给文字。举例包括:周日烤羊腿的时间表可以和菜谱放在一起,公路旅行的站点可以标在地图上并注明哪里值得绕路。转写在 “GPT‑5.6 Instant” 标题下收进了一整份文字版烤羊腿计划(人数、温度、下午日程),随后出现 “GPT‑6 Instant” 标题,但几乎没有跟着的正文,所以并排的视觉界面没有进入这份纯文本。后文还写到可以让 ChatGPT 现做一个工具,例如储蓄计算器、晚餐账单分摊或对话里玩的游戏。

实现一节写:他们做了一套可流式输出的原生组件库,以及一个在模型生成时就处理界面的编译器。组件库提供熟悉的外观,模型决定怎么拼;编译器让界面随生成逐步出现,不用等整段结束。训练上,他们评估界面是否清楚、有用、完整,并让模型学会何时用交互、何时只给文字。文中也写,设计判断和能做的东西都还有改进空间。

速度一节写,推理模型出现之后,难题要等模型想完才开始回答;现在 ChatGPT 可以把思考和回答交错进行。它被训练成考虑用户等待时间,用到当时为止的知识和发现,分段把答案补完,并让全文仍然像一次写完那样连贯。内部评测的说法是:在高价值的日常 agent 任务上,GPT-6 Extra High 开始回答的时间与 GPT-5.6 Medium 相同,总分则好于 GPT-5.6 Extra High。需要网页搜索的问题,GPT-6 Instant 平均比 GPT-5.6 Instant 早 44% 开始回答。同一节还写,GPT-6 更会判断何时检索,在另一项困难问题的内部评测里,也更经常碰到用户问题的关键点。这些百分比和「更好」都是博文里的内部评测,本文没有复现。

安全段落写,GPT-6 在识别现实风险、回答是否诚实、以及遵守用户设定的界限上继续推进,并借用了 Astra 的若干安全进展,以便比 GPT-5.6 Sol 更抗绕过、更遵守护栏、也更清楚自己能做什么。训练按真实使用里的教训做了更新,加强对网络攻击、生物威胁和暴力等高风险滥用的防护。对抗测试里,它对多轮、会适应的攻击抵抗更强。它也被训练成在较高风险场景里安全回答,同时避免无谓拒绝无害请求,并利用对话历史看出单条提示里看不出来的风险。博文把细节指到系统卡。

系统卡页面 GPT-6 Sol and GPT-6 Luna: October 2026 update 可以直接打开,标注 Published October 7, 2026。本文读的是这个 HTML,不是评论里的 PDF 链接。页面写,相对各自的 GPT-5.6 对照,GPT-6 Sol(October)在标准 self-harm 评测上有统计显著的退步;GPT-6 Luna(October)在标准 self-harm、gore 和 sexual content 上有统计显著的退步。人工复查认为违规案例处于边界、总体上仍然安全:两个模型更愿意回答关于自我伤害的信息性问题,同时指向专业资源;按他们的评测,模型不遵从协助自我伤害的请求。对 gore 和性内容,它们更可能接话而不是直接拒绝,但复查到的输出严重度更低。对抗性红队没有按他们的标准发现高严重度风险。页面同时写,这些评测没有计入 Trusted Contact、本地危机热线和针对年轻用户的 Parental Controls 这类系统层措施。图像输入评测里,两者与 2026 年 8 月的 GPT-5.6 Sol / Luna 大体持平,例外是 extremism 视觉评测上的退步;他们复查后认为不安全回答的严重度总体较低。另一处写,在合法请求的有用性上相对先前模型有改进,但在一些安全请求上分数更低;评测还表明它们更少拒绝无害请求,也更少加过长或说教式的保留。

可用性一节写:Intelligent UI 的 GPT-6 今天开始向 ChatGPT Plus、Pro、Business 和 Enterprise 的 Chat 标签全球推出;从明天起扩展到 Free 和 Go。企业是否可用取决于管理员。付费的 Plus、Pro、Business、Enterprise 使用 GPT-6 Sol,Free 和 Go 使用 GPT-6 Luna,两者都为日常对话调过。这次不改动 Work 和 Codex 所用的模型。

主要讨论方向与观点
界面口味分成两边。revolvingthrow 觉得多数人会更喜欢 6 而不是 5.6 的周日烤肉比较,但自己几乎排斥那些留白和清单,感觉被当成小孩。他担心 OpenAI 把 Work 和聊天合并后,这种界面会渗进工作工具;博文写明这次不改 Work 和 Codex。他还失望聊天用的不是 6.1:视觉解释有用,但 6.1 更强,而越来越多人把模型当知识来源。6.0 和 6.1 的对比是这条评论的说法;博文写的是 Sol 与 Luna 的分档,没有用 6.0 / 6.1 这两个名字。mortenjorck 拿 Bartosz Ciechanowski 的手工交互讲解作对照,认为那些仍然会像机械钟相对于塑料石英表一样留下来,同时承认计算机已经能为冷门题目做出能用的交互解释。xpct 更习惯一次只讲几句、来回追问,担心新界面像以前的和弦图一样反复贴同一张、而且很难关掉。jjcm 把它叫做一次性的 “disposable UI” 或 “paper plate UI”,担心该给一句普通回答时也会强行做界面,并想知道对延迟的影响。

ankit_mishra 把系统卡里的退步摘到评论里,认为公司一边在 PDF 里写下这些安全指标下降,一边把发布焦点放在新界面上。上面那些退步和「边界案例、仍然安全、不协助自我伤害」的复查,都在系统卡页面上,不是评论者的转述。virtuosarmo 推测这是为了在 ChatGPT 里放广告,并链到几天前的视觉广告格式页面。本文没有打开那个广告页面,博文正文也没有把 Intelligent UI 写成广告位。giancarlostoro 不喜欢 OpenAI 和 Sam Altman,但觉得发布页的呈现和苹果同一水准,并说自己两年前就认为这些公司该离开纯聊天界面。

专有名词解释

  • Intelligent UI:博文里的名字。模型从一套原生组件里选文字、图形、按钮、表单和图表,编译器边生成边把界面流式显示出来。
  • GPT-6 Sol / GPT-6 Luna:博文写,Chat 里 Plus、Pro、Business、Enterprise 用 Sol,Free 和 Go 用 Luna。Work 和 Codex 的模型这次不变。
  • Extra High / Medium / Instant:博文用来比较开始回答时间的档位。44% 是 GPT-6 Instant 相对 GPT-5.6 Instant、在需要搜索的问题上平均提前开始回答的内部数字。
  • self-harm / gore / extremism 视觉评测:系统卡页面上写出退步的项目。同一页写了人工复查的严重度判断,以及评测没有计入危机热线等系统层措施。
  • Astra:博文说 GPT-6 的安全进展建立在 Astra 的若干安全工作之上,用来对照绕过防护、遵守界限和说明自身限制。博文没有在这篇里定义 Astra 的产品形态。

HN 讨论:thread · 489 分 · 255 评

今日 Product Hunt 热榜对应太平洋时间 2026-10-07 日榜(上海时间 10 月 8 日上午抓取,太平洋时间当日尚未到午夜,名次和分数仍可能变化)。榜单页写明:分数是此刻的活跃分数,名次反映所查看时段结束时按分数的排序;这次抓到的前十按分数从高到低排列,与页面顺序一致。前半段是把人和 Agent 放进同一间办公室或同一本数据笔记本、让落地页跟着广告和名单变化,以及在自己的电脑上把演示过一次的操作收成可再跑的流程。后半段是把第一人称视频收成机器人训练数据、在 Figma 画布上改设计和做原型、预览一个在欧洲训练的万亿参数模型、让买家边点演示边提问、把文件和模型放在欧盟的一台云电脑上,以及从公开讨论里找出正在描述你所解决问题的人。按日榜页顺序,前五是 Velozity、GenPage 3.0、IrisGo for Solopreneurs、Databench by Alkera 与 Pegasus 1.6 by TwelveLabs,后五是 Figma Agent、Mistral Large 4、Supademo AI Demo Agent、Rool 与 Ownfeed。

1. Velozity · 官网

标语:The Multiplayer AI Office where your team and agents work.

背景
Velozity 日榜第 1,发布页标为有免费方案,公司信息写 Launched in 2026。发帖人 Darshan(@ishudarshan)写自己是联合创始人;Akash Mandal 在帖里以 CTO 身份补充实现。Darshan 的原话是:AI 是单人的,真正的工作是多人的。团队里每个人各自付费、各自提问,再把答案贴回聊天。Velozity 把聊天、音视频(带转录)、任务、日历和文件放进同一处,并让 Agent 用你已经在付费的订阅(页面举例 Claude、Codex)工作,不另开一张 AI 账单。内置 Agent 名叫 Speed,官网写它从第一天就在团队里,不需要 Claude Code 或 Codex 订阅。人可以看见谁在线,敲同事的「cabin」直接说话,不用发会议链接。这次发布是他们自己在 Velozity 里排的。支持时间写为周一到周六 10:00–20:00 IST,回复时间 24–48 个工作小时。抓取时日榜页上的当前分数约 385、评论约 112。

产品要解决的问题
同一次工作被拆进聊天、会议和各自的 AI 窗口。换一个同事或换一个 Agent,上下文就要重讲一遍。

产品市场分析
发布页写给创业公司,以及研发、产品、销售、运营团队,或同时用好几个 AI 的个人。变现信号是「free to start」。这次没有抓到公开价目表。团队回复:任务按人分配,管理员在 Pro 上有团队活动仪表盘,也可以问 Agent 谁的未完成任务最多。自动标出过载的视图还没有。Akash 复述了按负责人查看任务和询问未完成工作,并确认自动检测过载仍未做。官网首页有四段客户引言,并附了他们自己的结果数字:Devcansol 写日常协作摩擦少 85%;Drivigo 写协调比原先快 4 倍;Sumit Nirmal 写每人每月少花 214 美元;Suraj Lal Mehta 写工具切换少 97%。这些是首页引言里的数字,不是独立审计。对照是继续用分开的聊天、会议和各自的 AI 订阅。有人把它比作从桌面 Office 到 Google Docs;Darshan 回复,治理是起点:离开工作区的东西要人批准。

产品上下游
上游是你已经付费的模型订阅、放进 Space 的文件,以及个人连接的邮件、日历和会议记录。团队回复,个人邮件、日历和会议笔记只由本人的 Agent 只读,不会因为同处一个 Space 就给同事的 Agent。放进 Space 的文件属于这个 Space:里面的人和 Agent 都能打开,Space 内今天没有按文件再分权限;私有 Space 只限被加进来的人。Agent 只在其主人已经加入的 Space 里跑,不会扩大别人的权限。工作区角色写为 admin、member、guest。下游是草稿,而不是直接发出去的邮件、消息、付款、签名或代码提交。Darshan 回复三步:Agent 把草稿放进 Space;对应的人批准、要求修改或拒绝;只有批准之后才发出。草稿在批准后若再改,需要重新批准。团队其他人也能看见草稿。每次运行记在 Space 里:谁问的、做了什么、改了什么。团队回复,Agent 可以改代码仓库并开 PR,合并仍走原来的评审;也可以设重复运行的 routine。聊天方面,团队一条回复写 Velozity 自己就是聊天,不架在别的聊天工具上面;同一问题下另一条回复写可以连接 Slack、Microsoft Teams、Discord、Telegram 和 WhatsApp Business,把那些对话的上下文拉进来,并自带聊天和 Spaces。官网演示里 Speed 读取的来源标为 Gmail、转录和文件。

2. GenPage 3.0 · 官网

标语:Build, personalize, and optimize landing pages with AI

背景
GenPage 3.0 日榜第 2,是 GenPage 的第 2 次发布,公司信息写 Launched in 2024。联合创始人 Samy Barbier(帖里署名 Sam)写,第一次在 Product Hunt 发布时产品还没有 AI,只做一件事:给每封冷邮件的对象单独一页,而不是同一套推销。他写 3,400 多个团队、超过 250,000 页之后,他们认为外联只是更大问题的一个症状:广告、关键词和名单都已按人分开,点击之后却落在同一张首页。3.0 按活动生成页面:ABM(account-based marketing,按目标客户单独做销售)给每个目标账户一页;Google Ads 给到活动、广告组和关键词;LinkedIn Ads 对准点击的受众;外联给每个潜在客户一页。流程写为:从网站、幻灯和文档学习品牌;连接 HubSpot、Salesforce、Clay 和广告账户;用提示、网址、截图或文档生成页面;按融资、招聘、LinkedIn 或新闻做研究;用 Variables Agent 填变量;把 URL 推回 CRM、序列工具或广告平台;用 Autopilot 持续测试;用 Concierge 做访客资格判断;并提供分析、热图、回放和实时提醒。他还写了 40 多个集成、API 和双向 MCP(Model Context Protocol,让外部工具按约定读写产品的接口)。发布日优惠码 PRODUCTHUNT50:任意付费方案 3 个月五折,年付则一整年五折。抓取时日榜页上的当前分数约 375、评论约 52。

产品要解决的问题
获客已经按受众、账户和关键词分开,落地页仍是同一张。做一页一活动要设计师和开发,团队没有这个时间。

产品市场分析
官网写给营销、增长和 GTM(go-to-market,把产品送到买家面前的销售与市场动作)团队。定价页在选中年付时列出:Free 每月 0 美元,页头写年付相当于少付两个月;Pro 每月 79 美元;Scale 每月 249 美元;Ultimate 为定制。月度额度在表上对应 100、500、2,500 和定制。Free 含 1 个席位;Pro 写无限席位、自定义域名、去掉「Made with GenPage」、MCP 与 API、GTM 与 CRM 集成。Scale 在此之上写自定义脚本与 HTML、Webhooks、SDK、BYOK(bring your own key,用自己的模型密钥)、会话回放与热图、无限工作区。Ultimate 写包含 Autopilot、品牌知识库、专属客户经理,以及 SSO、RBAC、可选欧盟或美国存储。广告模块标为附加,从每月 399 美元起,更高档显示为已包含。积分:发布一个变体 1 分,10 次 AI enrichment 1 分,生成页面随模型和复杂度变化。月度积分每周期重置;另购积分滚动保留 12 个月,100 分 25 美元起。已发布页面保持在线不耗积分。Samy 在帖里写现在可以免费开始、100 积分、不需要付款。Autopilot 和品牌知识库出现在发布说明里,定价页则把它们放在 Ultimate。他回复 Autopilot 仍是近期上线的 Beta,还没有可以公开的指标。销售外联的 A/B 测试里,他写相对纯文本外联看到 2–3 倍转化;LeadCat 的案例是会议多 3 倍。官网另写「up to 3x higher conversions」、会议平均 3 倍、头部活动转化提升 30% 以上、今年创建 20 万页以上、G2 平均 5/5,以及 3,400 多个团队。Webtouch 案例页写 55 万美元管道、12 个新客户、30% 回复率、6,678 封邮件,并写他们把用法扩到 20 多个客户。有人拿 Mutiny 比较;Samy 回复两边都做个性化页面和 ABM,Mutiny 现在更宽,包括账户研究、提案和 deal room;GenPage 把页面接到外联名单和广告账户,并加上点击之后的分析和 Autopilot。官网导航里还有与 Clay + Webflow、Unbounce、Instapage 等的对比页,本文没有逐页核对。

产品上下游
上游是现有网站和设计、品牌文档、CRM 或 Clay 里的名单、广告账户里的关键词,以及 GenPage 自己的研究。动态变量是页面里的占位符,例如公司名或痛点,由名单、CRM 或研究填上。Samy 回复:先做好基础页,再指定哪些区块固定、哪些可变;Autopilot 在你划定的范围内生成变体并分流,你选择上线的变体和赢家。他写不能保证每次改动都提高转化。下游是放在你自己域名上的页面、推回 CRM 或广告平台的 URL,以及热图、回放和 Slack、Gmail 提醒。FAQ 写 GenPage 本身不直接改变邮件送达率,链接是落地页;他们建议小批量外联时可以把链接放进第一封邮件,大批量时先把个性化页面当作软性邀请。积分用完后已发布页面仍在线。

3. IrisGo for Solopreneurs · 官网

标语:AI workflow automation: show it once, let it run

背景
IrisGo for Solopreneurs 日榜第 3,发布页标为免费,公司信息写 Launched in 2026,并写首次发布日为 2026-04-16。这次发布页把 IrisGo 写成 Windows 和 Mac 上的 AI 操作系统:Watch & Learn 看你做一遍,收成可复用流程,再换输入重跑;另有每日简报、重要邮件和下一步。面向一人公司的页面写,Beta 期间免费,用来交待重复的行政工作。讨论里回复的是 Jeffrey Lai 和 Yuan Sun。官网首页把 Watch & Learn 写成录下工作流、变成可自主运行的技能,并写利用本机 NPU(神经网络处理器,电脑上专门跑模型的芯片)和 GPU 做本地推理。首页列出的支持方包括 Andrew Ng 的 AI Fund、Pegatron Ventures、Intel、Google for Startups 和 NVIDIA Inception,并写与 Intel 及 AI PC 厂商合作,图标里有 Acer、Windows 和 Apple / Mac。公司 2026-05-20 的新闻稿写,Watch & Learn 在 Windows 和 Mac 进入公测,并提到 Acer Swift 16 AI 等设备上的预装;同一稿称创始工程师来自 Apple 的 Siri 团队。下载页抓取时 macOS 为 Apple silicon 的 DMG,版本 v0.2.5,另有 Windows 64 位安装包。抓取时日榜页上的当前分数约 362、评论约 82。

产品要解决的问题
一人公司的收件箱、跟进和跨工具报表每天都要重做。把这些写成脚本或宏,界面一改就断。

产品市场分析
这次发布页写给 solopreneur(一人经营的创始人)。Yuan Sun 回复,产品可以跟着业务变大:一个人时它处理重复的桌面工作和跨工具报表;有团队之后,录下的流程变成可共享的 playbook。这次发布特意展示创始人和一人公司。变现信号是发布页写 Beta 期间免费。这次没有在官网抓到现行价目;第三方对「大约每月 20 美元」的转述没有放进本文。Jeffrey 回复,自动化要操作系统权限。有人问界面改版或 A/B 测试会不会让流程断掉;他回复,这不是按固定坐标点击的宏,而是用视觉模型理解界面元素,并配合实时导航、校验、按指令重放或重录,以及绕过界面的直接集成。下载页同时提供 Mac 和 Windows,发布讨论里也有人专门因为 Windows 支持而来。对照是自己做宏、或只用只支持 Mac 的电脑 Agent。

产品上下游
上游是你演示的那一遍操作、屏幕和本机应用,以及你设下的运行时间、日程和结果送到哪里。Jeffrey 回复,自主运行前你会先批准这套流程。简历下载这种条数不固定的列表,他写系统把演示当成模式:逐条处理,并用视觉或无障碍检查判断何时没有下一条,重放时还可以用自然语言改命名格式。有人问它算不算另一套操作系统;抓取到的讨论里没有团队把这句话收成「替换 Windows 或 macOS」。下载物是跑在这两套系统上的应用。下游是本机上的技能、简报和跨应用动作。Jeffrey 回复隐私结构:录下的流程、屏幕快照、音频转录和记忆库存在本机,不持续同步到他们的服务器;只有处理某一步所需的文本或界面上下文会发给 LLM API;不出售数据,也不用个人活动训练公开模型;可以查看、删除、暂停或清空。邮件分拣里哪些步骤不经人确认、有没有每周回顾,Sara Ford 在帖里问过,这次抓到的回复里没有对应答案。

4. Databench by Alkera · 官网

标语:Open-source collaborative agentic workspace for data teams

背景
Databench by Alkera 日榜第 4,发布页标为免费,公司信息写 Y Combinator、Launched in 2026。它是 Alkera 产品里可自托管的开源子集,仓库 AlkeraAI/Databench 许可为 Apache-2.0,抓取时约 0 star。README 写:同一本笔记本里混用 SQL 和 Python,SQL 单元把结果交给后面的 Python 当 dataframe;笔记本是兼容 marimo 的普通 Python 文件。marimo 是一种会按依赖重跑过期单元的开源笔记本,发布页也写了这一点。Agent 和人一起实时改单元格。组织有密码登录、嵌套团队、邀请、角色,以及记录每次决定的授权层。每个组织一块共享盘。Agent 聊天在你选定的机器上的沙箱里跑,模型网关用你自己的提供方密钥。默认 harness(发起并约束这次 Agent 运行的程序)是 vendored 的 opencode,MIT 许可;Claude Agent SDK 写为进行中。计算来自本机 Docker 或通过 SSH 加上的服务器。另有网页客户端和带本地 daemon 的 CLI alkera。联合创始人 Tony 写,另外两位联合创始人是 Rick 和 Andrew;他以前做交易数据时,管道散在 Python 文件和仓库里,编程 Agent 不擅长跨工具的数据。一位以 CTO 身份发言的人写,Jupyter 配 VS Code Live Share 会单元格失步,Agent 加进来更乱,而且有意思的分析往往不在笔记本上、尤其涉及 GPU。抓取时日榜页上的当前分数约 264、评论约 15。

产品要解决的问题
数据结论要能指回代码和数据,人和 Agent 还得同时改同一本笔记本。远程计算通常是后补上去的。

产品市场分析
发布页写给数据科学、分析和工程团队,可在 alkera.ai 用免费额度,或自己托管。README 写 Alkera 是功能更多的商业产品,并带有 generous free tier;这次没有抓到 Alkera 的价目数字。有人问竞品;团队回复,面向终端用户的对照包括 Hex,相对 Hex 和 Sigma,他们能看见整层数据,从而做原本要数据工程师搭的分析管道,并把可复现和「这个结论怎么来的」放在企业场景的前面。官网首页同时又把 Hex、Sigma 和 Snowflake、dbt、BigQuery、Databricks 等列在可连接的工具里。自托管的单机栈需要 Docker Compose v2 和 Anthropic 或 OpenAI 的 API key;README 写该栈使用开发用密钥、端口绑在本机,只适合自己的机器。给别人访问的部署用另一套生产 compose,并要求真实密钥。

产品上下游
上游是 SQLAlchemy 能连的数据库(发布页举例 PostgreSQL、SQLite、MySQL 等)、你的模型密钥,以及通过 SSH 加进来的 Linux 机器(x86_64 或 arm64,systemd)。官网首页还列出仓库、编排、BI 和知识库一类连接,包括 Airflow、dbt、Fivetran、Looker、Tableau、Notion、Slack、GitHub。下游是笔记本、图表、可分享且会跟着变的仪表盘,以及带来源、并标明是否人工核对过的知识条目。首页写列级血缘横跨仓库、转换和分析,并可以在沙箱里试改动。GPU 部分写给笔记本内核一台专用 GPU 节点;首页示例标了 8x NVIDIA B200,这是页面上的示例配置,不是本文另找的套餐价格。Agent 的编辑和人的光标出现在同一本笔记本里,结果要能追回数据和代码。

5. Pegasus 1.6 by TwelveLabs · 官网

标语:Transforms egocentric video into robot training data

背景
Pegasus 1.6 日榜第 5,是 TwelveLabs 的第 7 次发布,公司信息写 Launched in 2025。联合创始人兼 CTO Aiden Lee 写,机器人和物理 AI 团队堆着第一人称素材,用来做动作标注和下一动作预测,而通用视频模型主要在转播和第三人称画面上训练,对着可穿戴相机或机器人自己的相机时会漏掉正在发生的事。Pegasus 是他们的视频语言模型:看着视频,生成摘要、标签、时间戳或按自定义结构抽出的文字。1.6 在 1.5 的 Time-Based Metadata(按你定义的字段,抽出带时间戳的结构化元数据)上增加第一人称视频和任务叙述,并加强手、工具和物体交互的识别,以及长视频上的实体识别(凭上下文说出画面里是谁)。文档写新增:可穿戴和遥操作(人远程操控机器)画面、每次请求 1 到 20 张图像、不太依赖分段定义的元数据、分段内部的时间戳事件,以及去掉 token 上限后的分段(结果不完整时任务仍结束,并标明可能不全)。上下文窗口 261,120 token,输入和输出都算在内。单段分析最长 2 小时;整文件最长 4 小时时只能分析其中一段。语言上英文为完整支持,中文等 12 种为部分支持。Aiden 写,标注可以进训练管道,而不必做他称为每小时素材 4 到 22 美元的人工标注。迁移指南写:把模型名改成 pegasus1.6 即可,其余请求可以不动;不写模型名时仍用 1.5;批量分析还不支持 1.6。抓取时日榜页上的当前分数约 250、评论约 19。

产品要解决的问题
第一人称和遥操作录像是机器人训练的原料。通用视频模型看不懂手在做什么,人工把它们收成带时间戳的动作标签又很贵。

产品市场分析
发布页的标签是 Robots、Artificial Intelligence、Video。文档把新增用途写成动作标注、对照预期行为做质检、预测遥操作里的下一步、图像对比,以及视频分段。官网仍把平台卖给媒体、体育、广告、政府和安防等大规模视频库,模型分 Marengo(嵌入,用来搜索)和 Pegasus(生成文字)。公司页写 SOC 2 Type II、可部署到你指定的位置。这次发布没有单独的价目;官网是 Try Free 和 Talk to Sales。有人问是否依赖现有商业模型;抓取到的讨论摘录里没有团队对这句话的直接答复。有人问第一人称视频会不会成为机器人训练的主要数据来源;TwelveLabs 的 Yash Gugale 回复,这是他们在这个方向上看到的主要 traction,模型按质量和规模来做。有人问 Bedrock 托管,摘录里没有答复。对照是继续用第三人称视频模型,或继续人工标注。

产品上下游
上游是原始的可穿戴、遥操作或机器人机载录像,以及你定义的分段字段;也可以是最多 20 张静止图像。文档写视频分辨率从 360×360 到 5184×2160,文件不超过 10 GB,格式需 FFmpeg 支持;图像为 JPEG、PNG、WebP、GIF、BMP,单张不超过 20 MB。通过公开 URL 上传时要直接指向原始视频文件,视频网站和网盘分享链接不支持。下游是带时间戳的动作标签、合规类评分和可进训练管道的元数据,以及分段内的事件列表。Aiden 写 1.6 不要求特定相机。官网另写索引速度大约为实时的 60 倍、每天 1 万小时以上,那是平台页的基础设施说法,不是这次单独为 1.6 标出的基准。

6. Figma Agent · 官网

标语:Prompt, edit and prototype without leaving the canvas

背景
Figma Agent 日榜第 6,是 Figma 的第 34 次发布,公司信息写 Launched in 2015。发布说明写:Agent 就在 Design 画布上,使用真实的组件、变量和团队文件,而不是一张扁图。它可以生成布局方向、跨屏幕批量修改、把评论变成改动,并用提示做原型;通过 MCP 从 Notion、Slack、GitHub 和 Linear 取上下文;生成插件和 shader(在画面上做玻璃、折射这类视觉效果的小程序);把重复流程存成技能,用「/」运行。Hunter Kate Ramakaieva 强调,许多 AI 设计工具先给一张图,再由人在 Figma 里重建。帮助中心写,在图层上点 Agents,或按 Cmd / Ctrl + Enter 打开画布上的提示框;也可以从左侧栏打开持续侧栏。Full seat 且对文件有编辑权的人可以让它改文件;View、Dev、Collab 或只读访问只能聊天不能改;Drafts 里任何人都可以让它改。2026-06-23 起,新对话默认对同一文件里有编辑权的 Full seat 可见,更早的对话保持私有,除非你公开。The Verge 在 2026-10-06 写,这个设计 Agent 从 5 月的 Beta 进入普遍可用,并可以加入指南、看到同事的 Agent 在做什么。抓取时日榜页上的当前分数约 184、评论约 7。

产品要解决的问题
设计反馈和批量改字、改间距仍要人在画布上逐项点。另开一个 AI 工具生成图片之后,还得用自己的组件重做一遍。

产品市场分析
帮助中心页首写所有方案可用,表下又注明部分能力需要付费方案,Starter 免费方案没有。积分按任务复杂度变化,页内没有给固定单价。原型营销页则写 Agent 在所有付费方案里,当前开放 Beta 不消耗 AI 积分,并描述它会把屏幕连成可点击的流程。帮助中心的能力表把「Prototyping and interactions」标为 Coming soon,把矢量编辑、造图标、slots 也标为即将推出,把导出资源标为不支持。同一张表把技能、MCP、网页搜索、shader、插件、批量改内容、改组件实例、变量和样式、评论处理、设计反馈标为已支持。两套官方页面和 The Verge 的「已普遍可用」并不一致,本文并列。有人问能不能用 ChatGPT 订阅来驱动、能不能一次预览并撤销全部改动、组件实例会不会被拆离;抓取到的发布讨论里没有团队答复。帮助中心写聊天里的 Undo 撤销最近一次改动,并建议先复制再撤销以便对照。实例编辑写为改属性、切换变体、覆盖文字和图片,另有一项是修改主组件;这没有直接回答「会不会 detach」。对照是 Figma Make:帮助中心写 Make 用来生成可交互应用并发布到网页。另一个对照是 Figma MCP 的 write to canvas:外部编程 Agent 用插件 API 把内容写进文件,画布上的 Agent 再接着改。Agent 目前只在 Figma Design 的桌面应用或网页里,不在移动端。

产品上下游
上游是当前选中的图层、连接的设计库、用 @ 点名的组件和变量、贴上的文件或图片、网页搜索,以及 MCP 连上的 Notion、Slack、GitHub、Linear。下游是画布上的真实图层、评论、插件和 shader,以及发布说明和原型营销页所描述的交互原型。帮助中心仍把原型标成即将推出。可以并行跑多个提示,每个在画布上有进度。可以在聊天里停止当前任务。改动可以撤销,帮助中心写决定权仍在设计者。

7. Mistral Large 4 · 官网

标语:Mistral’s 1T parameter open weight frontier model

背景
Mistral Large 4 日榜第 7,是 Mistral AI 的第 24 次发布,公司信息写 Launched in 2023。2026-10-06 的官方公告把公开预览叫做 ML4,昵称 le Chonk:可在 Mistral Studio 使用预览 API,权重在本月内放出。公告写它是原生多模态、1 万亿参数、520 亿活跃参数的模型。文档页写更细:细粒度 MoE(mixture of experts,每次只激活其中一部分参数)、520 亿活跃参数、总量 1.05 万亿,另有 16 亿参数的视觉编码器;上下文 100 万 token;文档日期同为 2026-10-06,状态为 Public Preview、Open v26.10。产品页的发布摘要写的是 490 亿活跃参数,与公告和文档的 520 亿不一致,本文以公告和文档为准。文档上的模型名是 mistral-large-4+1。标价以促销价显示:输入每百万 token 0.68 美元(原价 1.36)、缓存输入 0.07 美元(原价 0.14)、输出 2.09 美元(原价 4.18)。功能列表包括结构化输出、函数调用、文档问答、批处理,以及 Agents 与内置工具。抓取时日榜页上的当前分数约 157、评论约 2。

产品要解决的问题
机构希望模型能力强,同时能在自己的机器上跑、自己定策略。闭源接口可以拒答,也可以在事件中途失去访问。

产品市场分析
公告写给金融、工程、制造、物流、制药、科研、航运和公共部门等他们正在合作的行业,并写欧洲区域由 Mistral 端到端运营、独立于其他数字服务商、适用欧洲法律。权重放出前,他们与网络安全方面的负责人、受邀伙伴和国家机构做真实场景的红队,这些对象使用同一模型的降低审核、扩大网络能力的版本。公告称这是 30 亿欧元 D 轮之后的第一个里程碑,并把该轮称为欧洲科技公司最大的股权融资;这是公司自己的表述。变现在预览期走 API 标价,权重按公告将在月底可自行部署。许可文本不在这次抓到的公告页上,发布标签写了 Open Source。文档列出的促销价如上。公告中的部分自测:Artificial Analysis Cyber Index 全球前五,并领先中国以外的开放权重模型;其中「复现开源软件里的真实漏洞再打补丁」一项为 82%,他们称为所有模型里最高;Cybench 40 道题解出 93%。他们写 Claude Opus 5.5 和 GPT-6 Astra 等闭源模型在同一项上接近 0 分,因为拒绝做这件事。编码方面:DeepSWE v1.1 为 61.7%,SWE-Atlas-QnA 为 59.4%,Terminal-Bench 4 为 28.3%,Coding Agent Index 合计 49.8%。Surge AI 的盲评里,ML4 Preview 在五个模型中编码质量第二(3.74),低于 Claude Opus 5(4.22)。视觉定位 Dense 200 为 42%,他们写超过 GPT-6-Astra 的 41%。AutomationBench 657 个业务流程为 59.9%。这些数字都来自 Mistral 的公告,不是本文复测。架构、更多基准和后训练方法,公告写将在放权重时一并公布。训练仍在进行,他们写还没有饱和。

产品上下游
上游是文本和图像,包括他们在演示里提到的工程图、图表、PDF 和大幅卫星图。训练侧,公告写从零开始,用 Mistral 自己在欧洲数据中心里的 3,800 块 NVIDIA Grace Blackwell GPU;预览也由这套基础设施提供。训练数据里有超过 160 种语言,包括欧盟全部官方语言。后训练用他们称为 Mistral Forge 的同一套训练、定制和强化学习环境;公告写当前规模约 3,000 GPU 时,一次训练每天大约产生 330 亿 token,其中约 160 亿是过滤和掩码之后可训练的补全 token。下游是 Studio 上的预览 API,以及月底起他们承诺的可下载权重,供私有云或本地部署。放权重之前,扩大后的网络能力只对公告里点名的那类红队对象开放。

8. Supademo AI Demo Agent · 官网

标语:Agentic demos like your best salesperson, without the salary

背景
Supademo AI Demo Agent 日榜第 8,是 Supademo 的第 4 次发布,公司信息写 Launched in 2022。联合创始人 Koushik Marka 写,互动演示已经做了多年,缺的是买家在夜里点完演示之后有人回答「这适合我的团队吗」。联合创始人兼 CEO Joe 写,他们想去掉预约演示的表单。Agent 用语音或文字提问、理解买家、调出对应的互动演示、视频或文档,按你的标准做资格判断并约会议,发布说明写大约 50 多种语言。买家自己点真实的分步演示,可以跳转、后退,而不是看一个不停讲的虚拟头像。Fredo Tan 回复,整个会话可以换成用户的语言,中途也能换,被调出的演示也会本地化;他并写 Supademo 网站已有日文版。用你已有的演示、视频、文档和网站训练。会话页有完整转录、AI 摘要和购买意向分;知识缺口标出答不好的问题。访客的赞踩还没有,Koushik 写已记入清单。抓取时日榜页上的当前分数约 155、评论约 13。

产品要解决的问题
买家在没人值班时看完演示,问题要等到下一个销售时段。约到演示之前,对方可能还没看见产品。

产品市场分析
定价页按创建演示的席位收费,外部观看不限。Free 每月 0 美元,1 个创建者,5 个引导式互动演示,50 段 4K 录像。Scale 每月 50 美元,年付折合每月 38 美元,按创建者计费。Business 每月 249 美元(年付折合 199),含 1 个创建者,额外创建者每月 50 美元。Growth 每月 450 美元(年付折合 350),含 5 个创建者。Enterprise 定制,从 10 个创建者起,含 SSO、数据驻留和多工作区。AI Demo Agent 是 Scale、Business、Growth 和 Enterprise 上的按量附加,不按席位。信用点:每次 Agent 回复 1 点,语音再按每 15 秒 Agent 音频加 1 点;买家自己点、Agent 没说话的时间不计费。典型 15 分钟通话大约 20 点。每个工作区起步 1,500 点(大约 75 通),页面写不需要信用卡,积分不过期。套餐 99 美元 1,400 点、299 美元 5,500 点、500 美元 12,500 点,也可在 99 到 5,000 美元之间自选。可选自动充值:余额低于 500 点时充 299 美元。Koushik 在帖里写前 75 通免费、不需要订阅;定价页则把 Agent 放在付费方案的附加项里,同时给每个工作区 1,500 免费点。两句都在公开页面上。Enterprise 的 Agent 页写额外有工作区治理、审计日志和限定来源。对照是预约表单、只说话不展示产品的聊天机器人,以及带虚拟形象的演示通话。

产品上下游
上游是你已经做好的互动演示、视频、文档和网站,加上你在构建器里写的话题范围、回避话题和自定义指令。Koushik 回复 Sara Ford:Agent 被限制在公司自己的内容上,无关请求(例如做作业)会被带回产品。下游是买家当时看见的那一段演示或文档、约到的会议,以及会话里的转录、摘要、意向分和知识缺口。积分按回复和语音计,不按买家独自点击的时间计。自动充值默认不在「必须开启」的描述里,定价页写它是可选的。

9. Rool · 官网

标语:Your private AI machine. Files, ideas, AI in one workspace.

背景
Rool 日榜第 9,发布页标为有免费方案,公司信息写 Launched in 2026。官网把它写成欧盟托管的一台云电脑:保存文件、运行软件,并使用他们在欧盟自托管的模型。聊天只是表面,后面是一台在任务之间保留工作和记忆的机器。发布说明写数据存在芬兰、适用欧盟法律;不卖数据、没有广告、不用你的内容训练模型。Casper Wilstrup 在帖里回复。他把 Rool 放在自托管和普通云服务之间:由他们运行足够多的栈(他点名 GPU)来支撑隐私承诺。多位使用者写用它做房屋翻修和申请的长期项目、统计软件里的编码、研究和图像;有人写它不像一味称赞用户的模型,Casper 回复他们有意压低这种讨好倾向。抓取时日榜页上的当前分数约 131、评论约 76。

产品要解决的问题
把文件和对话交给主流聊天产品,就要接受对方的数据用途。完全自托管又要自己准备 GPU 和运维。

产品市场分析
官网写给在意隐私的个人、团队和创作者。定价页抓取到三档,每档都从免费机器升级而来。Standard 永久免费,不需要信用卡:每天 240 点 AI 额度、2 台机器、每台 1 GB,余额每小时补充、上限 1,000,含完整 Object Memory 和前沿模型。Plus 每月 9 欧元:每天 1,200 点(页面写为 Standard 的 5 倍)、2 台机器、每台 2 GB,每小时补充上限 2,000,自定义子域名,以及连接器和 MCP。Pro 每月 25 欧元:每天 4,800 点(页面写为 20 倍)、5 台机器、每台 10 GB。抓取在 Pro 的存储一行结束,更高档或 Pro 的其余项目这次没有收全。讨论里有人提到从 ChatGPT、Claude 换过来,并担心能力差距;Casper 回复会尽量在质量上对齐,同时守住对方商业模式复制不了的隐私条件。本文没有独立的质量对比。

产品上下游
上游是你放进机器的文件和你发出的任务,以及 Plus 起可接的外部连接器和自定义 MCP。模型由他们在欧盟自托管,不走「把你的内容拿去训练」这条产品说明。下游是留在这台机器上的文档、软件运行结果和跨任务的记忆,以及你邀请的人。Casper 没有在抓取到的回复里反驳使用者的说法:这台机器在你提问时才做事。个人数据是否离开欧盟,以他们「机器和模型都在欧盟」的页面表述为准,本次没有另找审计报告。

10. Ownfeed · 官网

标语:A social feed of people who need your product

背景
Ownfeed 日榜第 10,发布页标为需要付款,公司信息写 Launched in 2026。运营者是日本神奈川的个人事业主 Shunsuke Nakagawa,支持邮箱 support@ownfeed.dev。用法是贴上产品 URL,系统读页面,每天从 Reddit、X、Bluesky 和 Hacker News 里留下「需要你所做的东西」的帖子。没有关键词设置,没有提醒收件箱,也不自动回复。你每天滚动大约五分钟,自己写回复。Shunsuke 回复排序:每条帖子有一个「值不值得回复」的分数(作者是不是在描述真实痛点、是不是在找工具),再加时间衰减;评论数和点赞数显示在卡片上,但不影响顺序。他写一条上百条评论的帖子常常是泛讨论,两条评论的帖子反而可能正是你要回的人。Sara Ford 问过要不要把讨论热度放进排序;他回复这还没做,已列入清单。发布当天他在帖里承认两处故障,并写当晚修好:托管在 Framer、Vercel 或 Webflow 上的站点被误判为私有地址;Stripe 结账页还在加载时按钮可以再次点击,第二次点击使第一次会话失效。抓取时日榜页上的当前分数约 128、评论约 43。

产品要解决的问题
需要你产品的人今天就在公开讨论里描述问题。用关键词盯收件箱,或者整段时间泡在论坛里,都会错过或看错对象。

产品市场分析
FAQ 写给做完产品、想找到正在寻找它的人的独立开发者。价格:1 美元试用 1 天,之后每月 39 美元,除非在试用结束前取消;或每 3 个月 89 美元。均自动续费,美元计价,结账时可能加税。取消后用到已付周期结束。三个方案都包含 Reddit、X、Bluesky 和 Hacker News。3 个月方案额外有小批量、无保证的 Beta 来源:LinkedIn、Threads、TikTok、Instagram、YouTube 和 Product Hunt。有人建议自动拟回复、翻译非英文帖、以及用赞踩训练相关性;这些是评论里的建议。Shunsuke 回复,匹配不依赖产品名,只描述问题的人也可以排到前面。对照是关键词提醒、自动代发回复的工具,以及自己搜索。首页用一个虚构的发票产品 Tidybill 走通流程,那些帖子是页面示例,不是客户案例数字。

产品上下游
上游是你贴上的产品页,以及上述平台的公开帖子。FAQ 写他们读产品页、搜索公开帖,再用 AI 留下产品用得上的那些。下游是你自己的时间线,不是代发的评论。Ownfeed 不登录你的社交账号,回复在你原来的账号里由你自己写。试用会准备最近一段时间的帖子;Shunsuke 在修好误判后,给一位用户准备了最近 7 天。首页写生成订阅源通常大约 15 分钟。评论里提出的翻译和相关性反馈,在抓取到的回复中还不是已上线功能。

In React Native, logical AND may cause crash as below.

Conditional rendering in React Native may crash your app

This babel plugin here can replace all logical AND with ternary operators, with a little more configuration.

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
// .babelrc.js
module.exports = function (api) {
api.cache(true);

const presets = [];
const plugins = [
'./ternary-jsx.js',
// this two plugins below only parse but not transform code
['@babel/plugin-syntax-decorators', { decoratorsBeforeExport: true }],
['@babel/plugin-syntax-class-properties', { loose: true }],
];

return {
parserOpts: {
plugins: ['jsx', 'typescript'],
},
presets,
plugins,
generatorOpts: {
retainLines: true,
compact: false,
minified: false,
concise: false,
},
};
};

However, Babel will lose some code formatting in the process, as it works based on the AST..

How to add Category and Tag page

If you want one page list all categories, just create source/categories/index.md, and then write type: categories in it, which tells Hexo to create public/categories/index.html. “Tags”, “About” are the same.

1
2
3
4
cd source
mkdir categories
cd categories
vi index.md
1
2
3
4
5
6
<!-- index.md -->
---
title: categories
type: "categories"
---

引言

开发过程中经常会碰到相同的逻辑,一般为了代码的整洁性,都会进行复用。
但是是不是所有相同的逻辑都需要复用呢?

实际场景

有两个商品卡片需要实现,其中一个是热点商品,一个是普通商品
两个在长相上有一些区别,大概在30%左右
热点商品多了标签,背景色,按钮等功能

  • 复用型写法I
1
2
3
4
5
6
7
8
9
10
11
12
function ProductCard({isHot, price, productImage, productUrl}) {

return (
<div style={isHot ? styles.cardWithBg : {}}>
{isHot && <Tag />}
<span>{price}</span>
{isHot && <Button />}
<img src={productImage} onClick={() => Navigate.push(productUrl)} />
</div>
)

}
  • 复用型写法Ⅱ
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
function CommonProductCard({price, productImage, productUrl}) {
return (
<div>
<Price price={price} />
<ProductImage image={productImage} url={productUrl} />
</div>
)
}

function HotProductCard({price, productImage, productUrl}) {
return (
<div style={styles.cardWithBg}>
<Tag />
<Price price={price} />
<Button />
<ProductImage image={productImage} url={productUrl} />
</div>
)
}

function Price({price}) {
return <span>{price}</span>
}

function ProductImage({image, url}) {
return <img src={productImage} onClick={() => Navigate.push(productUrl)} />
}

复用型I的代码说不上来的别扭,绝对的垃圾代码
复用型Ⅱ是经常能见到的,看起来解耦非常不错,也容易理解,但是细想:
热点商品为什么要跟普通商品的UI复用?两者本来就应该长得不一样。现在只是恰巧有某些地方是一样的,后来我说不定就改了。

技术层面复用逻辑没有问题,但是回到需求本身,这种复用是没有必要的,本来这两个东西就应该是分开的。
所以不如复制粘贴再写一遍更好:

  • 分离型写法
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
function CommonProductCard({price, productImage, productUrl}) {
return (
<div>
<span>{price}</span>
<img src={productImage} onClick={() => Navigate.push(productUrl)} />
</div>
)
}

function HotProductCard({price, productImage, productUrl}) {
return (
<div style={styles.cardWithBg}>
<Tag />
<span>{price}</span>
<Button />
<img src={productImage} onClick={() => Navigate.push(productUrl)} />
</div>
)
}

总结

不要盲目的复用代码,即使他们在逻辑上有相同之处,也要看这种逻辑相同是否是需求所期望的,可能只是偶发性的相同。

今日 Hacker News 热榜前五里,两条都指向 OpenAI 刚公开的数学预印本库:第一条是整批结果的发布说明,第五条单独讨论其中的整数乘法。中间是 Mistral Large 4 的公开预览、把 PS5 可执行文件重链接到 PC 的 AnyPS5,以及 OpenAI Decisions API 的公测。数学仓库写明稿件处于不同核验阶段,并非篇篇都有 Lean 形式化;Mistral 的新闻稿和文档页对激活参数的写法也不一致。以下按 Firebase topstories 当时的顺序整理,分数与评论数为抓取时快照。

1. Sharing AI progress in mathematics

背景介绍
OpenAI 这篇发布页直连返回 HTTP 403,下面的页面原文来自 r.jina.ai 转写,并与 openai/math 的 README、CONTENTS.md 核对。页面说,他们放出一批由一个内部前沿模型做出的数学结果,模型链接指向此前的 Navier–Stokes 页面。发布方式参考了普林斯顿高等研究院「数学与人工智能咨询组」(AGMAI)的意见和公开建议:这次先放在 GitHub,并附上修订和引用规则;他们还在看有没有符合该委员会要求的社区托管方案。许多证明会用 Lean 写成可机检的形式化,拿到之后再补进仓库。页面还说会公开 10 份推理过程摘要、按 ChatGPT Pro 用量估算的算力,以及尝试过多少问题。平均每个结果所用的算力,大约相当于三小时的 ChatGPT Pro 思考。页面写,他们打算资助围绕这些结果的研讨和项目,并在准备把产出这些结果的模型负责任地放出来。

仓库 README 写得更具体,也更谨慎。稿件和证明附件来自一个尚未发布的内部模型;现有数学评测饱和之后,他们把评测扩到开放研究问题上,有些输出建立在模型更早的结果之上。目录里目前是 722 篇手稿、372 个族。一族可以包含主结果、伴随论证、推论或另一条证明。核验阶段并不整齐:不是每篇都有 Lean,README 写「有些尚未形式化的结果可能有问题」,并说会尽快修。绝大多数结果用同一套流程:平均每个结果三小时 ChatGPT Pro 算力,整个评测大约抛了 4,000 个问题,再按族和显著性收成现在的目录。README 点名的例外有两处:黎曼 ζ 函数的无零点区域,以及对 CM 阿贝尔簇的 Hodge 猜想的证明。另外,Re(s) > 11/12 这一无零点区域的文稿经过人工编辑,以便阅读。GitHub API 显示该仓库创建于 2026-10-06 21:47 UTC。

CONTENTS.md 里抽查到的几条,都是目录自己的表述,不是本文重新证明过的定理。第 102 族写,证明了 Khot 的 Unique Games 猜想:对任意固定的 ε、δ ∈ (0, 1/2),给出从 3SAT 到有限字母表 Unique Games 的确定性多项式时间归约,完备性至少 1−ε,soundness 至多 δ。同一族还写了若干直接归约,包括在无权图上、超过 Goemans–Williamson 比例的 Max-Cut 近似是 NP-hard。这一族标了 Lean 链接。第 180 族写,证明 Barnette 猜想:每个有限、简单、三正则、二部、平面、三顶点连通的图都有 Hamiltonian 圈;也标了 Lean。第 124 族写,解决 Garey 与 Johnson 书里的三台相同机器、单位工时、带优先约束的调度问题,给出确定性多项式时间算法,并标了 Lean。第 003 族写,每个 Dirichlet L 函数(含 ζ(s))在 Re(s) > 7/8 没有零点,并称之为拟黎曼假设的解决;伴随稿另给 Re(s) > 11/12 的证明,这一族同样标了 Lean。README 说 11/12 那篇文稿经过人工润色,无零点区域的工作和 CM 阿贝尔簇上的 Hodge 猜想不属于上面那套固定流程。整数乘法是第 109 族,放在本文第 5 条。

主要讨论方向与观点
讨论集中在「如果这些稿子成立,分量有多大」,以及还没人逐篇核完。enoether 说 Unique Games 猜想是复杂性理论里的基础猜想,很多不可近似结果以它为前提,一份站得住的证明是大事。prideout 点名 Barnette 猜想:几个月前用当时的前沿模型自己试过,没做出来;这份证明乍看还读得进去。NotOscarWilde 做调度,认为三机单位工时不如 Unique Games 重要,但从 Garey 与 Johnson 1979 年的书起就是开问题。他引用论文里的 Theorem 1.1:在确定性多带图灵机上,步数是 O((L+2)^150020),L 是输入的二进制长度。目录摘要只写「多项式时间」,这个指数来自该评论对论文的摘引,本文没有从 PDF 里再对一遍。他说自己今天核不了正确性,但希望这个指数是真的。

xanderlewis 引用 Kevin Buzzard 的话:Buzzard 在 2020 年《Notices of the AMS》里问过,若有一个人同时理解全部现代纯数学,他立刻还能多看多远;六年后开始看见答案的形状。schleck8 贴了 Anthropic 数学家 Levent Alpöge 的一段评论,把证明、零和计算机这一类历史进展,与「把过去十年糊在一起看、再用今天来度量」做对比,说没有可比较的东西。这段是 HN 上的转述,本文没有打开 Alpöge 的原帖。gizmodo59 认为这是一次没有伴随戏剧的进展,并建议把仓库交给自己的 agent 去估分量;评论里还有「相当于人类 50 到 100 年数学进展」的说法,那是评论者的判断。foota 引用了仓库里「平均每个结果大约三小时 ChatGPT Pro」那句。bashtoni 问的是就业:数学家会被替换,还是会多出一批审这些证明的工作,现在还不清楚。againstapples 以「AI doomer」的身份问非 doomer:这类结果在未来一到五年里,是平台期,还是只停在数学里。zone411 对照 proofatlas.ai 的开放问题榜,称这份目录声称完整解决了前 500 个问题中的 90 个,并列出他认为排名最高的若干项,其中包括有理数上的 Hilbert 第十问题、Unique Games、Anderson 模型的扩展态和时空 Penrose 不等式。本文没有核这 90 条;仓库里确实有标题对应 Hilbert 第十问题(有理数)和 Unique Games 的手稿目录。sebmellen 建议去读 reasoning_traces/,README 的十份摘要表里包括三维相对论 Vlasov–Maxwell 系统。

专有名词解释

  • AGMAI:页面上的全称是 Institute for Advanced Study 的 Advisory Group on Mathematics and Artificial Intelligence。OpenAI 说这次的发布形式参考了他们的建议。
  • Lean:可让计算机检查证明的形式化语言。README 写许多手稿已有形式化,但不是全部;未形式化的结果可能有问题。
  • Unique Games 猜想:Khot 提出的复杂性猜想。目录第 102 族声称用从 3SAT 出发的归约证明了它。完备性是「原问题可满足时,新实例里能满足的约束比例」;soundness 是「原问题不可满足时,任何赋值至多能满足的约束比例」。同一族还由此写到一批近似问题的 NP-hard 门槛。
  • Goemans–Williamson:Max-Cut 的一种半定规划近似算法。目录说,在无权图上,任何固定地优于该比例的近似都是 NP-hard。目录没有写出这个比例的小数。
  • Barnette 猜想:每个有限、简单、三正则、二部、平面且三顶点连通的图都有一条经过每个顶点恰好一次再回到起点的圈。目录第 180 族声称证明了它。
  • 拟黎曼假设:目录第 003 族用这个名字称呼「Dirichlet L 函数在 Re(s) > 7/8 无零点」。ζ 函数是其中之一。Re(s) > 11/12 是伴随稿,README 写那篇文稿经过人工编辑。
  • ChatGPT Pro thinking:OpenAI 用来给这批结果估算算力的单位。页面和 README 都写,平均每个结果大约三小时。

HN 讨论:thread · 362 分 · 299 评

2. Mistral Large 4

背景介绍
Mistral 于 2026 年 10 月 6 日发布 Introducing Mistral Large 4。HN 提交的 URL 末尾多了一个反斜杠,文章本身的地址没有它;模型卡在 docs.mistral.ai。博文称公开预览,非正式名字 ML4,正式绰号 “le Chonk”。预览 API 可在 Mistral Studio 试用,权重写在本月底放出。

参数有两套官方写法。博文写:原生多模态,1 万亿参数,490 亿激活,是他们至今最大的模型,并且还在变好。文档页 meta(页面标注 October 6, 2026、Public Preview、Open v 26.10)写:细粒度 Mixture-of-Experts,激活 52B,总参数 1.05T,另有 1.6B 视觉编码器。同一文档页的价格数据是:输入每百万 token 0.68 美元(划掉的 originalPrice 为 1.36)、缓存输入 0.07 美元(原 0.14)、输出 2.09 美元(原 4.18),上下文 1M。本文没有另找第三方价目表。

博文写,ML4 从零训练,用了 Mistral 自己位于欧洲的数据中心里 3,800 张 NVIDIA Grace Blackwell GPU,公开预览也由这套设施提供。权重放出前,他们与网络安全方面的负责人、受审合作方和国家机构做红队,对方使用同一模型,但审核更松、网络能力更宽。博文强调欧洲端到端部署,按欧洲法律、不依赖其他数字服务商;训练数据里有相当一部分是多语的,覆盖 160 种以上语言,包括欧盟每一种官方语言。定制和强化学习环境与卖给客户的 Mistral Forge 相同。博文还写,更细的架构、更多基准和后训练方法要等权重一起公布。

博文中的基准是 Mistral 的表述,本文没有重跑。Artificial Analysis Cyber Index 上,他们写 ML4 位于全球前五,并大幅领先在中国以外开发的开放权重模型;其中一项「在开源软件里复现真实漏洞再打补丁」的测试为 82%,是该项任何模型里的最高分。Cybench(40 道来自安全竞赛的练习)为 93%,称为开放权重模型里最高分之一。博文接着说,Claude Opus 5.5 和 GPT-6 Astra 在同一测试上接近 0 分,因为它们拒绝做这件事;而防守往往要从证明漏洞真实开始。内部测试里,模型被用于分析恶意软件、给漏洞排序和写检测规则。博文同时写,在 JailbreakBench、StrongREJECT 和 AgentHarm 的网络安全提示上,ML4 的平均拒绝率高于所有开放权重模型。

编程数字:DeepSWE v1.1 为 61.7%,SWE-Atlas-QnA 为 59.4%,Terminal-Bench 4 为 28.3%,Coding Agent Index 合计 49.8%,博文称高于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。Surge AI 的盲测里,职业标注者按 1–5 给编程质量打分,ML4 Preview 在五个模型里排第二(3.74),低于 Claude Opus 5(4.22),高于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40)。AutomationBench 的 657 个业务流程(Gmail、Google Sheets、Slack、Salesforce 等)为 59.9%。AA-Briefcase 的 Elo 为 1,393。视觉定位 Dense 200 为 42%,GPT-6-Astra 为 41%。开放权重模型里,SciCode-Verified 被写成领先;博文举例说它可以一次生成完整的 Hartree–Fock 模拟。法律和金融任务经由 vals.ai,博文称两项都超过 GPT-6-Astra;HarveyAI 的 Legal Agent 上超过所有开源模型。Lakera 公开的 B3 基准上挡住 93.3% 的攻击。KORA 为 1.691,满分 2,博文称为他们在开放权重模型里测到的最高。内部标注者拿它和 GLM-5.3 比:CAD 和 STEM 更偏好 ML4,金融和编程接近或持平。

后训练一节把预训练的 3,800 张卡和当前强化学习规模分开写:当前规模是 3k GPU,单次训练一天大约产生 330 亿 token,过滤和掩码之后约 160 亿是可训练的 completion token。博文写这次预览背后的强化学习还在跑,没有饱和的迹象。文末把 ML4 称为 €30 亿 Series D 路线图上的第一个里程碑,并称这是欧洲科技公司最大的一轮股权融资。这是博文自己的说法。

主要讨论方向与观点
simonw 试了推理档位:只看到 “none” 和 “high”。两边的思考痕迹都很少,high 的输出 token 甚至更少,但 high 画出的自行车车架更好。他把自己的鹈鹕骑自行车结果链出来,并说这是他见过的 Mistral 模型里最好的一张。chriddyp(Plotly)贴了他们的数据分析基准:相对 4 月的 Mistral Medium 3.5,价格约为十分之一,正确率从 58% 到 74%;还没站上帕累托前沿,但他认为再过几个月会很好。这些百分比和倍率是该评论里的结果,不是博文的数字。jakozaur 用 Vals Index 做了更宽的比较:48.05% 对 GLM-5.3 的 53.51%,每次测试 13.78 美元对 7.25 美元,并说很多公司仍会因为它不是中国模型而选用。他把 82% 叫成 CyberGym-E2E;博文的 82% 写在 Artificial Analysis Cyber Index 的那一项漏洞复现测试上,两个名字本文没有再对齐。

abixb 问基础设施:若大约 4,000 张 Grace Blackwell 就能把 1T 模型训到接近 Kimi K3、并在部分项上追上中国实验室,美国超大规模集群里的几十万张卡是在做什么。评论里点名的集群规模是评论者的说法。eigenspace 觉得这至少说明早期并不是赢家通吃、追赶不可能;Large 3 摔过之后 Mistral 还在,他希望它「够好」,成为欧洲的默认选项。michaelkdev 把卖点放在欧盟主权:在欧盟训练、在欧盟推理。prodigycorp 认为视觉和网络安全数字够做日常模型,网络安全上也许会成为首选,并说不该无缘无故贬 Mistral。simjnd 认为它比 DeepSeek 4.1 Flash 略低、规模大约两倍;对一个「本该几个月前发布」的模型来说已经不错。manlymuppet 的语气相反:讨论像在给最后冲线的孩子加油,Mistral 的进度比美国实验室和中国实验室都慢。

专有名词解释

  • MoE:Mixture-of-Experts。文档页写 ML4 是细粒度 MoE,所以激活参数远小于总参数。博文的 490 亿激活和文档的 52B 激活没有对齐。
  • Grace Blackwell:NVIDIA 的 GPU 平台。博文写从零训练用了 3,800 张,放在 Mistral 自己的欧洲机房;后文的强化学习规模另写为约 3,000 张。
  • Cybench:博文描述为 40 道来自安全竞赛的练习。93% 是博文里的分数。
  • Dense 200:博文用来比较视觉定位的基准。42% 与 41% 都出自这篇博文,不是本文复测。
  • Hartree–Fock:量子化学里近似电子结构的一套计算。博文说 ML4 可以一次生成完整模拟。
  • le Chonk:博文给 ML4 起的绰号。权重仍写在本月底,预览期间先走 API。

HN 讨论:thread · 1580 分 · 960 评

3. AnyPS5: Port PS5 binaries to PC without emulation (87% system libraries mapped)

背景介绍
AnyPS5 的 GitHub 描述是:把 PS5 可执行文件自动移植到 Linux 和 Windows。README 写,relinker 把可执行文件转成目标系统的原生格式,并提供一批可动态链接的系统 PRX 库实现。没有仿真,也没有单独的运行时进程。语言是 C++,许可证是 GPL-2.0 only。仓库创建于 2026-08-03。README 没有署个人真名,账号是 boykopovar。

HN 标题里的 87% 和页面徽章不是同一个数字。抓取时 libraries 徽章 为 86.62%,shaders 徽章 为 97.34%。README 的脚注写明:系统库百分比是项目迄今已知、并在 core/libs/prx 里声明过的函数所占的比例,不是全部 PS5 系统函数;分母会随着新声明变大。着色器重编译器在打开 ANYPS5_ENABLE_SPIRV_TOOLS 时,会用 SPIRV-Tools 校验生成的 SPIR-V。未支持或意外状态一律抛 std::runtime_error,把 what() 打到 stderr 后进程退出。

兼容表 COMPATIBILITY.md 里目前只有一行:Dreaming Sarah(ID PPSA02929),Windows 为 “In game, playable”,Linux 为 “?”。GTX 1050 Ti / i5-7500 3.4GHz 上 60 FPS,Intel HD Graphics 620 / i5-7200 2.5GHz 上 36 FPS。用法要求一份干净的 ELF,配套模块放在可执行文件旁的 sce_module/、sce_modules/ 或 prx/。relinker source/input.elf app.elf 产出 Linux ELF;加 --windows 产出 PE。--to-intel 给 Intel 主机。输出格式默认是 Linux ELF,只把文件名改成 .exe 并不会变成 Windows。手柄走 SDL 映射;键鼠用 anyps5-input.ini。

免责声明写:项目用于互操作、研究、保存和兼容,不包含、不分发、也不要求版权软件、固件、密钥或专有库;使用者自行遵守法律和许可。技术债文档写,Windows 构建需要特定的 MinGW-w64 GCC 15.2.0,并且若干对话框库是静默桩:存档、消息、错误和登录对话框不画出真正的界面。

主要讨论方向与观点
someperson 建议本地做 git 镜像,因为项目以后可能被法律投诉下架,并举 Yuzu、Ryujinx,以及 Nintendo 在一天内清掉大批 Switch 模拟器仓库的报道。causesothere 好奇是谁在做这种东西:太受欢迎的话,像是在请政府上门;同时认为问题本身在技术上有意思,也高兴有人在保存游戏。weakened_malloc 支持打破厂商锁定,但担心这会推动 Sony、Nintendo 和微软更偏向云游戏,让这类移植更难发生。dukodk 问会不会在发售日就有 GTA 6 的 PC 移植。vuurmot 接着问:若第一天就能把游戏剥出来,谁还会付钱,软件产业权重大的国家会不会被压垮。这两问都是推测,兼容表里并没有 GTA。

emkoemko 问这是不是 WINE 那种做法。Xirdus 回复:介于 Wine 和 Rosetta 之间;二进制本身会被改写,但源和目标都是 x86,所以没有指令转译。isityettime 接着问,这听起来不就是 Wine。README 的原话是重链接到原生格式,加上系统库的重新实现,没有仿真,也没有单独的运行时进程;它没有使用 Wine 或 Rosetta 这两个名字。dsedgwick 认为,既然 PS5 已经是 x86-64,摩擦主要在专有图形 API,并问 GNM 命令缓冲是在静态重链接阶段预先编成 Vulkan,还是游戏排队绘制时仍有运行时拦截。README 确认着色器重编译器产出 SPIR-V,没有写 GNM 命令缓冲的处理方式。

专有名词解释

  • PRX:PlayStation 上的可重定位系统库模块。AnyPS5 重新实现的是项目已经声明的那一部分,徽章分母会变。
  • relinker:仓库里的转换器,把 ELF 收成 Linux ELF 或 Windows PE,再链到这些库。
  • SPIR-V:着色器的中间表示。README 写重编译器能生成它,并用 SPIRV-Tools 做校验。
  • GPL-2.0 only:GNU 通用公共许可证第 2 版,不含 “or later”。
  • Wine / Rosetta:Wine 在非 Windows 上翻译 Windows API,而不是仿真 CPU。Rosetta 是苹果在不同 CPU 架构之间翻译指令的兼容层。Xirdus 用这两个名字描述 AnyPS5;README 没有使用它们。

HN 讨论:thread · 54 分 · 15 评

4. Decisions API is in public beta

背景介绍
OpenAI 的 Decisions API 指南 写,这个接口评估文本、图像或两者,返回带类型的答案,速度大约是 Responses API 的 10 倍。用途是判断条件是否成立、从固定选项里选一个,或按量表打分,用来分类、路由和排优先级。接口处于公测,文档预期未来几周进入 GA。目前唯一可用的模型是 gpt-6-luna,端点是 POST /v1/decisions。

三种问题类型:predicate 检查一个条件,返回 0 到 1 的概率,表示模型估计该条件为真的程度;choice 从调用者给出的选项里选一个,并返回各选项概率和一个 confidence;score 按从低到高的等级打分,返回的分数是等级下标的概率加权平均,因此可以落在两个等级之间。文档里的例子:0.1、0.7、0.2 三个概率得到 1.1。需要自由生成、符合自有 JSON schema 的对象时,文档建议用 Responses API 的 Structured Outputs;需要模型发起工具调用时用函数调用。相互独立的问题可以放进同一次请求;若后一个问题依赖前一个答案,则要分成两次。

图像必须是内联的 base64 data URL。托管的 HTTP/HTTPS 图片 URL 和 file_id 不受支持。定价写在 gpt-6-luna 上:输入每百万 token 0.10 美元,只对输入 token 收费,没有缓存读、缓存写或输出 token 的费用。区域处理加价和长上下文乘数仍然适用;同一模型走其他接口时,按那些接口自己的价格。文档写,符合条件的客户可以使用 Zero Data Retention 和 HIPAA;数据驻留和区域处理支持美国,以及欧洲(EEA 与瑞士)。

主要讨论方向与观点
simonw 贴了一次真实调用:输入 “I am angry about the new product feature”,两个 predicate 分别问是不是投诉、是不是夸奖,返回概率 0.91 和 0.06,output_tokens 为 0,输入 310 token。他把这收成一个 llm 插件 llm-openai-decisions,并说 OpenAI 单独开一个端点时,常常会变成其他供应商跟着做的事实标准。TSiege 把这次发布读成对 Jev 的回应,并认为这能说明 AI 生意是大宗商品:Jev 证明了又快又便宜的是/否/置信度就够用,开源版本涌进 Hugging Face,大实验室若想留住客户,就得把原本靠输出 token 赚钱的一块让出去。sidcool 说 Jev 震动了行业,事后看很明显。jasonjmcghee 回想起早期补全 API 和指令 API 分家,问这种接口以后会不会被折进模型的后训练,让校准过的输出变成模型本身的能力。swader999 问,为什么不直接做进所有模型,而要单独一条路由。

Topfi 用不到 600 次调用,经 OpenRouter 把自己的决策评测(界面组件选择、聊天图表、标签、个人知识管理)拿去对 Jev 和 Mercury Decide。他的初步结果:比 Jev 慢,延迟和 Mercury Decide 差不多,但并不随输入变长而线性增长(p50 346ms,p95 860ms);在他那些含糊的界面任务上置信度更低,0.6 及以下常常达不到他的用途;失败调用 4 次,两家对照都是 0;平均比 Jev 贵约 3.1 倍。他尚未测试图像输入,并说这套评测绑在自己那个带无限画布的 Firefox 分支上,不能当成通用结论。MiroslavPokorny 针对文档里「罐头有没有凹痕」式的商品损坏示例,问知道这一点有什么价值。mrkn1 另指了一条在 CPU 上跑决策模型的项目 gutsy,本文没有展开那条线程。

专有名词解释

  • predicate / choice / score:Decisions API 的三种答案。第一种是条件为真的概率;第二种是无序类别;第三种是有序等级的期望下标。
  • confidence:choice 和 score 在概率分布之外另给的字段。文档建议用自己的标注样本来定路由阈值。
  • gpt-6-luna:文档写明,公测期间这个端点只有该模型。这里的 0.10 美元/百万输入 token 只适用于 /v1/decisions。
  • Zero Data Retention:文档中的零数据保留选项,限于符合条件的客户。
  • Jev:评论里用来对照的决策模型。TSiege 把它描述成便宜的是/否/置信度接口,并说开源版本已经很多。本文没有另抓 Jev 的产品页。
  • Responses API:OpenAI 用来生成文本和工具调用的接口。Decisions 文档用它做速度和用途上的参照。

HN 讨论:thread · 121 分 · 51 评

5. Integer multiplication below n log n

背景介绍
这一条是第 1 条同一个仓库里的单篇预印本,日期写着 2026 年 9 月 23 日,作者栏是 OpenAI。目录里的 README 只有标题、日期和 BibTeX,正文在 paper.pdf。CONTENTS.md 第 109 族的摘要是:在一台固定的、有限字母表、有限条一维纸带的图灵机上,对每一个输入长度,把两个 n 比特整数精确相乘,确定性最坏情况时间为 O(n (log n)^{1−κ}),其中 κ = 2^{−182}。目录说,这在普通多带比特模型里否定了 Schönhage–Strassen 关于 n log n 最优的猜想。手稿简介里的对数写成 lg,族摘要写成 log;两者都在同一个大 O 和同一个指数下面。

和第 1 条里几篇不同,这一族的标题下没有 Lean 链接,仓库里也没有 lean/docs/109。第 102、124、180 和 003 族则标了 Lean。本文没有运行那些形式化,也没有把这篇 PDF 逐页核完。第 1 条的 README 仍然覆盖它:未形式化的结果可能有问题;平均结果大约用了三小时 ChatGPT Pro 量级的算力。那是整批目录的平均值,不是这篇单独标出的耗时。

主要讨论方向与观点
线程几乎全在谈这个指数有多小,以及没有机器检验时该不该信。shmoil 说自己对着 n lg n 的 (1 − 2^{−182}) 次方笑出声。12390asdjkas 写,这适合「数组至少有 2^118000 个元素」的场合,除非加速是真正一般的,否则不会在意各种乘法加速的提案。2^118000 是这则评论里的说法,不是目录里的门槛。MinimalAction 问,既然看起来没有低出阈值多少,为什么还值得注意。isaac-harvey 回复:只要任何一点低于 n log n,就说明上面可能还有空间;理论上很小的突破,常常会引来后来真正把差距拉开的工作。Kotlopou 把兴趣放在应用之外:用上万亿美元的技术,才知道两个数可以乘得稍快一点;数学比大模型大,声称数学正在被「解决」、开放问题快要用完的人,还没有朝这口深渊里看够。infocollector 说,若有人真能读懂,这会很惊人。

wk_end 直接问有没有配套的机器检验证明。他写自己工作里已经是 vibe-code,所以既知道前沿模型有多强,也知道它们会很有把握地讲出错事。没有 Lean 开发或充分的人工核验,他就保持怀疑,甚至有点希望结果是错的:一部分是因为他对 AI 并无好感,一部分是因为 n log n 比现在这个界漂亮得多。目录现状和他的要求对得上的地方是:整数乘法这一家没有挂上 Lean 链接。

专有名词解释

  • n log n:n 比特整数相乘时,人们长期对照的复杂度标尺。目录把 Schönhage–Strassen 猜想表述为:在普通多带图灵机上,这个量级已经最优。算法文献里,2019 年 Harvey 与 van der Hoeven 给出过 O(n log n) 的算法;本预印本声称再低一个 (log n) 的极小幂。
  • κ = 2^{−182}:目录里的指数。相对 n log n,比值是 1 / (log n) 的 2^{−182} 次方,所以对任何写得下来的 n,改进都极小。评论区笑的是这一点。
  • 多带图灵机:这篇复杂度陈述所用的计算模型。目录写明是一台固定机器、有限字母表、有限条一维纸带,而且每个输入长度都精确,不是近似或平均情况。
  • Schönhage–Strassen:1971 年的快速整数乘法,以及目录所否定的那条最优性猜想。猜想的原始论文不等于这份预印本。

HN 讨论:thread · 40 分 · 27 评

今日 Product Hunt 热榜对应太平洋时间 2026-10-06 日榜(上海时间 10 月 7 日上午抓取,太平洋时间当日尚未收盘)。前半段是把已经在用的编程 Agent 放进浏览器、给一次 Agent 运行留下跨系统的成本记录,以及在自己的电脑上组一支 Agent;后半段是用语音把点击和打字交出去、把 LinkedIn 外联交给自己的 Agent、用一套接口搭销售栈,以及把听写偏好从常用模型里导进来、用短课学编程、让 Agent 操作一台真 iPhone,和从收件箱发起删除个人数据。按日榜页名次,前五是 Rill Browser、AUDR by Chargebee、OpenBot、Incredible 与 Extrovert,后五是 Fuse AI、Willow Knowledge、Coddy、iphone-use 与 Ghostifier。前六名的分数和评论数取自同周周榜页上这些发布的当前分数(页面写分数是此刻的活跃分数);后四名这次没有核对到单独标出的分数字段。收盘前名次和分数仍可能变化。

1. Rill Browser · 官网

标语:The browser where Claude Code and Codex work beside you

背景
Rill Browser 日榜第 1,发布页标为免费,产品页写 Launched in 2026。发帖人 William(@williamgaoharvard)写,自己做这个浏览器是为了不用在「正在看的页面」和「编程 Agent」之间来回切换。它基于 WebKit(苹果的浏览器引擎),系统要求是 Apple silicon(M 系列芯片)和 macOS 14 及以上,页面标为 Beta。浏览可以不登录 Agent;AI 功能调用的是这台 Mac 上已经登录的 Claude Code 或 Codex,不另买订阅,也不要 API key。在任意页面按 ⌘E,把眼前的内容说成一项任务,Rill 从 Claude Code 和 Codex 的历史里找项目并把上下文带过去。也可以按主题整理标签、把历史收成可搜索的一天,以及把各项目里 Agent 做过的事放在同一张图上。语音输入在设置的 Talking 里,按住 Fn 说,页面写仍是 beta。William 回复进度显示:正在工作的 Agent 会出现在右下角的 At Work 托盘里,用颜色区分状态,并有一行当前进度。有人问为什么不做 Chrome 扩展;他回复扩展只能改浏览器里的东西,而他想把 Agent 放进「人产生想法的地方」,并感谢 WebKit,说他们看过 Chromium 的内部、复杂度很高。有人拿 Atlas、Comet、Dia 比较;他回复那些产品是在浏览旁边加 AI,Rill 要接的是能跑长时间任务的编程 Agent,并举 Astra 和 Fable 作为这类能力的例子,本文不另释这两个名字。抓取时周榜页上这条发布的当前分数约 361、评论约 55。

产品要解决的问题
想法往往出现在读网页的时候。要切到终端、找到仓库、把刚看到的内容再讲一遍,这一步会把想法丢掉。

产品市场分析
官网写给已经有 Claude Code 或 Codex 方案的人。变现信号是浏览器免费,模型费用走用户自己的方案。对照是继续用系统浏览器加终端,或使用在页面旁边加助手、但不把编程 Agent 当作一等公民的浏览器;后一句是 William 的区分。目前没有 Chrome 扩展。有人说因此用不了 1Password;William 回复密码存在 Mac 的 Keychain(系统钥匙串),可以从 Chrome 等浏览器导入,并写愿意以后支持第三方密码管理器。他另写将来会做「用一句话做自己的扩展」,左上角的画是留给这个功能的位置,今天还没有。

产品上下游
上游是当前页面、用户点出的位置,以及本机已登录的 Claude Code 或 Codex 和它们的项目历史。下游是落在对应项目里的任务,以及浏览器自己的标签、历史和钥匙串。官网 FAQ:新任务在你允许编辑之前是只读的,git 仓库里的每次编辑可以撤销。网页上的任务会在付款、下单、发送、发帖或删除之前停下,除非你明确说做完;它不能往密码、银行卡或一次性验证码栏里打字。Agent 把页面当成不可信文本。在项目里,Agent 用自己的标签浏览,不带你的登录,点击或输入要你允许;直接对网页下的任务会用到你的登录,限制同上。FAQ 写这降低提示注入(页面里的文字假装是指令)的风险,但去不掉。标签整理和「一天摘要」可以在设置里关掉。历史以文件形式留在这台 Mac 上。

2. AUDR by Chargebee · 官网

标语:Open standard for tracking agent run costs

背景
AUDR by Chargebee 日榜第 2,是 Chargebee 的第 6 次发布,发布页标签含 Open Source、Developer Tools、GitHub。AUDR 是 Agent Usage Detail Record 的缩写:一次 Agent 运行的用量明细记录。官网把它比作电信业的 CDR(Call Detail Record,通话详单):先记下用量,以后再定价。一条 JSON 记录带着 token、工具调用、计算秒数,以及客户、功能、环境这些业务字段。三条规则写为稳定、不经主版本不会改:运行 ID 由 harness(发起这次运行的应用)生成并传到后面的每一层;每个字段只有一个权威来源;汇合时冲突就拒绝,更正是新记录,不是改旧记录。规格页面为 openaudr.dev/spec/v1.0.0/。协议为 Apache-2.0,仓库 openaudr/audr 抓取时约 10 star。Chargebee 的 Akash Sharma 在帖里感谢早期审阅和倡导者,点名 Merge、Mastra 和 OpenHuman。讨论里有人问要不要把现有订阅迁过来;回复写不需要,AUDR 是用量记录格式,不是计费系统。有人问能不能接到已有的 Stripe;回复写计费仍留在 Stripe,需要一个把 AUDR 事件送进 Stripe meters 的 sink(接收端),已发布的第一个 sink 是 Chargebee 的,规格允许别人再写一个 Stripe sink。有人问能不能在用到月度上限之前自动告警;Dinesh Kumar 回复这是计费系统的事,AUDR 只规定怎么记。抓取时周榜页上这条发布的当前分数约 296、评论约 46。产品页上另有 14 和 214 两个数字,紧挨着奖项区,本文不把它算进这次发布。

产品要解决的问题
一次运行会经过应用、路由和工具。每一层都能看见自己的那一段,拼不成「这次是谁发起的、一共花了多少」。

产品市场分析
官网写给要回答功能成本、单客户用量和毛利、以及哪条工作流或哪个模型在烧钱的团队。变现信号不在规格里:规格没有价格和计费逻辑,SDK 里没有套餐或发票。Chargebee 是起草方和当前 steward(照管方),页面写采用变多之后希望把成本治理交给一个独立基金会。可以不接任何计费系统,把记录写到本地文件、仓库或可观测平台。Chargebee 公司介绍里的「6,500+ 企业」是计费产品的说法,不是 AUDR 的采用数字。

产品上下游
上游是 harness、路由和工具在运行时已经知道的标识、用量和时间;适配器页面写它们读这些,不读提示词和输出。已发布的适配器:NVIDIA NeMo Relay、LiteLLM、Merge Gateway、Vercel AI SDK、Mastra,以及可直接发记录的核心 SDK(Python 包 audr、TypeScript 包 @openaudr/audr)。OpenRouter 的支持页面写为还在做。下游是 sink:官网 FAQ 写今天有 Chargebee 和 Lago。PyPI 上的 audr-sink-chargebee 写它把记录打到站点的用量批量接口,没有 attribution.subscription_id 的记录不会送出。官网写发送在请求路径之外异步进行,正常情况不加同步延迟;若启用可选的出发前预算检查,那一次检查会发生在运行开始之前。和 OpenTelemetry(OTel,一套观测数据的开放约定)的关系写成叠在上面:可以沿用 GenAI 语义约定,也可以把记录发成 OTel span;OTel 不管「缺了归属怎么办、重试如何保持幂等、更正如何表达」,用量记录不能像丢掉一条 span 那样算了。和 FOCUS(云厂商账单的统一格式)的关系写成互补:FOCUS 统一你从云厂商收到的账单,AUDR 统一运行发生时你自己发出的用量,定价仍在后面。

3. OpenBot · 官网

标语:Grok Bot alternative: free, local, open-source, multiplayer

背景
OpenBot 日榜第 3,发布页标为免费,产品页写 Launched in 2026。讨论里以 OpenBot 身份回复的是 Kamil(@kamil_cyrek)。另有一条评论说 Norbert 已经介绍过产品是什么,本文没有再核对 Norbert 的职务。它是桌面应用:每个 Agent 有自己的名字、说明和工作区,可以互相发消息、移交任务、共享文件。提供方包括 Codex、Claude Code、Gemini、Grok、OpenCode、Cursor、Cline,也可以接 OpenAI 兼容端点、Ollama 或 LM Studio。换提供方之后,工作区和对话还在。内置浏览器、任务队列(可暂停、继续、取消)。工作区、对话、文件和浏览器数据放在运行 OpenBot 的那台电脑上。手机应用连到这台电脑;Kamil 回复远程查看是做移动版的主要原因,远程访问需要账号,单机使用不需要账号。有人问一个 Agent 把任务交给另一个时,原来的上下文还在不在;回复写各自保留自己的线程和工作区,移交走消息或共享频道,频道里看得到共享讨论,私人线程仍分开。有人问不同成员能不能给同一个 Agent 各写一套说明;回复写目前说明是团队共享的,要分开就得用不同的 Agent。Kamil 写过去一个半月发了 67 个版本。仓库 nightly-labs/openbot 抓取时约 399 star。抓取时周榜页上这条发布的当前分数约 272、评论约 34。

产品要解决的问题
云端的多 Agent 环境把文件和登录放在别人的电脑上。想自己留着数据、又让几个 Agent 分工,就要自己拼工作区、队列和互相发消息。

产品市场分析
官网把它写成 Grok Bot 的本地方案,对照页标注核对日期为 2026-10-02。目标是已经在为 ChatGPT、Claude、Gemini、Grok 或 Cursor 付费,或自己跑模型、又希望文件留在自己电脑上的人。软件本身标价 0 美元,没有锁功能;模型费走用户自己的方案。许可是 PolyForm Noncommercial 1.0.0:可以读、改、为非商业目的运行;FAQ 写这不是 OSI 定义下的开源许可证,商业使用要另拿许可。仓库说明写到 0.1.11 版(含)仍以 Apache-2.0 提供。不想一直开着自己的电脑时,对照页写可以租一台托管在欧盟(德国、芬兰或法国)的 Linux 服务器,起价每月 €20 或 $25,该页数字截至 2026-10-02。发布页标语里的 open-source,和 FAQ 里的许可限制,本文并列入上面两句。

产品上下游
上游是用户写下的任务、已登录的提供方,或本机的 Ollama / LM Studio。下游是本机 SQLite 里的工作区和对话、内置浏览器里的操作,以及可选的手机连接。用云端模型时,提示仍会发给那个提供方;Kamil 回复若改用 Ollama 或 LM Studio,提示留在这台机器。FAQ 写这是开发预览:Agent 可以不经逐次询问就读改文件、跑命令、用网络并控制内置浏览器,只适合交给你信任的任务。GitHub 连接写在更新日志里:装上 OpenBot 的 GitHub App 后,gh 和 git 以你的身份使用那些仓库,不需要个人访问令牌。

4. Incredible · 官网

标语:Vibe computing. Control your computer with your voice.

背景
Incredible 日榜第 4。这是产品页上的又一次发布;公司信息写 Launched in 2025,主页介绍仍是「替你在电脑上做点击和打字的桌面 AI」。按住激活键说话,也可以打字。它在你已经打开的浏览器、文件和应用里操作,激活之后才能看见当前屏幕,其余时间页面写屏幕保持私有。发送之前会先问你,可以改了再批,也可以随时停。系统要求定价页写为 macOS 13 或 Windows 10 及以上。首页举的例子包括把一封介绍邮件里的联系人放进 HubSpot、整理收据、筛简历、约会议。安全页写 SOC 2 Type 2(由 Sensiba 审计)、GDPR、静态和传输加密、不用客户数据训练。日榜页上 Sara Ford 问实现走的是操作系统无障碍树、网页 DOM,还是录鼠标轨迹,以及目标用户是不是低灵巧度人群;这次抓到的日榜摘录里没有团队答复。抓取时周榜页上这条发布的当前分数约 243、评论约 34。

产品要解决的问题
聊天机器人可以写出一段话,把这段话填进每一个应用仍要人做。重复的点击和粘贴占掉原来想做的事。

产品市场分析
定价按席位、按月,试用结束前不锁功能:Pro 每月 50 美元,Max 每月 179 美元(用量为 Pro 的 3 倍,支持靠前),Ultra 每月 500 美元(用量为 Pro 的 10 倍,可选和创始人共享的 Slack 或 Teams 频道,并写可用于 CRM、ERP 这类旧系统)。7 天试用包含 Pro 的全部功能,不需要信用卡;试用结束不会自动扣款,除非试用期内已经加了卡,那时会按 Pro 每月 50 美元继续。用量按人计算,不在团队内共享;加人或减人按剩余天数折算。团队方案本身没有单独的 7 天试用,同事可以各自先试用。大团队可以谈发票。首页写可以直接连接的应用超过 3,000 个,其余能在浏览器里打开的应用也可以用。首页另有一句「14 倍」:写明是在若干重复工作流上测的,结果因任务而异。CellMark 的 Håkan Enhager(VP Global IT & Digital)有一段使用引言,页面写 CellMark 在瑞典、法国和美国的办公室使用。替代方案是继续用聊天窗口再自己粘贴,或使用只在浏览器里操作的 Agent。

产品上下游
上游是你说的任务、激活后的当前屏幕,以及你已经登录的网站和本机文件。下游是它在这些应用里点完、填完的结果,以及到点的提醒。到达用量上限时它会暂停并告诉你何时恢复。无障碍树是否被使用,本次没有从讨论或文档里核对到。

5. Extrovert · 官网

标语:Run LinkedIn outreach from your agent

背景
Extrovert 日榜第 5,发布页标为 Free Options。这是第 5 次发布,产品页写 Launched in 2024。创始人 Oleg Sobolev 写,这次从「你自己操作的外联副驾」变成「你的 Agent 也能跑的外联」:找人、建活动、看评论、写私信、跟进,都可以交给 Claude、ChatGPT 或其他 MCP 客户端;原来的界面还在。它不按同一套步骤推所有人,而是看对方的帖子、你们的对话和你设定的节奏,决定下一条评论或私信。跟进可以发生在对方回复之后。联合创始人 Dmitry Bergelson 在讨论里被 Oleg 点名。有人问代理商能否让每个客户有自己的 Voice 和 playbook;Oleg 回复可以,一个人也可以为两套身份或两类客户各存一套。Sara Ford 问风格从哪来、能不能纠正反复的错误,以及「agent-in-the-loop」是什么意思。Oleg 回复:三到四条真实评论,加上几条你怎么开口、怎么跟进的消息,就可以开始;最好是你自己写过的。语气和内容分开,评论和私信分开设置。助手或你自己的 Agent 可以从帖子、旧评论、消息、网站或销售文档里帮你建 Voice,不是必须去解析整段 LinkedIn 历史。打开 Auto-learn 后,你改过并批准的评论会变成新例子;他写大约 20 条评论是一个起点。反复的错误要改底层指令,例如不要每条私信都以夸奖开头。agent-in-the-loop 指的是:Extrovert 仍准备优先级和草稿,审阅的人可以换成你的 Agent,它在你允许的范围内改和发,你留下想自己做的决定。抓取时周榜页上这条发布的当前分数约 231、评论约 45。

产品要解决的问题
一条一条看 LinkedIn、记住该跟进谁,质量高,也占掉大半天。群发序列又常常对所有人走同一步。

产品市场分析
Oleg 写最匹配的是 B2B 创始人、销售团队和代理商,尤其是销售周期较长的;求职者用同一套去认识招聘经理「说得通」,但他说经验和数据主要在 B2B 销售。定价页:每席每月 49 美元(一席对应一个 LinkedIn 账号),含全部功能、250 个被跟踪的潜客、1 个话题、每月 300 Credits;不连接 LinkedIn 的队友免费。页面写席位变多时单价会下降,具体阶梯这次没有从页面文本里取出。可选加购:多 250 个潜客每月 20 美元或每年 200 美元,多 2 个话题每月 15 美元或每年 150 美元,2,000 Credits 一次 29 美元,10,000 Credits 一次 99 美元。Credits 按来源计价,例如 Lead Finder 每个潜客 1 Credit,按关键词找帖子每个 50 Credits。未用完的月度 Credits 不结转,一次买的 Credits 结转。代理商页写订阅终身八折,或客户直接向 Extrovert 付费时终身 20% 佣金。定价页写 1,000+ 用户。Oleg 在讨论里给的使用数据是:事先没有评论时连接接受率 27.4%,两条评论之后是 41.1%。首页另有「60%+ 连接接受率」「回复率 2–5 倍」「52% 的回复发生在第 2 次及以后接触」等句子,和讨论里的 27.4% / 41.1% 不是同一句,本文不把它们合成一个数字。产品页 12 条评价、5.0 分,其中多数评价早于这次「交给 Agent」的发布。

产品上下游
上游是你描述的理想客户、LinkedIn 上的帖子和互动、你提供的写作样本和销售 playbook,以及可选的 CSV、CRM 或 Sales Navigator 导入。下游是待批准的评论和私信;Oleg 回复它不做邮件,也不管你的帖子或 newsletter。MCP、API 和 webhook 在定价表里列为包含。讨论里 Extrovert 写自己在底层使用 AI Ark 的数据做人和公司的补充,这是产品页「built with」里的自述。

6. Fuse AI · 官网

标语:Build a Custom GTM Stack. One SDK. One MCP.

背景
Fuse AI 日榜第 6,发布页标为 Free Options,并写有 20% off。产品页写 Launched in 2026,公司页有 Y Combinator 标记。发帖人 Saurav Bubber 把这次发布写成:用一个 SDK 和 MCP 覆盖原来要拼起来的 GTM(go-to-market,把产品卖到客户那里的整套动作)。他在帖里的类比是 OpenRouter、Apollo、Clay 和 Zapier 放在一起。涵盖的步骤他列为网页自动化、数据补充、多渠道触达、工作流和 AI Agent。MCP 地址写为 https://mcp.fuseai.com,登录后由 Agent 接上。Jay Smith 问它是否只管销售、不管营销漏斗;Saurav 回复营销漏斗也做。有人问自定义工作流难不难;回复写可以用平台上的自动化层,或把数据和发送基础设施接到自己的 CLI。Product Hunt 用户当周全部方案九折,是 Saurav 在帖里写的。抓取时周榜页上这条发布的当前分数约 230、评论约 29。

产品要解决的问题
外联常常同时开着找人、补数据、发邮件、发 LinkedIn、打电话和看意向的好几件工具。每换一步就要再接一次 API。

产品市场分析
官网写给销售和营销人员,并写被 1,000+ 家初创和企业的此类人员使用,这是站上自述。定价页(美元,月付;页上有年付八折开关):Free 为 0,每年 24,000 credits,1 个席位,数据补充、序列、研究 Agent 和实时信号都有限额;Solo 每月 60 美元,每年 48 万 credits,含 40+ 提供方的联系人补充、邮件 / LinkedIn / 拨号序列不限,以及 CRM、MCP、API、Slack;Team 每月 200 美元,每年 120 万 credits,5 个席位,研究 Agent、实时信号和并行拨号不限;Enterprise 另询,含 RBAC、SSO 和审计日志。首页对照表把 Fuse 的数据准确率写成 95%,Apollo 74%、ZoomInfo 82%、RocketReach 78%,表是 Fuse 自己放的,本文没有独立复核。首页还写 8.5 亿以上联系人、补充准确率 90% 以上、50 个以上实时信号,同样是站上自述。安全区写 SOC 2 Type I 为审计进行中,并列出 GDPR、CCPA 和 CASA Tier 2。替代方案是继续分别购买数据、序列和自动化工具。帖里的九折和定价页的年付八折是否叠加,本次没有核对。

产品上下游
上游是你的 ICP 描述、自有客户知识,以及 Fuse 接上的数据提供方和意向信号。下游是补充后的联系人、邮件 / LinkedIn / 电话序列,以及你在 MCP 或 SDK 上搭的 Agent。护栏页写可以规定 Agent 能碰什么、哪一步必须先经过人。

7. Willow Knowledge · 官网

标语:Your AI already knows you. Now Willow can too.

背景
Willow Knowledge 日榜第 7,发布页标为免费。这是 Willow Voice 的第 8 次发布,公司页写 Y Combinator、Launched in 2025。Willow 本身是语音听写:在任意应用里说话,它排版、改错、去掉口头语。这次的 Knowledge 由 Sharath Kuruganty 发布。做法是把 Willow 给的一段提示词贴进 ChatGPT、Claude、Gemini 或其他你在用的 AI,再把回答贴回 Willow,从而带入写作偏好和个人背景;可以先审、再改、也可以自己加。可以要求邮件短一点、用固定的结尾、避开某些说法;工作和随意消息可以各有一套偏好;还可以把 Notion 和 Google Docs 这类应用编成组。Sharath 写 Knowledge 可用于 macOS 和 Windows。Sara Ford 问这是不是 Willow 的「agent skills」;他回复可以这么理解:导入之后,听写和写作助手 Scribe 会更像你。Tori Seidenstein 问工作和私人账号的上下文能不能分开;Sharath 的回复集中在 Scribe 会读屏幕上下文加上你给的说明,没有直接说明多账号切换今天是否做好。产品页历史评价 11 条、4.9 分,针对的是 Willow 听写本身,不是这次的 Knowledge。这次发布的分数没有在抓到的产品页文本里单独标出。

产品要解决的问题
听写工具能把话说成字,但不一定知道你在邮件、Slack 和文档里各是什么写法。这些偏好已经存在于你平时用的模型里,却进不了听写。

产品市场分析
目标是已经用 Willow、又在别的模型里积累了写法和背景的人。Knowledge 这次发布标为免费;Willow 本体另有定价。抓取时定价页在月付和「省 20%」的年付切换旁,把 Pro 写成 15 美元和 12 美元(user/mo),Business 写成 35 美元和 28 美元每月,Enterprise 另询。免费档写为较弱模型不限量、Scribe 每周 20 次。帮助中心另写 Individual Pro 每月 15 美元(年付八折)、Team Pro 每人每月 12 美元且至少 3 席。两处计划名称没有在本次抓取里对齐,本文不把 12 美元同时解释成「年付折算」和「团队席位价」。帮助中心写 Enterprise 含 SOC 2 Type II、HIPAA、可强制的零保留和 SSO。替代方案是继续在每个应用里手写风格说明,或使用 Wispr Flow、MacWhisper 等听写工具;后几个名字来自产品页上的用户对比,不是 Willow 的官方对照表。

产品上下游
上游是你贴回来的模型回答,以及随后在 Willow 里改过的偏好。下游是 Scribe 和听写在当前应用里生成的文字。导入是否会把模型对话里的敏感内容一并带入,取决于你贴回去的那一段;Sharath 写可以审完再留。

8. Coddy · 官网

标语:Learn to code 20+ languages in a fun way with short lessons

背景
Coddy 日榜第 8,发布页标为 Free Options,产品页写 Launched in 2026。讨论里回复的有 Barak Glanz 和 Nethanel Bar。它用短课教编程:浏览器里的编辑器配测试用例,过关条件是代码真的跑过。语言列表在发布页写有 Python、JS、C++、SQL、Rust、Go 等 20 多种。AI 导师叫 Bugsy,给提示而不是直接给答案;Nethanel 回复,提示会给到它判断学习者已经太受挫的时候,然后才提供解答。Barak 回复 Sara Ford:练习的精神接近 coding kata(小而可重复的编程练习),另有每日挑战把学过的东西再用一次;路线可以是一门语言从基础到进阶,也可以是「做一个网站」这类把多门课串起来的目标路径。首页写共同学习的人数为 5,680,627、覆盖 202 个国家;发布页写 5M+,两处本次没有互相换算。平台为 Web、iOS 和 Android。发布页写 Product Hunt 访客 72 小时内任意方案五折,自动生效。这次发布的分数没有在抓到的产品页文本里单独标出。

产品要解决的问题
很多编程课是长视频或长章节,人在第二周左右离开。想每天只学几分钟、并且从第一分钟就写能跑的代码,课程结构对不上。

产品市场分析
Barak 写他们优化的是「三个月后还在学」,不是「一个周末把课刷完」。首页 FAQ 写可以免费开始,另有可选的付费档;具体价格这次没有从定价页核对到。FAQ 另写大多数初学者持续每天练习 1 到 2 个月能写出有用的代码,到可求职通常要 6 到 12 个月,这是站上的学习时长说法。每门完成的课有可核验的证书,可放进 LinkedIn 或简历。首页写 iOS、Android 和 Web 的评分为 4.9 星,没有附上评分人数。替代方案是长课程平台、只看不写的视频,或直接把题目交给会给完整答案的模型。

产品上下游
上游是课内的说明、测试用例,以及学习者写下的代码。下游是通过测试的练习、连续打卡和联赛积分,以及证书。Bugsy 的提示发生在课内编辑器旁边;Nethanel 写它和真正可交互的平台连在一起,不是单独一个聊天窗口。

9. iphone-use · 项目

标语:Let AI agents drive a real iPhone, even apps with no API

背景
iphone-use 在两次抓取的日榜页上都排第 9。产品页后来被站点拦截,讨论回复这次没有从产品页核对。项目仓库是 leeguooooo/iphone-use,作者写为郭立(Guo Li / leeguoo),抓取 GitHub API 时约 81 star,许可证 MIT,语言为 Rust。README 写:Mac 上的守护进程通过 USB 连接的 iPhone,跑一个基于 XCTest 的设备运行器(它替换了 WebDriverAgent,并说同一套 API),把屏幕读成文字,执行点击、滑动和输入,并明确告诉你动作有没有落到屏幕上。它不碰 Mac 自己的屏幕、光标或焦点。仓库简介仍写 WebDriverAgent 和 21 个 MCP 工具;README 写 MCP 服务器有 23 个工具,供 Claude Code、Claude Desktop 和其他 MCP 客户端使用,两处本次没有再对哪一版为准做第三次核对,功能描述以 README 为准。没有单独的营销站点,仓库主页字段是一条演示视频链接。

产品要解决的问题
没有 API 的 iPhone 应用,包括会挡住屏幕录制的银行和支付应用,Agent 看不见也点不了。只截 Mac 的屏幕,会漏掉这些应用,也会占用你正在用的电脑。

产品市场分析
README 写给要让 Agent 或脚本操作一台真实 iPhone 的人,并提供给人用的网页和原生 iOS 应用(实时画面、点击、输入)。变现信号是 MIT 和自托管,没有标价。重复任务可以存成 flow:按应用复查过的脚本,回放时不再调用模型,因此不耗 token。官方 flow 仓库为 leeguooooo/iphone-use-flows。替代方案是有 API 的应用直接调 API,或在 Mac 上做屏幕级 computer-use。系统要求:macOS 15 及以上、登录了开发团队的完整 Xcode(免费的 Personal Team 可以)、打开了开发者模式并用 USB 信任的 iPhone,以及 libimobiledevice。

产品上下游
上游是 Agent 通过 HTTP(/agent/*,默认端口 44321)或 MCP 发来的点击、滑动和文本,以及手机上的当前界面。下游是落在手机上的操作结果,以及可选的、不经过模型的 flow 回放。每次响应会说明动作是已应用、未发送还是未知,以及能不能安全重试;点在被挡住或隐藏的元素上、没有写进去的输入,会被拒绝或报告,而不是假装成功。README 的安全说明:密码只保护 44321 端口;手机上运行器自己的端口没有认证,应在可信网络里使用。安装文档包含一条从仓库拉取的安装脚本,是否执行由使用者自己决定。

10. Ghostifier · 官网

标语:Companies have your data. Ghostifier gets them to delete it.

背景
Ghostifier 日榜第 10,产品页写 Launched in 2026。作者 Jonathan Wise 在讨论里回复。它从 Gmail 出发,找出给你写过信的公司,退订、要求对方停止出售或共享,等过退货窗口后再发删除请求,并跟踪回复。银行、保险、医生、学校、雇主,以及密码管理器、邮箱、网盘、域名和加密资产,页面写永远不会被要求删除;近一年用过的和 Google、Spotify 这类家庭常用名字也不会被删除,但仍可按设置要求停止出售。数据经纪商即使没给你写过信也会被问到,页面写 220 家已登记的经纪商,包含在 Cleanup 和 Autopilot 里。没有模型,决定按固定规则走。Sara Ford 问如何只读邮件头;Jonathan 回复用的是 Gmail API 的 metadata 范围:发件人、主题、退订链接等头部,不包括正文。这个范围属于受限制范围,Google 要求第三方安全评估,他写评估还在早期,所以连接时可能看到 Google 的警告。有人拿 Aura 和 Incogni 比较;他回复那两家从经纪商名单做起,Ghostifier 从收件箱做起,希望在数据进经纪商之前碰到实际交易过的商店、应用和通讯;Incogni 覆盖的经纪商更多,Aura 还有信用监控和身份盗窃保险,Ghostifier 不做这两项,可以同时用。退货窗口他写为:距上一笔订单 45 天,或距上次送达 30 天,取较晚的那个。部分删除的持续监控,他写是以后想做的,不是今天的功能。这次发布的分数没有在抓到的产品页文本里单独标出。

产品要解决的问题
每家公司一份删除表格,很难做完。只向数据经纪商发信,又碰不到因为你下过单、注过册而持有姓名和地址的那些公司。

产品市场分析
官网写给想从自己的收件箱清理数据、并且使用 Gmail 的人。定价:免费档永久 0 美元,可看到扫描结果,并对支持一键退订的列表退订;Cleanup 一次 29 美元,含至今扫到的公司的选择退出和删除、220 家经纪商、按有法律规定的截止日期跟踪并在错过时跟进一次、每封请求留底;Autopilot 每年 59 美元(约合每月 5 美元,或按月 8 美元),另含之后新出现的公司、每天检查收件箱、退订后仍来信的跟进和每周摘要。60 天内从 Cleanup 升到 Autopilot,29 美元计入第一年。付款经 Stripe,页面写 Ghostifier 看不到卡号。页面上的「412 家公司」「已幽灵 17」等是示例仪表盘,不是本次抓到的用户统计。替代方案是 Jonathan 点名的 Incogni、Aura,或自己向每家公司提交请求。

产品上下游
上游是 Gmail 的邮件头(metadata 范围)和你批准的计划。第一次扫描大约回看两年,什么都不发,直到你确认。下游是 Ghostifier 用自己的地址、凭你签过的授权发出的退订、选择退出和删除信,以及公司回复的记录。回复在请求完成后加密保留 30 天,也可以提前删;页面写不保存你的邮件。很多公司会直接写信到你的邮箱核实身份,Ghostifier 看得到「有这样一封信」并放进 Needs you,但不能替你读正文或从你的地址回复。

今日 Hacker News 热榜前五落在生成图片的署名、一份尚未放出权重的开放模型、旧金山的缓坡路线、example.com 的改版,以及不用反向传播来预训练 Transformer。排第一的是 Nieman Lab 的报道:ChatGPT 会在仿《纽约客》漫画的角落签上真人漫画家的笔名。第二是 Reflection 的 Beam,501B 总参数、23B 激活的稀疏 MoE,博文写权重计划本月以 Apache 2.0 放出。后面是在浏览器里计算旧金山步行或骑行的「最平」路线,DebugBear 梳理 example.com 二十多年的版面变化,以及 QLabs 的 Dust:用激活扰动估计梯度。以下按 Firebase topstories 当前顺序整理,分数与评论数为抓取时快照。

1. ChatGPT is adding real cartoonists’ signatures to fake New Yorker cartoons

背景介绍
Andrew Deck 在 Nieman Lab 报道,ChatGPT 生成仿《纽约客》单格漫画时,会在角落签上杂志真人作者的笔名。文章以一张流传很广的图为例:Dolly Parton 与扮成 Dr. Frank-N-Furter 的 Tim Curry 站在天堂门口。文章写,这是 8 月下旬两人去世后几天里先在网上传开的图,右下角笔名是 “BLOPER”,也就是《纽约客》漫画家 Brendan Loper 的署名,但 Loper 没有画这张图,也没有签名。图是一位 Dolly Parton 的歌迷发到 Facebook 的,她在评论里写,自己只是让 ChatGPT 画 “a New Yorker-style cartoon”。Loper 告诉作者,先是双胞胎兄弟发来短信,随后陌生人也来问这是不是他的作品。

文章写,这不是第一次。5 月就有人在 Instagram 上提醒 Loper;夏天他又在 Reddit 的 ChatGPT 论坛里看到更多例子。作者自己的测试里,ChatGPT 签过 Harry Bliss、Emily Flake、Joe Dator、Pat Byrnes、Peter Vey、Jason Adam Katzenstein,以及 George Booth、Liza Donnelly、Ellis Rosen、Saul Steinberg 等人的名字;作者统计,至少记下了 15 位以上《纽约客》漫画家的署名被未经许可、也未付费地用上。不是每张图都有签名,有的笔名是乱码,但能认出来的经常是真人。Flake 说能看见自己画风的痕迹,整体却更像好几位作者的拼合;签名本身则是她的 “e. flake”。Byrnes 从少年时代就在 “P.Byrnes” 末尾加句点,作者找到的十多张签了他名字的生成图,每一张句点都在。

OpenAI 发言人的声明写,他们相信创造力的未来根本上属于人,并感谢社区指出模型的意外行为。作者通知 OpenAI 之后,再要求生成《纽约客》风格漫画时,ChatGPT 会回一句提示可能违反「与第三方内容相似」的护栏;但到文章发表时,一些普通漫画仍会被签上真人笔名。

版权关系在文中写得很具体。2024 年 Condé Nast(杂志母公司)与 OpenAI 签了多年授权,条款未公开;《纽约客》发言人告诉作者,Condé Nast 从未允许任何大模型开发者用其漫画训练,协议里也不允许把杂志标志放进模型输出。作者看过几份漫画家模板合同:稿件是投稿、录用才付费,不是 work for hire,版权留在作者手里,合同也没有把作品许可能用于 AI 训练。OpenAI 没有回答模型是怎样吃进这些签名的。文章引用纽约时报诉 OpenAI 案上月公开的文件,以及微软备忘录里把训练数据称作 “the largest theft of labor in human history” 的说法;另一份备忘录里,时任 OpenAI 政策负责人的 Jack Clark 写,他们在 AI 与创造力上的工作会越来越做出替代文化劳动者的系统。Clark 后来参与创立 Anthropic。

Katzenstein 把这件事说成比版权更接近假冒:模型把他的名字安在他不认可的作品上。他参加过 2024 年作家协会对 Anthropic 的集体诉讼,因为自己的漫画收进过一本 HarperCollins 选集,而这批盗版书被用来训练 Claude。文章写,法官于去年认定用作者作品训练属于合理使用,但下载并保存盗版书构成大规模侵权;文中接着说,7 月联邦法院批准和解,向作者和出版商支付 15 亿美元。Dator 的对比是:信用卡被盗时,对方至少没有打扮成他。

康奈尔大学法学院的 James Grimmelmann 在文中说,签名表示真实性,但署名只占合理使用分析的很小一部分;这类输出通常不是在复制某一张具体漫画,而是在模仿一种风格,这才是版权诉讼的难点。他提到另一种可能是州法上的公开权(right of publicity),那需要证明生成图被用于商业目的,而不只是玩笑。作者写,自己没有看到这些图被买卖的证据,但已经看到编辑漫画岗位被替换:去年《巴尔的摩太阳报》解雇了在该报画了三十多年的普利策决赛入围者 Kevin Kallaugher,今年意见版开始经常刊登 AI 漫画;用 OpenAI 的水印识别工具核对,这些插图来自 OpenAI 的产品。美国社论漫画家协会主席 Marc Murphy 在公开信里谴责用 AI 替代原创。文章也写,《纽约客》本身没有改去刊登 AI 漫画,但受访者说单靠杂志稿费养不活自己,杂志署名是接到商业稿和书籍插画的名片。

主要讨论方向与观点
讨论分成「该不该告」和「这到底是什么错误」。Insimwytim 认为问题不是模型会这么做,而是事后没有被诉讼压垮。MarkusQ 把它叫成 “Plagiarism as a Service”。回复里,jrflo 说这是一句适合社交网站的嘲讽,并不是 OpenAI 的商业模式;walrus01 则把矛头转回实验室之间互相指责「蒸馏」:被蒸馏的模型本身就建立在大规模版权争议上。GolfPopper 引用了与文章相同的那句微软备忘录。

gwern 写,自己用 Nano Banana Pro 和各代 ChatGPT 画漫画时,假签名是老问题,常常要再编辑一次擦掉,多数用户懒得做。WD-42 说,公司工程经理把一张签着 “bloper” 的漫画放进冲刺演示,并不好笑,问过之后确认是 ChatGPT,对方没注意到签名。dyauspitr 认为这说得通,因为训练样本里几乎都有签名。userbinator 补充,写实生成也会带上变形但仍能认出的水印,因为训练数据里就有;并认为年轻学画的人一开始也是在抄自己见过的东西。cm2012 主张,除非用户要求,模型默认不该在作品上签名。

ThrowawayR2 认为这拆掉了「大模型会推理」和「人也犯这种错」两种说法。antonvs 回复说,这是把图像生成模型和语言模型混为一谈,没有人声称图像模型会推理。baubino 把文章里 Katzenstein 和 Dator 的话收成「冒充」,AnimalMuppet 认为这已经够得上起诉的门槛。SchemaLoad 写,艺术家应能在每次伪造签名时亲自告 OpenAI 诽谤。

专有名词解释

  • BLOPER / e. flake / P.Byrnes:文章里的笔名,分别对应 Brendan Loper、Emily Flake 和 Pat Byrnes。Byrnes 的署名以句点结束,作者看到的生成图保留了这个习惯。
  • work for hire:受雇作品。文章写《纽约客》漫画家合同不是这种安排,版权仍归作者。
  • 合理使用(fair use):美国版权法里的抗辩。Grimmelmann 在文中说,署名只是其中很小的一部分;风格模仿通常拷不到「某一幅具体作品」。
  • 公开权(right of publicity):各州保护姓名和身份不被擅自商用的法律。文章写,要走这条路,需要商业使用的证据。
  • Cartoon Bank:文章用来对照授权原作的《纽约客》漫画授权库。

HN 讨论:thread · 183 分 · 79 评

2. Beam: Reflection’s 501B open-weight model

背景介绍
Reflection 于 2026 年 10 月 5 日发布 Introducing Beam。博文称 Beam 是该公司第一个开放权重模型:稀疏 Mixture-of-Experts,总参数 501B,激活 23B,面向编程、推理和 agent 工作负载。预训练用了 23.8 万亿 token,来源包括网页和专有授权数据。博文写,高算力强化学习在 10,500 张 NVIDIA GB300 上跑了 4 周,产生超过 1 亿次 rollout,RL 阶段最大上下文 256K token;训练和评分大约用了 13 亿个 sandbox,环境大约 100 万个。预训练则写在 6,144 张 GB300 NVL72 上、不到 4 周跑完,接近结束时 goodput 为 92.3%,中途有 9 次半自动回退。

能力表述是他们自己的定位:Beam「推进西方开放权重前沿」,在编程和 agent 任务上与更大的 GLM 5.2 有竞争力,并接近 Qwen 3.8-Max;Kimi K3 在原始能力上仍然领先,Beam 自称的优势是推理时的效率。高级推理基准上,博文写分数与 GLM-5.2 相当,推理计算约少 3–4 倍。模型是纯文本的。图注还写到推理专家约占全部 1 亿多次 rollout 里的 8,000 万次,并用来对比 Inkling 的 3,000 万次和 MiMo 的 75.3 万次。这些对比数字出自该博文,本文没有另找第三方榜单核对。

权重现在还不在公开仓库里。博文写 Beam 正在做最后的红队测试和评估,可以登记早期访问;本月将以 Apache 2.0 放出权重、技术报告、模型卡,以及运行、评估和微调所需的材料,并接入一批分发伙伴和开源工具。架构段落还写了交错的局部/全局注意力、细粒度路由专家、52 层上残差流保持有界,以及预训练结束时最忙专家的负载约为均匀值的 1.04 倍。中期训练把有效上下文拉到 100 万 token。

第二张演示图的图注是一次陆地/海洋实验:让 Beam 画固定的 180×90 网格,经度 −179° 到 179°、纬度 −89° 到 89°,共 16,200 个点;图注写覆盖正确率为 95.5%,介于 Opus 5 的 92.5% 和 Fable 5 的 97.8% 之间,并称之为对新任务的泛化。抓取当天的这段 figcaption 没有写「谜题只有几天、因此不可能在训练数据里」。

主要讨论方向与观点
主线是「数字不错,但权重呢」。htrp 摘了参数量和 RL 规模之后说,现在只有早期访问登记。wronglebowski 认为没有 Hugging Face 仓库的发布没有意义。wren6991 列了一张和 DeepSeek V4.1 Flash 的对照表,并引用 Linus 的 “Talk is cheap, show me the weights.” 这张表把 Beam 的预训练 token 写成 28T,和博文里的 23.8 万亿不一致;表中「无视觉、Apache 2.0、权重本月放出、激活参数 23B」几格与博文一致。表里 DeepSeek 一列的数字是评论者写的,不是这篇博文的内容。onlyrealcuzzo 觉得它比 DeepSeek v4.1 Flash 更大、更贵,而且每项指标都更差。aeetes 认为性能图把更强的开源模型折到视线之外,读起来像 Beam 赢了,其实没有。brumbelow 说这条链接只让自己更想去看 DeepSeek 4.1 Flash。

也有人接受「先入场、再迭代」。michaelkdev 承认它不如顶尖的中国开放权重模型,但把「西方也加入」本身当成事情。dotancohen 认为每个新进入者不需要首发就破纪录。swiftcoder 指出博文原句 “Western open-weight frontier”,猜测卖点是给不能用外国模型的政府合同,而不是给个人用户。vanuatu 把它说成面向美国公司和西方政府的「美国版 DeepSeek」。eaf7e281 则肯定博文承认 Kimi K3 仍然更强,而不是把图表说满。

Ariarule 引用的图注比当前页面多出一句:谜题只有几天,所以不可能出现在训练数据里。评论认为这句不成立,并链到 LessWrong 的 How Does A Blind Model See The Earth?。该页数据里的 postedAt 为 2025-08-11。extr 记得原始讨论更早,但觉得「没有专门对这个任务做 RL」这一点仍然成立。charlieyu1 认为谜题的年龄也许不重要,因为现在的模型都会搜索。

astrostl 希望更多 90B–133B、能把一部分专家放到磁盘上的 MoE,好放进 64–128 GB 内存的 Mac。minimaxa 写自己会等权重和 GGUF。drubs 说自己预训练第一天就在现场看着任务启动;这是评论者的自述。

专有名词解释

  • MoE:Mixture-of-Experts。博文写总参数 501B、每步激活 23B,所以推理成本按激活参数而不是总参数计。
  • rollout:强化学习里模型在一个环境中走出的一整段轨迹。博文的 1 亿次是这次 RL 的规模,不是下载量。
  • GB300 / NVL72:NVIDIA 的 GPU 以及按机柜交付的形态。预训练和 RL 用的卡数在博文里是分开写的:6,144 与 10,500。
  • goodput:博文定义为最终模型里保留下来的训练步,占墙上时钟的比例;接近结束时写成 92.3%。
  • Apache 2.0:博文承诺的权重许可证。到抓取时,权重、技术报告和模型卡都还没发布。
  • GGUF:评论里等待的本地量化格式。博文没有写 GGUF。

HN 讨论:thread · 296 分 · 77 评

3. Find the flattest route between any two points in SF

背景介绍
Flatten SF 页面署名为 Drew Edwards,仓库在 almostimplemented/flattensf。页面说明:路线在浏览器里、对大约 16 万条街段求解,高程用 USGS 1 米激光雷达,路网来自 Overture / OpenStreetMap。滑块从最短走到「还值得走的最平」:最平那一端,1 英尺爬升按 200 英尺步行计;再往右,路线就不再像路线。往右滑不会让路程变短,也不会增加爬升。爬升是沿途累计升高,不是起点和终点的海拔差。步行允许台阶,骑行排除台阶。地点搜索是离线的,路口、地址和地名打进页面,不调用地理编码接口。

README 把全市分析收成一句:在全部 1,260 对有序社区组合上,最少爬升的步行路线平均只比最短路线长 14%,却少爬 39% 的升幅,典型最陡坡度从 27% 降到 17%。资源管理器示例写,从 Bayview 到金门公园,最平步行是 7.67 英里、爬升 353 英尺,最短是 7.01 英里、爬升 1,076 英尺。分析代码是 MIT;街道几何来自 OpenStreetMap(经 Overture,ODbL),USGS 3DEP 高程为公有领域。README 还写,页面为了把图压小,会把长度量化到 5 厘米、爬升到 1 厘米,所以浏览器里的总数可能和 Python 差几十厘米。

主要讨论方向与观点
有人拿它和旧工具比。andalinmicphew 推荐自己和朋友维护了约五年的 Bike Hopper:湾区骑行会同时看坡度、自行车设施和公交,旧金山用 1 米 DTM,郊外用 50 米;并认为在旧金山做坡度路由必须用 DTM,因为建筑和树会让别的高程模型失效。verst 希望把同样的 1 米 DTM 扩到西雅图或 Puget Sound。cheeaun 贴了自己 2014 年的 steepless。pokpokpok 和 wmichelin 都把它连到 “the Wiggle”,也就是市场街一带骑去金门公园时故意绕开陡坡的那条走廊。

目标函数也有人觉得还不够。jez 希望有一个同时加长距离和总爬升、但压低坡度的选项:从 SOMA 到 Nob Hill,按累计爬升,「最平」可以是从 Market 顺着 Taylor 直上,骑起来却不如绕到 Polk 再上 California,或从 Embarcadero 转 Broadway。cowthulhu 担心如果真去最小化坡度,上山会变成无休止的之字形。scaredginger 描述自己以前的启发式:不远离目的地,能不下山就不下山,必须上坡时选更缓的那条,只用局部信息。ziofill 问爬升是不是跟路线无关;页面写明爬升是累计升高,所以跟路线有关。nerdtalker 希望加上驾车,给还在开手动挡的人用,并说自行车模式的结果已经比较合理。

具体路线有人报错。askjdfksdbfhk 写,在 Mission 的 22nd 与 San Jose 一带,工具不让人沿 22nd 直走,而是拐上 San Jose 再折返;同一条评论还把配色、连续滑块和海拔图上的高度标签叫成 “Claude UI”。danserfaty 写,从外里士满 Cabrillo 街的住处到 4th Avenue,工具让人去爬 25th Avenue 再走 Geary,而不是走完全平坦的 23rd Avenue。仓库在 2026 年 10 月 5 日有一条提交,说明 Overture 里 Slow Streets(包括 Page、Shotwell、Cabrillo、12th Avenue)的通行规则按文档顺序读时,最后一条「所有方式仅限目的地交通」盖过了前面的步行允许,于是 Cabrillo 在 23 号大街以西完全不能走;修好之后,点名某种交通方式的规则后生效,252 条边、共 9.9 公里恢复步行。HN 上 almstimplmntd 的回复与此相符,并写已经部署。这条提交的作者栏是 Claude,并带有 Co-Authored-By: Claude Fable 5.1。jeffbee 则从数据分辨率说起,认为换 USGS 3DEP 的 25 厘米 DTM 会更好,并补了一句该数据在 AWS S3 上免费。

专有名词解释

  • 累计爬升:沿路线把每一段上升加起来,下坡不抵消上坡。起点和终点海拔可以差不多,中间翻一道脊,累计爬升仍然很大。
  • 帕累托路线:页面说滑块上的每一步都是「没有另一条路在距离和爬升上同时更好」的路线。最短和最平是这条折中曲线的两端。
  • DTM:数字地形模型,表示地面。Bike Hopper 作者强调要把它和含建筑、树冠的模型分开;本站页面写的是 USGS 1 米激光雷达,仓库许可证段落写高程来自 USGS 3DEP。
  • Overture / OpenStreetMap:页面使用的路网。仓库写街道几何经 Overture 取自 OSM,再分发要遵守 ODbL。
  • Slow Streets:旧金山把一些住宅街道限制为低速、以本地出行为主的计划。上面的提交写,解析器曾把这类街道对步行也关掉。
  • The Wiggle:旧金山骑行者对一条低爬升走廊的叫法,从市场街附近绕到金门公园,专门躲开陡坡。评论是在用这个名字认路,不是网站的功能名。

HN 讨论:thread · 100 分 · 30 评

4. Example.com Just Launched the Biggest Redesign in Decades

背景介绍
DebugBear 的 Conor McCarthy 在 2026 年 9 月 30 日发文(10 月 2 日更新),回顾 example.com 的版面史。example.com 是 IANA 保留给文档示例的域名,从上世纪九十年代末就可以当例子用。文章写,到 2026 年 9 月 28 日为止,页面还是一份静态英文;改版用 JavaScript 加入阿拉伯语、中文、法语、俄语和西班牙语,并每 5 秒换一种语言,每个字符包在自己的 span 里、用递增的 transition-delay 做透明度过渡,JS 还会插入一个书本 SVG。英文句子是:这个域名用于文档示例,不需要许可;它不是一项服务,不要把它当成测试或监控的依赖。

文章引用了 IANA 的说明:改动通常要么是为了降低带宽,要么是为了让页面更有用;本周把内容拆成一个更小的基本页,再加上单独的 JavaScript。多数访问是自动化的,往往不取 JS,因此总流量下降。域名的用途是文档里的示例。有人会把示例配置粘贴出去后忘记替换,从而带来附带流量;但它不是用来做可用性探测的通用端点。履行保留域名的用途并不要求主机上一定有 HTTP 服务,网站只是 courtesy。

文章按 Wayback Machine 排了时间线。它引用维基百科,称网站在 1999 年 1 月 1 日上线;能看到的最早快照是 2002 年 1 月 20 日,当时是 ICANN/IANA 保留域名列表,Apache 1.3.22。大约 67 天后出现今天还能认出的那句「你输入了 example.com」。2003 年 2 月加上 RFC 2606 的链接,服务器换成 Apache 1.3.27。此后七年几乎没动;2010 年 7 月 30 日 example.edu 也指向这个落地页。2011 年 1 月起改为跳转到 IANA 网站;2013 年 7 月 29 日取消跳转,改由 EdgeCast 直接提供 “Example Domain” 卡片页。文章接着写 EdgeCast 被 Limelight 收购、改名 Edgio,Edgio 于 2024 年末申请破产,Akamai 接收了部分客户合同;2025 年页面再次改版并压缩 HTML;随后响应头出现 Cloudflare。2026 年 6 月 9 日加上空的 <link rel="icon" href="data:,">,避免浏览器再去要 /favicon.ico。「不要用于运维」这句话是 2025 年加上的。DebugBear 用自己的可用性监控看到,example.com 偶尔会不正常响应。

同一主题还有 Kim Davies 的 Being Exemplary。文中写,2026 年 9 月某一周这项服务大约收到 500 亿次请求,合每秒 8 万次以上;软件用它测网络、跑发布前测试、大学演示、触发酒店和机上 Wi-Fi 的强制门户,作者也怀疑自动系统和会浏览网页的 AI agent 在添流量。Cloudflare 通过 Project Galileo 支援带宽之后,他们才把说明做成联合国六种语言,并把页面拆成小的首包加一份 JavaScript:只检查「页在不在」的程序拿到更小的响应,浏览器用户才看到全文。

抓取当天(HTTP Last-Modified 为 2026 年 10 月 2 日)的首页本身只有英文段落和 <script src=/s.js>。s.js 把另外五种语言插进页面,按 navigator.languages 把匹配的段落挪到最前,没有匹配则保留英文,并用脚本插入书本 SVG。这里没有 DebugBear 所写的每 5 秒轮播。

主要讨论方向与观点
不少人在对「依赖一个声明自己不是服务的域名」开玩笑,也在认真讲后果。selcuka 问这次改版弄坏了多少自动化测试,并引用 Hyrum 定律:观察得到的行为都会有人依赖。chews 回复说,如果测试只对响应做哈希,而后续请求仍然稳定,测试可以继续过。lifeisloving 写自己已经改用 example1.com 做可用性测试。zahrevsky 读到「并不必须提供 HTTP」之后,猜这也是为了减少有人原样粘贴示例配置。zamadatix 把更底层的依赖放在 DNS 和 DNSSEC:有没有 HTTP 服务器,并不决定这些记录会不会被指到别处。

版面描述和当天页面不完全一致,评论已经先指出来。jamdav16 写,渐进透明度看起来被拿掉了,现在是把各种语言一起显示、没有 CSS 动画。johnnyanmac 对此表示失望,但觉得动画本身就会带出意外的测量流量。Gualdrapo 问,动态内容用 JS 说得通,为什么连静态 SVG 也用脚本插入。worg 的解释与 IANA 的带宽说法一致:不跑 JS 的客户端可以少下这些字节。afavour 则说文章写错了,自己关掉 JS 仍能看到 SVG,并怀疑整篇文章是用 AI 拼的。与之对照,抓取到的 HTML 里没有内联 SVG,图标在 /s.js 里。dangoodmanUT 觉得现在的文案看起来像模型生成的。adithyassekhar 数了一下,DebugBear 正文里 example.com 出现 14 次,没有一次是链接。

slipfold 和 ChrisArchitect、sea-gold 都把讨论指回几天前的线程,以及 Kim Davies 那篇说明。cute_boi 开玩笑说,IANA 这种事实上的单一供应者,连一个简单 HTML 页都托管得有点滑稽。

专有名词解释

  • example.com / RFC 2606:IANA 保留的文档用域名。RFC 2606 规定 example.com、example.net、example.org 以及 .example 等名字用于示例,避免作者编一个可能真的有人注册的域名。example.edu 是后来一并指向说明页的名字,文章和 Kim Davies 的帖子都提到了。
  • Hyrum 定律:接口只要有足够多的使用者,所有能观察到的行为都会被某人依赖,包括你没承诺的行为。评论用它解释为什么改一行示例页会弄坏测试。
  • Project Galileo:Cloudflare 为公共利益网站提供支援的计划。Kim Davies 写,example 域名的带宽是在这个计划下得到支援的。
  • courtesy 页面:IANA 的用词。保留域名本身不要求开网站;页面只是告诉访客这个名字为什么存在。

HN 讨论:thread · 68 分 · 44 评

5. Dust: Pretraining Transformers Without Backpropagation

背景介绍
Samip Dahal、Bishwas Mandal、Serdar Gülbahar 和 Akshay Vegesna 在 2026 年 10 月发表 Dust: Pretraining Transformers Without Backpropagation,代码在 qlabs-eng/dust。论文把 Dust 写成第一种在预训练 Transformer 语言模型上能与反向传播相比的零阶方法。做法是对每一层线性层的输出、在每个 token 上独立加上高斯噪声,看这个扰动让该 token 的损失降了多少,再把「奖励乘以噪声」在一组采样上平均,得到输出端的误差估计;误差和这一层已经算好的输入做外积,就是权重梯度。注意力内部不直接用 token 损失,而用注意力输出上的估计误差。他们把每个 token 叫成一个虚拟种群成员:一次前向同时评估整段序列上的成员,而不必像在权重空间里做进化策略那样,为每个成员准备一份扰动后的权重。

论文的基线是 EGGROLL 的 Transformer 实现,也就是在权重上做低秩扰动的进化策略。作者写,从 100 万 token 往上,按他们的外推,Dust 比这种实现大约高效 10³ 到 10⁴ 倍;在同样种群规模下,16k 的 EGGROLL 仍到不了 Dust 在 64 次采样时的损失。实验是 GPT 式网络、FineWeb、4096 token 的 BPE、每批 16k token、带动量的 SGD。在 10 万和 100 万 token 上,Dust 从几百到大约一千次采样起,测试损失可以低于调过参的反向传播。到 1,000 万和 2,000 万 token,差距随种群缩小;2,000 万 token 上幂律外推的极限是 4.431(95% 区间 3.89 到 4.58),低于反向传播的 4.633,但阶梯在 16k 采样时还在下降,作者把这看成「差距还会随种群缩小」,而不是已经测到的极限。

另一项结果写在摘要里:更大的网络更省种群,而不是更费。固定 1,000 万 token,2M、7M、38M、243M 四个尺寸里,243M 在大多数种群规模上优于大约小 120 倍的模型。论文同时把边界写清楚:现在并不打算把计算效率做到可以替换反向传播;也不在本文训练那些反向传播不好训的结构,例如回路里夹外程序、或要在时间上展开的循环 Transformer。作者写,还要再有几个数量级的效率,Dust 才可能在当前算力水平上成为实用替代。

主要讨论方向与观点
评论很少,而且贴着论文自己的两句结论。eriwang915 认为令人意外的是 243M 在大多数种群上胜过小 120 倍的网络:网络变大之后,种群效率更高,而不是更低。polyomino 问,既然这比反向传播贵,能不能拿一个已经用反向传播训好的检查点,再用 Dust 微调,看学习轨迹会不会不同。这条下面没有展开的回复。

api 问:是不是计算效率更低,但更容易并行。vatsachak 回答说不一定。反向传播本身就是一批矩阵乘法,并行度已经很高;Dust 省掉的是反向那一趟。真正可以各干各的是另一类方法,例如神经预测编码,远处的权重不必同步。回复还写,即便如此,行业已经把钱押在前向加反向上,除非有人做出合适的硬件并证明能扩到数十亿参数,否则后继算法很难赢。论文自己的并行点更窄:虚拟种群是沿 token 维一次前向评估很多成员,而不是声称整个训练比反向传播更省。

专有名词解释

  • 反向传播(backprop):用链式法则把损失对每一层输出的导数传回去。Dust 仍要算权重更新,但输出端的误差来自种群,不来自这条链。
  • 零阶优化:只看函数值、不看解析梯度。这里的函数值是每个 token 的损失变化。
  • 进化策略(ES)/ EGGROLL:在参数上加扰动、用整次评估的好坏来估计更新方向。论文用 EGGROLL 代表「每个种群成员一次前向」的权重空间做法。
  • 节点扰动 / 虚拟种群:噪声加在激活上,而不是加在权重上。一个 token 算一个成员,所以一段几千 token 的序列,一次前向就评估几千个成员。
  • 种群:Dust 里是每次更新的采样次数(draws)。论文写,头部分类层和注意力内部的采样另计,占一次更新 FLOPs 的一小部分。

HN 讨论:thread · 87 分 · 13 评

今日 Product Hunt 热榜对应太平洋时间 2026-10-05 日榜(上海时间 10 月 6 日上午抓取,太平洋时间当日尚未收盘)。前半段集中在把脚本做成可发布的社媒视频、给模型请求做路由,以及把单据抽成结构化数据;后半段是 Agent 运行时、隔夜经营体检、给 Agent 接实时搜索,以及桌面上的视频编辑、编程 Agent 控制室、简历和就地改写。按日榜页的名次,前五是 Spira Maxima、FastRouter.ai、Invofox Self Serve、Opengeni 与 DailyHelm,后五是 Web Search API、HyperFrames Studio (Desktop)、devpit、Reactive Resume v6 与 Jarq。票数与评论数取自该日榜页抓取快照,收盘前仍可能变化。

1. Spira Maxima · 官网

标语:Video model that turns script into viral social media videos

背景
Spira Maxima 日榜第 1,发布页标为 Free Options,挂在 Spira AI 名下。Spira AI 的公司介绍写自己做能自行发帖的 AI Influencer;这次发布的是其中的视频模型。CEO Long Ma 在帖里写,自己曾是 Creatify AI 的创始成员和产品负责人,也是 TikTok Creative、CapCut 和 Meta Video Ads 的创始成员。模型把纯文本收成一条竖屏成片:出镜人、跟词走的 B-roll、动效、字幕和音乐一次生成,导出为 9:16 的 MP4,并附带文案和话题标签。输入可以是口播稿、稿加一张照片和可选的声音样本、稿加产品图,或已有的手机录像。不上传出镜人时,它会按稿子配一个社媒上常见的形象。官网写它在社媒趋势和表现数据上做了后训练(post-training,在基础模型之上用特定数据再训一轮),用来跟着当前更常见的视觉处理走。Long 在讨论里说明分身规则:上传者须确认自己有权使用这张脸和这段声音;分身只在该账号内可用;可在设置里删除分身及原始照片和声音样本;这些材料不拿去给其他用户训练。有人升级后仍下不了去水印的旧视频,团队回复 Chris Kang 表示会补「升级后去掉已生成视频水印」,目前要重新生成。抓取时约 331 票、约 47 评。

产品要解决的问题
生成一段画面已经很快,但要发到 TikTok、Reels 或 Shorts 上,还得选人、切 B-roll、改字幕、配乐。成品停在这一步时,很多稿子就不再发出去。

产品市场分析
官网写给要经常发产品介绍、购买说明、系列上新和创始人讲解的品牌、服务商、创始人和营销团队。对照表把 Creatify Aurora、HeyGen Avatar IV Premium、Veo 3.1 Standard 和 Seedance 2.5 放在旁边,并注明竞品数字来自对方公开页面和 fal 标价,核对日期为 2026-10-03;「—」表示那一步仍要自己进剪辑软件。标价是成品视频每秒 0.15 美元,动效、字幕和音乐含在内;首月五折,页面上的启动价写作每秒 0.075 美元。生成前按钮会显示当次价格。长度上限:免费 20 秒、400 字;Creator 60 秒、1,200 字;Growth 90 秒、1,800 字。视频编辑、给 Claude Code 和 Codex 的原生 MCP 与 CLI,以及 API,页面写为仍在开发、分阶段放出。MCP(Model Context Protocol,模型上下文协议)是让模型调用外部工具的接口。

产品上下游
上游是口播稿、照片、声音样本、产品图或已有录像,以及官网所说的社媒趋势数据。下游是竖屏 MP4 和配套文案。分身材料按讨论里的说法留在该账号,并可删除。

2. FastRouter.ai · 官网

标语:Route requests to the right LLM for cost, latency & quality

背景
FastRouter.ai 日榜第 2,发布页标为 Free Options。讨论里以团队身份回复的是 Ritesh Prasad;猎人 Rohan Chaubey 提到 Andrej 曾来演示产品。它是一个 OpenAI 兼容的网关:应用把原来打向 OpenAI SDK 的地址改到 FastRouter,同一套请求可以落到 200 多个模型上,并按费用、延迟、吞吐或优先级选择上游。虚拟模型别名可以配随机、最低延迟、最高吞吐、最低用量、最低价格、优先级和按类别路由。失败切换目前只发生在第一个 token 发出之前;流已经开始后再出错,会把错误写回流并结束,不会从半截续写。内容日志可以按 API key 关掉,关掉后那些请求不能再拿去做评估、洞察和提示词优化。企业版可以放到客户自己的环境。讨论里有人注册后找不到「两个月免费」的领取入口,Ritesh 回复该方案的限额已在后台打开,并请对方写信到 support@fastrouter.ai。定价页上的「两个月免费」指年付相对月付少付两个月,相当于约 16%。抓取时约 308 票、约 54 评。

产品要解决的问题
生产环境里的模型调用往往同时挂着多家供应商。换模型、做失败回退、看清哪一次请求打到了哪家,以及发现账单上可以省的部分,常常要自己再做一层。

产品市场分析
官网写给要在多个模型之间做费用、延迟和质量取舍的开发者和企业团队。定价页(美元,模型用量零加价,方案费另计):Starter 永久 0 美元,3 个组织、最多 5 个别名、1 把自带密钥且每月 100 万次请求、每月 20 万条日志、保留 7 天;Pro 每月 199 美元,10 个组织、20 名成员、60 天日志、响应缓存、追踪和护栏;Business 每月 799 美元,100 个组织、服务账号密钥、日志保留 120 天;Enterprise 另询,含自托管。年付 Pro 为 1,990 美元、Business 为 7,990 美元。替代方案是直接对接各家 API,或使用其他模型网关;Ritesh 在帖里把差异写成周期性的费用建议、按请求的告警、提示词版本、跨文本和图像视频的评估,以及多模态响应缓存。自述有客户经这些建议识别出每月超过 1 万美元的节省,这是帖文说法。

产品上下游
上游是应用发出的文本、图像、视频、嵌入和语音请求,以及可选的自带供应商密钥。下游是选定的模型供应商、统一日志和告警(Slack、PagerDuty 等)。自托管只写在 Enterprise。零数据保留取决于所路由的供应商是否提供该选项。

3. Invofox Self Serve · 官网

标语:99% accurate document extraction, SLA guaranteed

背景
这是 Invofox 的第 3 次发布,日榜第 3,发布页标为 Free Options。产品页公司信息标有 Y Combinator。讨论里回复的有 Alberto Gimeno 和 Nacho Gabaldón。它是文档解析 API:上传 PDF 或图片,返回按 schema(目标字段结构)整理的 JSON,覆盖分类、抽取、校验和反馈。预置类型包括发票、收据、账单、工资单、采购单、身份证件、合同、税表和美国抵押贷款文件;也可以交自定义 schema。官网 FAQ 写准确率门槛按文档类型和字段写进 SLA(服务等级协议);稳定用例达到 99.2%。报错的文档会自动退回该页费用。默认在欧盟处理,美国处理需另行申请。零保留(交付后删除文档)写为 Scale 和 Enterprise 可选;本地或 VPC 部署写为 Enterprise。Alberto 在讨论里对「能否本地处理敏感文件」回复:支持零数据保留和本地部署,并请对方联系团队。有人转述免费额度为 500 页且无需信用卡,他回复本次发布期间是 1,500 页。定价页仍写新账号 500 页、无需信用卡、也没有持续的免费额度。两处数字本次没有再向团队核对。抓取时约 273 票、约 24 评。

产品要解决的问题
发票、收据和合同的版式差很多。只做 OCR(把图像转成文字)之后,表格、手写和字段校验仍要人看;用通用模型搭一个周末原型,也还没覆盖模型升级后的回归和按客户文档持续改规则。

产品市场分析
目标是把单据解析嵌进自己产品的软件团队,定价页提到金融、物流、借贷、保险和医疗运营。定价页(美元):Free 为 0,500 页,含发票、收据、水电账单、票据和工资单的预训练模型与 REST API;Starter 起价每月 500 美元、按年计费,每月最多 5,000 页,并列出 99.9% 可用性 SLA;Scale 与 Enterprise 另询。页脚又写 SLA 档面向每年处理 100 万页以上的方案。按页计费,量越大单价越低;Enterprise 也可按文档或业务对象计价。定价页写平均处理时间不到 3 秒,OCR 说明页写典型文档大约 10 秒,两处没有互相解释。官网写生产中约 150 家公司、每月处理超过 1,000 万份文档,这是站上自述。

产品上下游
上游是 PDF、图片、目标 schema 和客户通过反馈接口标出的错误。下游是 webhook 或轮询取回的 JSON,以及记入账单前被退回的错误页。零保留和本地部署不在自助免费档的功能列表里。

4. Opengeni · 官网

标语:Ship AI agents within minutes. Infrastructure for Agents

背景
Opengeni 日榜第 4,发布页标为 Free Options,并写有 100 美元额度。产品页 2 条评价、5.0 分。协议为 Apache-2.0,仓库在 Cloudgeni-ai/opengeni。讨论里回复的有 Davlet Dzhakishev、Jørgen Sandhaug,以及被点名的 Benny。它提供可恢复的会话、隔离沙箱、工具和 MCP、人工审批、记忆、按租户隔离,以及按步骤和金额查看花费。连接断开后运行继续:消息返回 202,Agent 在后台工人上接着做,子 Agent 经 Postgres 回报,不依赖浏览器一直连着。空闲会话只是数据库里的一行,不轮询。流式 token 每 33 毫秒或每 50 个事件批量写入,不锁主会话行;在线观看方经 NATS 收到通知后再读 Postgres。核心目前不能缩到零,工人是长驻进程,部署在 Kubernetes 或云主机上;调用方自己的后端可以是无服务器函数,但不建议用函数去代理 SSE 长连接。MCP 端点已用可流式的 HTTP。发布说明写前 100 名云用户可用码 PRODUCTHUNT100 领取 100 美元额度;抓取官网时页面写还剩 49 个码。抓取时约 265 票、约 45 评。

产品要解决的问题
把 Agent 放进已有的 SaaS,要自己处理断线后续跑、沙箱、每个用户的 OAuth 令牌、多租户隔离和花费账本。这些部分在演示里看不出来,一进生产就占掉做产品本身的时间。

产品市场分析
Davlet 写,目前更常帮到已经有 SaaS、又要在不打破用户和组织边界的前提下加上 Agent 的团队。定价页:自托管软件许可为 0 美元,计算、存储和模型费自付;云上按模型供应商费用加 5%,无席位费、无平台费、无最低消费;Enterprise 另询,含私有部署、SSO 和商业支持。替代方案是用 LangGraph 一类框架或云厂商自己搭。发布码的剩余数量会变,以官网当时显示为准。

产品上下游
上游是应用通过 SDK 发来的会话、用户自己的 OAuth 连接(讨论和官网举例有 Stripe、GitHub、Google Drive)、OpenAPI 描述的工具,以及 OpenAI、Azure OpenAI、OpenRouter 或自备的兼容端点。下游是沙箱里的工具调用、待人批准的动作、webhook(如一轮结束、需要人工),以及按用户和会话的费用记录。有人问能否给 Agent 或会话设硬预算、用尽即停;Davlet 回复已经在记费用并有限额和护栏,把两者合成硬停止「会比较简单」,没有说这个开关今天已经打开。

5. DailyHelm · 官网

标语:Turn analytics into daily revenue-boosting fixes

背景
DailyHelm 由 Brandon 发布,日榜第 5,发布页标为 Free Options。猎人 Rohan Chaubey 写自己参与了发布前的表述。它是给创始人和增长团队的隔夜审阅:连上分析、广告、商店和支付数据,第二天给出按影响排序的发现,并带证据、置信度和建议动作。定价页写包含 6 个专科 Agent 和编排者 Aria。专科角色在产品脚本里写为 Iris(分析与增长)、Pitch(广告)、Echo(SEO)、Ada(代码)、Penny(费用)、Sage(站点体验)。Brandon 在讨论里说:不是用来替换 GA4 的明细报表;Iris 读 GA4,标出值得看的变化。连接器用各平台自己的授权页,页面写为只读、不保存密码。PostHog 的接入说明是粘贴个人 API key。Google Ads 今天可以接;Meta Ads 在连接器列表里标为即将推出,Brandon 说 Facebook 计划下个月上线。一个登录可以加多个业务,每个业务单独订阅,第二家按全价、不做成折扣加购。7 天试用为完整产品,无需信用卡。抓取时约 206 票、约 65 评。

产品要解决的问题
仪表盘和表格已经很多,但转化断了、广告空耗或结账异常,仍要人每天去各处对。对完之后,先改哪一件往往没有排序。

产品市场分析
讨论里 Rohan 把它推荐给 DTC、SaaS、代理商和小型线上生意。定价页方案(美元,月付;年付按月折算更低):Solo 每月 99 美元,1 个席位、Aria 每月 30 条消息、邮件日报、发现保留 60 天;Growth 每月 199 美元,3 个席位、每月 75 条消息、Slack 投递、保留 1 年、每周摘要;Scale 每月 349 美元,席位和历史不限、API 与 webhook、PDF 导出。年付折算月价分别为 79、159 和 279 美元。官网对照文把 Databox、AgencyAnalytics、Triple Whale 和 Baremetrics 写成不同侧重点的替代:对方更偏看板、客户报告、Shopify 广告归因或订阅指标。对照文里另有一句把 Growth 写成每月 149 美元,与定价组件里的 199 美元不一致,本文采用定价组件。

产品上下游
上游是 GA4、Search Console、站点爬虫、PostHog、Google Ads、Shopify、Stripe、Square、GitHub、HubSpot、Zendesk 等已连接的数据;Meta Ads 仍标为即将推出。下游是邮件或 Slack 里的日报、可分享链接,以及 Scale 上的 webhook 和 PDF。发现是否值得做,取决于人是否核对它附上的证据。

6. Web Search API · 官网

标语:Give AI Agents Access to Live Internet Data

背景
Web Search API 是 Cloudflare 的第 54 次发布,日榜第 6,发布页标为 Free Options。公司主页仍是 cloudflare.com;这次发布的说明在 2026-10-02 的更新日志,状态为 beta。它让 Agent 和应用搜索互联网,用来给回答加上当前信息,而不是猜 URL 或停在模型的训练截止日期。上线可选三家:Ceramic.ai(默认)、Exa、Linkup。三家都写明经 Cloudflare 的请求支持零数据保留,并承诺遵守 Cloudflare 的已验证爬虫标准。调用走 AI Gateway:用账号 API token 打 REST,或在 Worker 里用 AI 绑定的 websearch()。不指定供应商时用 Ceramic。自带密钥时,密钥存在网关的 Secrets Store,请求体里只传别名;未配置该别名则返回 400,不会悄悄改用额度。讨论里有人问更适合哪类查询、是抓取还是知识工作;抓取到的帖文里没有团队答复。抓取时约 158 票、约 2 评。

产品要解决的问题
模型回答停在训练截止日期之后的事情时,要么猜,要么由应用自己再接一家搜索 API,并单独处理密钥、日志和账单。

产品市场分析
目标是已经在用 Cloudflare 账号和 AI Gateway、要给 Agent 加实时检索的开发者。供应商文档上的标价(经额度支付、无加价;自带密钥则由该供应商按原协议计费):Ceramic 每 1,000 次 0.25 美元,Linkup 每 1,000 次 5 美元,Exa 每 1,000 次 7 美元。Ceramic 文档写它维护面向 Agent 的独立索引,规模超过 400 亿页。替代方案是直接购买 Exa、Linkup 或其他搜索 API,或使用模型供应商自带的联网工具。AI Gateway 文档里另有一条「把某家模型的联网工具原样代理过去」,那是另一条路径,不是这次的 Web Search API。

产品上下游
上游是查询语句、可选的供应商和条数上限,以及 AI Gateway 额度或自带密钥。下游是带回摘要或片段的搜索结果,以及网关日志。Linkup 在这条 API 里用 fast 深度并返回原始结果,不由 Linkup 再生成一篇答案。索引覆盖和时效仍取决于所选供应商。

7. HyperFrames Studio (Desktop) · 官网

标语:The First Video Editor built for Agents

背景
HyperFrames Studio 是 HeyGen 的第 19 次发布,日榜第 7,发布页标为免费。发帖人 Bin Liu 写自己在 HeyGen 负责 Agent 视频产品与工程。核心库 HyperFrames 已开源:Agent 用 HTML 写视频,再渲染成 MP4。抓取 GitHub 仓库 heygen-com/hyperframes 时约 57,338 star;Bin 在帖里写超过 56,000,并称 HyperFrames 技能在 skills.sh 上排历史第 13,后一数字本次没有从 skills.sh 再核对。Studio 是放在这套渲染前面的桌面编辑器:用 Claude Code 或 Codex 生成初稿,然后在画面上圈选、留言,把一批批注一次交给 Agent。也可以动手改时间线、片段速度,并导出 MP4、WebM 或 MOV,最高 4K。Bin 写它更适合动效、发布片和口播再剪。系统为 macOS 和 Linux,Windows 写为即将推出;同事 Miguel Ángel 对「何时有 Windows」回复很快会有。有人问开源部分和 Studio 如何分界,抓取到的帖文里没有直接答复。抓取时约 144 票、约 10 评。

产品要解决的问题
用对话改视频时,「某一秒的某个词再早一点」很难指清楚。每一轮文字说明都可能改到别的地方。

产品市场分析
Bin 写给被剪辑卡住的创始人、营销和讲故事的人,以及已经在用编程 Agent 的人。变现信号是发布页的免费;Studio 与开源核心的收费边界,本次没有从官网核对到价目。替代方案是传统时间线编辑器,或只生成成片、不能在画面上批注的视频 Agent。HeyGen 主产品仍是头像视频平台,产品页上的历史评价多数针对那一条产品,不是这次的 Studio。

产品上下游
上游是描述、画面上的圈选和批注,以及编程 Agent(帖里点名 Claude Code 和 Codex)。下游是 HTML 时间线渲染出的成片。开源仓库继续作为 Agent 写视频的那一层;Studio 的下载页在抓取时返回错误,安装包以 hyperframes.dev 当时提供的入口为准。

8. devpit · 官网

标语:A native control room for your Claude Code agents

背景
devpit 由 Jhol Hewres 发布,日榜第 8,发布页标为免费。官网写它是桌面应用:每个项目一个终端,一块看板,每次调用的费用,以及能看见多个项目的编排器。技术栈在 FAQ 里写为 Rust 和 Tauri,终端是真正的 pty,后面是 tmux;Windows 用自带的 psmux。构建列出 Linux(x86_64 与 arm64)、macOS 通用包和 Windows x64 安装包,Linux 构建也可在 WSL 2 里跑。协议为 Apache-2.0,仓库为 jholhewres/devpit。它使用用户已有的 Claude Code 方案,不另发 API 密钥。数据放在 ~/.devpit,不往项目仓库里写文件。手机查看走 Tailscale(组私人网络的工具):用一次性码配对,并选择手机能做哪些事。今天的账号只用于登录;FAQ 写将来的同步会保留工作区、不上传工作内容本身。驱动的 Agent 目前是 Claude Code,其余写为还在路上。Jhol 回复费用可以按日、模型、项目和会话查看。有人追问一轮还在生成时数字会不会往上跳、以便中途停掉;回复说可以在编排器里看进行中的会话、每次调用的费用和 token,没有单独说明数字是否在该轮返回之前就更新。抓取时约 101 票、约 6 评。

产品要解决的问题
多个 Claude Code 会话同时跑时,哪一个终端还在烧 token、哪一张任务卡真正触发了工作,很容易对不上。

产品市场分析
目标是已经在本机用 Claude Code、又要同时看几个项目的人。变现信号是免费和 Apache-2.0;模型费用仍走用户自己的 Claude 方案。替代方案是继续用多个终端,或使用 Claude 自己的桌面界面。其他编程 Agent 的支持还没写进当前驱动说明。

产品上下游
上游是本机项目、看板上的卡片,以及已登录的 Claude Code。下游是 tmux 或 psmux 里的会话、按会话记下的费用,以及可选的 Tailscale 查看。编排器可以按卡片开一场会话再回报;仓库本身不被写入。

9. Reactive Resume v6 · 官网

标语:A free and open-source resume builder

背景
这是 Reactive Resume 的第 5 次发布,日榜第 9,发布页标为免费。作者 Amruth Pillai 写这个项目已经做了 6 年,v6 把简历、配套求职信和求职进度放进同一套流程。界面分成写作、设计和检查,简历始终可见;检查意见指到对应行。AI 修改并排显示原文、建议和理由,逐条接受或拒绝。预览就是 PDF,由浏览器里的 pdf.js 画出,下载与预览用同一引擎。可导入 PDF、Word、JSON 或 LinkedIn 数据导出,LinkedIn 导入不经过 AI。文档站写有 17 套模板、55 种语言,导出 PDF、Word、Markdown 或 JSON,分享链接可以加密码。求职跟踪有列表、看板和日历。自托管是一个 Docker 镜像,Amruth 回复即使没有 Docker 经验,也可以把文档交给 Agent,并写树莓派也能跑。协议为 MIT。没有广告、没有追踪、没有付费档;AI 可选,密钥连到用户自己的供应商,费用由该供应商收取。项目靠 Open Collective 捐赠维持。有人问跟踪器能否在面试前发提醒,抓取到的帖文在问题之后没有团队答复。抓取时约 100 票、约 4 评。

产品要解决的问题
改简历时,写经历、调版式和决定能不能投,常常混在同一屏里。预览和导出若不是同一套渲染,投出去的 PDF 会和屏幕上看到的不一致。

产品市场分析
文档写给正在求职、不想先学设计的人。托管版在 rxresu.me 注册即用;组织也可以自己托管,功能与托管版相同。替代方案是按模板收费的简历网站,或文字处理器。变现信号是永久免费加上捐赠;AI 不在 Reactive Resume 的价目里。

产品上下游
上游是用户写下的经历、导入的文件,以及可选的自备模型。下游是 PDF 和其他导出、可加密码的分享链接,以及求职进度板。账号数据可以导出 JSON 或整包下载,也可以删除账号。

10. Jarq · 官网

标语:Translate, shorten, fix or rewrite any text near your cursor

背景
Jarq 日榜第 10,发布页标为免费,并写有 1 个月免费。官网要求 Apple Silicon(M1 或更新)和 macOS 13 及以上。在任意应用里选中文字后,翻译、缩短、修正或改写会出现在选区旁边,结果可以原地替换或复制。自定义指令会变成一颗按钮;选中的文字只当作待处理的材料,不当作命令。口授快捷键是 Option 加反引号,再说一次结束,整理后的文字落在光标处。可以说一种语言、打出另一种,官网写支持 13 种,页上点名英、俄、西、葡、法、德等。选区被应用挡住时,Option-T 仍会取字,官网点名 Figma 和终端。可选的本机语音模型让口授不上云,且不计入次数。云端处理的文字和声音,官网写不在服务器上保存、也不用于训练;历史留在本机。隐私政策页为 jarq.app/privacy。讨论里有人问口译是等停顿再提交,还是边说边改;抓取到的帖文里没有团队答复。抓取时约 95 票、约 4 评。

产品要解决的问题
把一段话交给翻译或聊天窗口再贴回来,要切换应用。正在写的句子会因此断掉。

产品市场分析
官网把它和 Grammarly、ChatGPT 的差别写成:那些工具在自己的窗口里,Jarq 在当前应用里改完。和 macOS 自带听写的差别写成:它交出带标点和指定语言的成句,并覆盖系统听写容易失败的应用。每次安装先给 14 天 Pro,无需信用卡、无需账号。之后免费档每天 5 次口授或翻译,不过期。付费为每月 4.99 美元、每年 39 美元,或一次 179 美元。本机语音模型在各档都不限次数。发布页写的「1 个月免费」和官网的 14 天 Pro,本次没有再核对是否为同一优惠。Windows 或其他平台不在系统要求里。

产品上下游
上游是选中的文字、自定义指令,或麦克风。云端模型处理需要出网的翻译和改写;本机模型只处理口授。下游是原地替换或复制到剪贴板的文本。官网提醒模型会出错,重要文字需要再看一遍。

今日 Hacker News 热榜前五落在本地大模型、上世纪文字冒险、系统自带 AI 占掉的磁盘、动画工作室档案,以及用现成 SSH 做临时外网入口。排第一的是 Strata:它把 Qwen3.8-Flash-Next 拆到消费级显卡、内存和硬盘上跑,热帖标题写的是 RTX 4090 上约 100 token/秒。后面是 Andrew Plotkin 用调试器挖出 Infocom 游戏 Infidel 里一个出厂就在的内存写坏,以及一个关掉 macOS 27 上 Apple Intelligence 并删掉模型文件的开源工具。后两条是 Tippett Studios 关停后有人把光盘镜像放上 Internet Archive,以及 Vincent Bernat 只用 OpenSSH 和 nginx 做带过期链接的自建 HTTP 隧道。以下按 Firebase topstories 当前顺序整理,分数与评论数为抓取时快照。

1. Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

背景介绍
Strata 的 README 说,它在普通 PC 上跑 Qwen3.8-Flash-Next,聊天、写代码、读图,并给本机上的应用和编程 agent 用;README 写「数据不离开这台 PC」。Hugging Face 模型卡把这款模型写成实验性预览,是日后 Qwen4 架构的一次公开权重发布:因果语言模型加视觉编码器,许可证名为 qwen-community-1.0。模型卡的参数量是 125B、其中约 6B 激活,另外还有 51B 的 n-gram embedding 和 4B 的 MTP;原生上下文 262,144 token,并写可延伸到 1,000,000。MoE 是 512 个专家,每步激活 10 个路由专家加 1 个共享专家,共 48 层。

Strata 的硬件要求是 12 GB 及以上显存(列出了多款 NVIDIA RTX 与部分 AMD Radeon)、32 GB 及以上内存、大约 80 GB 磁盘,系统为 Windows 10/11 或 Linux。README 自己的速度表测的不是 4090:RTX 5070(12 GB)配 64 GB 内存时,Q2_0 写回复约 94 token/秒、读 32K prompt 约 2,650 token/秒;同一张卡上 IQ3_S 约 53 token/秒。RX 9070 XT 上 Q2_0 约 60 token/秒。文中估计显存更大的 RTX 3090(24 GB)「应该」能到大约 100–140 token/秒,这是估计,不是表里的实测行。HN 标题里的「100T/s」和「RTX 4090」对得上提交者 snehesht 的跟帖:4090、128 GB DDR5、Ryzen 7950X3D,测到 124 token/秒。

README 把加速说成两件事。一是把工作拆开:显卡留下最常用的专家,内存放下全部,CPU 同时算其余部分,SSD 放一张大查找表。它写模型是「24,576 个小专家、每个词只用其中 10 个」。官方模型卡是每层 512 个专家、48 层;512×48=24,576,和这两个数字对得上,但 README 没有把这步乘法写出来,也没有单独提到模型卡里的那个共享专家。二是「先猜再核对」:小模型先猜接下来几个词,大模型一次核对,README 写同样的答案可以早 1.6–1.8 倍出来。安装器按内存推荐量化:32 GB 用删掉一半专家的 Coder 版,48 GB 用 IQ2_XS 或 Q2_0,64 GB 推荐 IQ2_XS、也可以上 IQ3。Coder 版 README 写,其作者测得 SWE-bench Verified 达到完整模型的 91%,代码以外(包括中日韩文本)更弱。服务开在 http://127.0.0.1:8080,并提供 OpenAI 兼容的 /v1。

主要讨论方向与观点
速度有人复现,质量有人存疑。mrinterweb 用一张 RTX 4090(24 GB)加 128 GB DDR4,写自己看到超过 110 token/秒(评论里称为 3 token MTP),上下文用到 60K/260K,并觉得目前不差于自己约 60 token/秒的 Qwen 3.8 q5 27B。jacquesm 承认速度在,但自己试下来准确度并不特别打动人,并说这类链接在各处 LLM 帖子里很多,蜜月期过后还要再看。a11r 不愿意用到 4-bit 以下,怕质量掉得厉害;对方自己的栈是租来的 RTX Pro 6000、大约每小时 1 美元,用 4-bit 做范围明确的编程任务。Tepix 直接写 Q2 量化不感兴趣。mmaunder 把 Coder 版说成丢掉一半 MoE 专家,认为「有总比没有强」,但离够用还有距离。

Jackson__ 用一个 50 张图的坐标任务做了对比:同一套 GGUF 和视觉适配权重,Strata 的中位误差 154.8 像素、平均 168.8;llama.cpp 是中位 46.5、平均 81.4,温度都是 0。评论把这个差距比作从 9B 跳到 35B,并写没有再做别的测试。也有人拿别的引擎比较:kamranjon 说 ds4 已经支持这个模型,自己每天用 q4;AntiRush 则在 RTX 6000 Pro 上用 另一份 ds4 的 Q4,写下代码场景 prefill 1,251 token/秒、decode 255.26 token/秒,以及可以同时开 4 路、速度在 400 token/秒以上。lxe 问这种专家缓存为什么还不进 llama.cpp。回复里一种说法是 GGML 要求贡献者自己看得懂代码,完全由模型生成、作者也不打算整理的内核就留在下游;另一种说法是主流引擎要同时守数值精度和很宽的硬件、模型矩阵,所以合入慢。

专有名词解释

  • Qwen3.8-Flash-Next:阿里云 Qwen 团队在 Hugging Face 上的开放权重预览。模型卡写 125B 总参数、约 6B 激活,并带视觉编码器。HN 标题把它写成 “Qwen 3.8 Flash Next”。
  • MoE / 专家:Mixture-of-Experts。模型卡写 512 个专家,每步走 10 个路由专家加 1 个共享专家。Strata README 的 24,576 与「512 专家 × 48 层」数值相同。
  • Q2 / IQ3 等量化:把权重压到大约 2-bit 或 3-bit 的格式名,README 的速度表按这些尺寸分行。评论里的担心是:更小更快,但低于 4-bit 时质量可能明显变差。
  • MTP:模型卡里的 4B multi-token prediction 模块。mrinterweb 用 “3 token MTP” 描述自己的测速;README 则把同类加速写成小模型先猜、大模型再核对。
  • GGUF:Jackson__ 用来对比 Strata 和 llama.cpp 的权重文件格式。评论写两边用的是同一套 GGUF 和视觉适配权重。

HN 讨论:thread · 598 分 · 280 评

2. Infidel goes wild

背景介绍
Andrew Plotkin 于 2026 年 10 月 3 日在 Zarf Updates 发表 Infidel goes wild。他写,前一天刚公开了 Planetfall,这几周则在看 Infocom 1983 年的文字冒险 Infidel,并用相当于内存级调试器的工具玩这款游戏,碰到了他见过的 Infocom 游戏里最离谱的 bug。分析对象是 Macintosh 更新版 release 22、序列号 840522;最初发行版序列号 830916 有同一个 bug,只是地址略有不同。

Infidel 的场景在埃及沙漠。营地以东是 3×3 的沙漠,再往外就走进一个叫 ENDLESS-DESERT 的房间,所有未画进地图的沙漠都由它代表,游戏另外记下经纬度。为了让「不同地点」看起来不同,丢在沙漠里的物品会被移出房间,坐标写进 DESERT-TABLE;走回同一坐标时再搬回来。丢下物品时还有三分之一的概率立刻被沙子埋掉。

Plotkin 想在调试器的 State 页显示这张表,发现表一直是空的,物品却确实会消失再出现。反汇编 DESERT-TO-TABLE 之后,他写原因是编译器:ZIL 允许参数默认值等于全局变量 DESERT-TABLE,但这张表的地址 11129 不是编译期常量。生成的 Z-machine 代码把局部变量初始化成全局变量的编号 30(十六进制 1e),而不是地址 11129。于是写入从内存地址 30 开始,把表和读回函数一起用错,表面上看物品还能回来,内存已经被踩过。Z-machine 版本 3 里地址 0–29 才是有意义的文件头,30–63 碰巧空着;地址 64 起是缩写表。他预言丢下九件物品再走开,最后一件会改写缩写表开头。文中贴出的结果是:幻觉句里的 “the” 变成了 “You”。另一次测试让解释器崩溃。他判断 1984 年的修订没有修这个 bug,也推测几乎没有人在无尽沙漠里丢过八件以上的东西。修法在文中写得很短:不要用全局变量当默认参数,改成函数开头 <SET TBL ,DESERT-TABLE>,或者多传一个参数。同文还提到另一对例程 PROP-TO-TBL / TBL-TO-PROP 有类似问题,而游戏并不允许在无尽沙漠挖坑。

主要讨论方向与观点
评论不多,多半接在那句「作为 C 程序员,我在法律上必须把内存破坏当成最严重的罪」上。Waterluvian 回了一句 “Self-flagellation considered dangerous.” kwertyoowiyop 问有哪位八十年代游戏程序员从没把内存写坏过就出过货。gertlex 说自己在读 Digital Antiquarian 的游戏史,那些文章往往要自己配磁盘镜像和模拟器;这种能直接在浏览器里看的写法,也许会让人真的去试一款解析器冒险。jdw64 问怎样才能写出这种基于亲身经历的技术文。zem 的回复把起点放得很小:在论坛里想起职业生涯中的一个瞬间并写短回复,或者学 Julia Evans 那样把「今天学到的一件事」写成博文,不要求每篇都一样重。页面底部还嵌了 Bluesky 和 Mastodon 上的转贴,其中有人问这会不会影响速通,glyph 提到有人在做以 6502 周期计时的 Zork 工具辅助速通,并链到 intfiction.org 的帖子。

专有名词解释

  • Infocom / ZIL / Z-machine:Infocom 是八十年代商业文字冒险的公司。ZIL 是它们的实现语言,编译到 Z-machine 这种虚拟机。文中的 txd 来自九十年代初的 ztools,操作码名字和 ZIL 术语并不一一对应。
  • ENDLESS-DESERT / DESERT-TABLE:游戏里代表一切未测绘沙漠的单个房间,以及记录「哪件物品落在哪个经纬度」的定长数组。文章写这张表有 100 个值、从地址 11129 开始。
  • 缩写表:Z-machine 文本压缩用的常用词表。文章写版本 3 从地址 64 开始,共 96 个词;被踩到之后,打印出来的句子会串词。
  • Visible Zorker:文章后文用来比较的名字,原句是 Infocom 没有类似它的工具。开头只把作者自己的手段写成内存级调试器,没有另起一段定义这个名字。

HN 讨论:thread · 70 分 · 10 评

3. Turn off Apple Intelligence on macOS 27 and get its disk space back

背景介绍
RemoveMacAI 的 README 写:macOS 27 不再为 Apple Intelligence 提供一个总开关,功能关掉之后模型文件仍留在磁盘上。这个工具会关掉功能、删掉模型,并阻止系统再次下载;改动可以还原。它只支持 Apple 芯片。README 的系统表写 macOS 27 受支持、在 27.0 上测试过;27.0.1 需要 0.2.3 或更新版本。macOS 26 及更早不受支持。

关掉的功能包括 Siri(含 “Hey Siri” 和菜单栏图标)、Writing Tools、Genmoji、Image Playground、ChatGPT 扩展,以及邮件、信息、Safari、备忘录和通知里的摘要,还有邮件智能回复、行内文本预测、Spatial Photos、照片的 Clean Up、Xcode 预测性代码补全。删掉的是 Apple Intelligence 基础模型,以及图像生成、Genmoji、Spatial Photos、照片 Clean Up 和 Xcode 补全各自的模型。听写是另一项设置,语音模型不删。

实现上,配置描述文件套用 Apple 的限制键,并强制那些没有限制键的设置。模型通过 Apple 的 asset 服务删除,系统完整性保护保持开启,不直接改 /System 下的文件。描述文件把已删除模型的下载指到一个关闭的本地端口,避免系统再下回来。删掉描述文件后,设置回到先前状态,功能再次需要模型时系统会重新下载。README 写这个工具本身不发起网络请求、也不收集数据。安装方式包括 Homebrew,以及一行 curl | bash:脚本下载最新发行包、核对 SHA-256,再从临时目录运行。发行包由 GitHub Actions 从标签构建,并带构建来源证明,可以用 gh attestation verify 核对。项目致谢写,它建立在 4evy 的 pared 上,后者先摸清了 asset 服务、模型集合和一部分设置键。

主要讨论方向与观点
不少评论把它看成系统「去臃肿」。ryandrake 比作装完 Windows 后一向要做的清理,并说 macOS 也到了要靠第三方脚本拿回资源和去掉不想要的软件的地步。hypfer 提到 O&O ShutUp10,问 Apple 的产品策略发生了什么。rsx88 把这件事和 iPhone 上关不掉的订阅横幅放在一起,问今年是不是该改用 Linux。1saadcodes 肯定工具开源、做了什么能看出来,同时担心为用不上的模型交出几十 GB,离开了以前把系统做瘦的做法。kristianpaul 只写自己需要拿回 12 GB。Grombobulous 已经不用 Mac,但抱怨 iOS 上不能再用一个开关关掉这类 AI,并对比微软、Firefox 提供的全局 AI 开关。

也有人站在保留本机模型一边。pdp 不理解为什么要删掉每台 Mac 都带的、体积相对小、也不上云的本地推理模型:够不上前沿,但够基本任务。Waterluvian 想起十多年前为了「即插即用」而在 OS X 里塞进数 GB 打印机驱动,好奇 Apple 怎么权衡磁盘占用和一部分用户的不满。安全问题被直接问出来:the_arun 问凭什么相信这个工具;回复是代码开源,可以自己看。pyaamb 问能不能手动做,detourdog 贴了 Apple 讨论区的一篇文档链接,本文没有再打开那篇文档核对步骤。pmarreck 问它到底做什么;一条回复用讽刺口吻描述被关掉的那些系统功能,不是在逐条解释这个仓库的代码。

专有名词解释

  • Apple Intelligence:macOS 27 上的系统级生成功能总称。README 的判断是:这一版没有单一开关,关掉功能也不会自动清掉已下载模型。
  • 配置描述文件:macOS 用来下发限制的配置。RemoveMacAI 用它套限制键,并让用户在系统设置里批准安装。
  • asset 服务:README 用来删除和拦截模型下载的系统组件。文件真正从磁盘消失的时间由系统自己排,所以「存储空间」里可能还会暂时把它们算在 Apple Intelligence 名下。
  • 系统完整性保护(SIP):macOS 阻止直接改系统目录的机制。README 写删除模型时 SIP 保持开启。
  • pared:4evy 先写的工具。RemoveMacAI 在致谢里把它当成摸清模型集合和设置键的基础。

HN 讨论:thread · 334 分 · 210 评

4. In the wake of closure, a digital archive of animated materials appears online

背景介绍
Ryan Lambie 于 2026 年 10 月 2 日在 Film Stories 发表 Tippett Studios | In the wake of its closure, a digital archive of animated materials appears online。文章说,Phil Tippett 创办的伯克利动画与特效公司 Tippett Studios 在财务困难之后关停;关门日期写的是「那个月的 28 日」,而「那个月」是文章开头的八月。以 10 月 2 日的发表日期来读,指的是当年八月二十八日,句子里没有再写一遍年份。关停的同时,Tippett 本人退休,几十年的道具、纪念品和美术在两天拍卖里卖掉。文章担心工作室里的大量资料会进私人收藏、不再公开,并提醒 Tippett 的工作出现在 Star Wars、RoboCop、Starship Troopers 等片里。

随后的消息是:一位化名 TippettFan 的人在八月拍卖上买下夹着 CD-ROM 和其他光盘的文件夹,价格未披露,并把内容数字化后上传到 Internet Archive。捐赠说明写,这里是 Tippett 档案里 90 张关键、不重复光盘的 .ISO 镜像,因为其中一些资料网上没有、以后也未必再以这么高的分辨率出现。馆藏页在 archive.org/details/tippett-archive。文章说,少量片段可以直接在线看,包括 CGI 生物测试和 2008 年对 Phil Tippett 的采访;主体仍是 ISO,文件名涉及 RoboCop、Starship Troopers 的幕后、原版 Star Wars 上的幻灯片,以及《猫女》(Catwoman)的宣传剧照。文章感谢在 Bluesky 上指出这个馆藏的 Brandon Sheffield。

主要讨论方向与观点
这条下面只有两条评论。drewbeck 认为标题里应该出现 Tippett Studios 或 Phil 的名字,否则熟悉他的读者找不到这篇。stavros 说这有 textfiles 的味道,并补了一条 discmaster.textfiles.com 上搜索 “tippet” 的链接(检索词少了一个 t)。没有人在已抓到的评论里核对 ISO 数量或拍卖价格;价格未披露这一点来自 Film Stories 的正文。

专有名词解释

  • Tippett Studios / Phil Tippett:伯克利的定格与特效公司及其创办人。文章用 Star Wars、RoboCop、Starship Troopers 举例说明其作品被用进过哪些电影。
  • ISO:整张光盘的镜像文件。捐赠说明写馆藏主体是 90 张不重复光盘的 ISO,而不是已经拆开的单张图片。
  • Internet Archive:文章所说的上传目的地。馆藏标识是 tippett-archive。
  • textfiles / discmaster:评论里用来类比的旧软件与光盘目录。那条检索链接把工作室名字拼成了 tippet。

HN 讨论:thread · 13 分 · 2 评

5. Self-hosted HTTP tunnels with SSH and Nginx

背景介绍
Vincent Bernat 于 2026 年 10 月 3 日发表 Self-hosted HTTP tunnels with SSH and nginx。场景是:朋友要看只跑在 localhost:8080 上的草稿。文章先把现成办法分成三类:ngrok、Cloudflare Quick Tunnels 这种商业服务;frp、localtunnel 这种能自己搭、但要专用客户端的;以及只要普通 SSH 客户端、却依赖特定 SSH 服务端的 sish。他要的是只用已经在服务器上的 OpenSSH 和 nginx。

步骤是:ssh -R 把远程端口转到本机服务,远程端口写 0 时由服务器分配空闲端口;nginx 再把 https://p<端口>.ssh.luffy.cx 代理到本机该端口。*.ssh.luffy.cx 需要 DNS 和 Let’s Encrypt 通配符证书。文中的 ACME DNS-01 用的是 Route 53 上的 acme.luffy.cx,证书由 NixOS 自动拿。文章接着说,端口本身熵不够:内核从本地端口范围里分配,而且更偏向奇数端口,等于再少 1 bit。于是用 nginx 的 ngx_http_secure_link_module,对过期时间、端口和一个密钥做 MD5,把 base64 哈希和过期时间放进 URL 的用户名(域名不区分大小写,放不下这个哈希)。示例形态是 https://<哈希>--<过期时间>@p41535.ssh.luffy.cx/。哈希不对返回 401,过期返回 410,因为以后的会话可能重新用到同一个端口。文章自己写,MD5 偏弱,但就这个用途够用;也警告这套配置会把监听在 127.0.0.1 或 0.0.0.0 上的任意 TCP 端口暴露给持有密钥的人,从而绕过多数防火墙规则,并建议把 server_name 收紧到临时端口范围。

因为 OpenSSH 不会把分配到的端口放进环境变量,后半篇是一个装在服务器上的 http-over-ssh 辅助脚本:沿着 sshd-session 进程找出在听的端口,再印出 URL。OpenSSH 9.8 起会话进程叫 sshd-session,更早版本要找 sshd。查端口需要 sudo,因为降权后的进程被内核标成不可转储,ss 否则看不到套接字属于谁。脚本和一份 NixOS 模块放在他的 nixops-take1 仓库。

主要讨论方向与观点
toomim 更想要跑在 iroh 上的 HTTPS:不转发端口、不需要公网 IP、也不另搭代理;两台机器经 iroh 的公共中继对上信号,再直接连。评论里提议的 URL 方案名叫 irohttps://,并贴了 iroh-webproxy 和 iroh-proxy-utils。aliasxneo 说自己在做的 DNTLS 也想覆盖这件事,并认为 Tailscale、Cloudflare 这类服务把隧道做得很方便,但「自建」的边界被抹糊了;理想是完全没有中间人。guessmyname 问:既然是自建,为什么还要 *.ssh.luffy.cx 这种第三方名字。benatkin 回复:换成你自己的域名。gonzalohm 倾向于只给装了指定客户端证书的浏览器提供内容,并指出手机浏览器常常处理不好证书。esseph 欣赏「已经有的技术就拿来用」,同时指出没有代理的自建要把端点暴露出去,防御手段往往更少。snehesht 写自己在做用户态 WireGuard 的类似东西,还没贴出代码。

专有名词解释

  • SSH 远程转发(-R):让 SSH 服务器上的一个端口接到你笔记本的 localhost。端口写 0 表示由服务器挑一个空闲端口。
  • secure_link:nginx 用来核对链接签名的模块。本文用它检查 MD5、过期时间和端口,不把「知道端口号」当成唯一秘密。
  • ngrok / Cloudflare Quick Tunnels / frp / localtunnel / sish:文章开头用来对照的现成隧道。前两个是托管服务,frp 和 localtunnel 要专用客户端,sish 则要特定的 SSH 服务端。
  • iroh:评论里提出的替代路线。说法是先经公共中继交换信号,再在两台机器之间直接加密连接,从而不用自己做端口转发。

HN 讨论:thread · 46 分 · 11 评