0%

2026-10-09 抓取时,Hacker News 首页前五按 Firebase topstories 的顺序排列,不按分数重排。前四条都在 260 分以上:Cactus 的端侧语音模型 Whistle、可以走进 Elizabeth Holmes 办公桌的 Theranos World、一篇问业界为何没有对 DeepSeek 4.1 Flash 紧张起来的个人博客,以及 Dexerto 转述的智能咖啡机流量帖。第五条分数低一些,是 Ken Arneson 2015 年的随笔,谈闲聊为什么不能省。分数和评论数是这一次抓取的快照。

1. Whistle: Speech to Text in 16.9 MB

背景介绍
Cactus 博客在 2026 年 10 月 2 日发布 Whistle,署名 Jakub Mroz 与 Henry Ndubuaku,页面标为 6 分钟阅读。Hugging Face 模型卡的引用还列出 Karen Mosoyan、Noah Cylich、Satyajit Kumar、Parkirat Sandhu、Roman Shemet 和 Justin H. Lee,单位写的是 Cactus Compute, Inc.。模型卡许可为 Apache-2.0。页面称它是给手机、可穿戴设备、机器人、智能家居、汽车和微控制器用的语音识别模型:一个 16.9 MB 文件,在 CPU 上跑,没有额外依赖,和 Needle 用同一套 C++ 引擎、同一个容器和同一套量化。同一站点导航里的 Needle 3 宣传语是 8–29 MB 的小设备基础模型,和 Whistle 的 16.9 MB 不是同一个数字。

它在设备上做三件事。转写:16 kHz 单声道,一次最长 30 秒,语言为英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语;除非指定,否则自动检测语言。词级时间戳:每个词有起止时间和概率,从解码器自己的注意力对齐。语音嵌入:编码器输出,每 80 ms 一帧,可以不解码成文本。页内沙盒写明,第一次按下麦克风会下载这 16.9 MB,音频不离开设备。静音低于阈值时返回空文本和空语言,不进入束搜索。

结构按页面的描述是这样。前端把音频切成 25 ms 窗、10 ms 步长、80 个 log-mel 频带,频带限制在 250–3500 Hz,并按通道归一化;30 秒对应 3000 帧。卷积 stem 为 128 通道、kernel 9,三次减半后剩 375 帧。编码器是 8 个 Simple Attention 块,页面写这些块跑的是 Needle 的代码,不是一份拷贝:4 条 mHC 残差通路,前馈网络换成 Monarch Hadamard MLP,注意力不是因果的。解码器是 8 个宽 512 的 Laddered Simple Attention,GQA 为 8 个 query 头对 2 个 KV 头,query/key 48 维、value 64 维,QKV 上有 3-tap 因果卷积,第 3 层和第 7 层做 engram 查找(18,432 个槽)。每一层再加一次门控交叉注意力;K 和 V 在音频进来时投影一次,5 条束搜索因此不必把音频重跑五遍。束搜索用长度归一化的对数概率打分。关键词偏置用 Aho-Corasick 自动机抬高指定短语的对数概率。词表是 8,192 个文本片段加 7 个语言 token,转录上限 320 个 token。--audio-depth 可以从 2 层起选择解码器深度,编码器始终跑满 8 层。

基准图的文字说明写:词错误率越低越好;缺条表示该模型的作者没有发表过这项。Moonshine 只有英语。Whisper 没有公布 SPGISpeech、Earnings-22 和 AMI cleaned;Whisper 的 AMI 数字是 AMI-IHM,和另外两个模型用的 AMI 子集不同。正文的结论是:Whistle 在 LibriSpeech 的 test-clean、test-other、SPGISpeech、Earnings-22 和 FLEURS 平均上领先;Whisper base 在 TED-LIUM、AMI 和 MLS 平均上领先,体积是 145.3 MB 对 16.9 MB。图表旁边的 HTML 文本没有逐项词错误率,本文不补这些百分比。体积、首 token 时间和解码速度有文字数字,测的是 Apple M4 Pro CPU 上 10 秒音频,各模型用官方运行时的默认设置:Whistle 的 C++ 引擎、5 条束;openai-whisper;moonshine-voice 对整段音频做非流式。首 token 时间是从音频进入到第一个 token。解码速度是其后的 token 数除以墙钟时间,编码器不重复计入。

Whistle Whisper base Moonshine tiny v2
体积 16.9 MB 145.3 MB 41.9 MB
10 秒音频的首 token 11.1 ms 73.2 ms 22.8 ms
解码 1,319 token/s 266 token/s 262 token/s

导语把首 token 写成 11 ms。正文还写 Whistle 随片段变长:5 秒 5.9 ms,10 秒 11.1 ms,30 秒 36.3 ms。Whisper 会把输入填到 30 秒,所以它的首 token 时间不随片段变。词错误率用 Whisper 的 normalizer 计分。Whistle 测了 86,174 条语音。Whisper 和 Moonshine 的数字是作者公布的多语言检查点,不是英文专用检查点。页面称,对照过音频校验和与说话人 ID 之后,报告过的测试集没有出现在 Whistle 的训练或验证数据里。模型卡补了精度:Whistle 为 2 到 4 bit,Whisper 在 CPU 上以 fp32 留在内存里,Moonshine 为 int8。模型卡还写,AMI 按 Open ASR Leaderboard 的惯例包含空参考;TED-LIUM 排除语料指定不评分的时间段;FLEURS 和 MLS 在 Whistle 的七种语言上平均,其中 MLS 是六种、不含英语。这些对比是 Cactus 的表和说明,本文没有重跑。

同一份引擎用 needle_load 读 .cact 文件,所以一个二进制可以只做语音、只做文本,或两个一起做。第三个用法是 needle_complete 直接收片段:引擎转写,再按调用方的工具表回答,返回一个 JSON,里面有函数调用和以 audio_ 开头的语音字段。安装是 pip install cactus-needle。16 kHz 的 WAV 或原始采样用基础安装即可;其他采样率和麦克风需要 [mic] 附加项,会带上 soxr 和 sounddevice。keywords 在搜索时抬高这些短语的对数概率,language="de" 则强制语言。权重在 Hugging Face,引擎和平台目录在 Cactus-Compute/needle3,源码仓库是 cactus-compute/needle。页面写引擎为十七个目标提供了预编译,举例包括 macOS、Linux、Android、iOS、watchOS、Windows on ARM、RISC-V、MIPS、浏览器和 WASI component,正文没有把十七个名字列全。语音相关的 C API 是 needle_load、needle_transcribe 和 needle_embed。引擎不读环境变量。

主要讨论方向与观点
讨论分成「自己的句子上准不准」和「它适不适合当通用听写」。skolos 用它接管 Echo Show:不再拨去 Amazon,本机 CPU 处理,并接到 Home Assistant。对照是 RTX 5080 上的 Qwen ASR 1.7B。170 条消息里 Qwen 对了 168 条,Whistle 对了 70 条。他把 Whistle 收成类似 Jev 的模板识别,用 10,000 条生成语音训练一个小网络,把 Whistle 的最终状态映射到模板概率,精度到 164/170。他写自己口音很重。这些是他这次实验的计数。

INTPenis 认为难点不是二进制大小,而是听懂口齿不清的人。他上周给 84 岁、中风后嘴部下垂的父亲装了 Windows 语音输入,一页字大约 10 分钟,但嘴里的每个声音都会上页面。albert_e 指出页内演示要等按下停止才出字,认为多数实时听写需要边说边出。wkcheng 拿它和自己在 M 系列 Mac 上用的 Parakeet 比,问精度;jwr 回复说 Parakeet 比 Whisper Large 差,自己做听写最后还是优化 Whisper Large,再接到本地 Qwen 3.8。zimpenfish 用一集电视剧试,说它会卡住并反复输出 “Thank you.”,有一次对着大约 60 秒对白一直出这句。andy_ppp 说自己用英语故意找错,它仍然听对了。flowerlad 用一句带 ASP.NET 和 .NET 10.0 的技术口语句子对比,写 Whistle 对了、iOS 信息里的听写不对。nialv7 只留了一句,认为发布说明没有找人来写;页面本身署了上面的作者名。

专有名词解释

  • Needle / .cact:Cactus 的小设备文本模型,以及它和 Whistle 共用的模型容器。Whistle 复用 Needle 的块、量化和引擎,而不是另带一套运行时。
  • log-mel:把波形变成对数梅尔频谱再送进网络。这里是 80 个频带、250–3500 Hz。
  • mHC、Monarch Hadamard MLP、engram、GQA:页面用来描述 Simple Attention 的内部件。mHC 是 4 条残差通路;前馈被换成 Monarch Hadamard MLP;engram 是第 3、7 层上 18,432 槽的查找;GQA 是 8 个 query 头共享 2 组 KV 头。
  • Aho-Corasick:同时匹配多条关键词的自动机。Whistle 用它在束搜索里抬高指定短语的分数。
  • WER:word error rate,词错误率,越低越好。页面没有在 HTML 文本里给出逐项百分比。
  • Whisper base / Moonshine tiny v2:对照模型。体积和速度见上表。Whisper 的 AMI 数字标明是 AMI-IHM。
  • Parakeet:评论里拿来比较的另一种本地语音模型。精度比较来自评论者自己的使用,不是这篇发布页的表。

HN 讨论:thread · 522 分 · 118 评

2. Theranos.world

背景介绍
首页几乎是一个可点击的办公室场景,正文很少。页面描述写:这是 Elizabeth Holmes 办公桌的互动模拟;可以打开她的 MacBook、翻她的 iPhone、运行 Edison 机器;每段文字和邮件都是真的,来自法庭审判,由 Extend 解析。社交卡的创作者是 @bolau_。场景文案包括以 Elizabeth Holmes 登录、不需要密码(点击 Log In,或按 Return / 空格),以及坐下、站起、拖动环顾、捏合缩放。样式表文件名里有 mac-elcapitan 和 phone-ios9,界面按 2015 年前后的 macOS 和 iOS 来做。本文只读了页面 HTML 和下面的评论,没有逐封打开场景里的邮件。

HN 提交者 kbyatnal 在评论里以「我们」回复:用 Extend 解析了全部 Theranos PDF filings,想要一个好玩的方式把它们可视化。另一条回复写,A24 是他们的客户,所以要在旧金山办一场观影会,并用自己的 API 解析这些 PDF 来做这个体验。页面描述写的是「法庭审判」,这条评论写的是「PDF filings」。Extend 官网标题是 “Document Processing Infrastructure for AI Agents”,描述为解析、抽取和拆分文档。首页上的基准百分比是 Extend 自己的宣传数字,和这个场景无关,这里不展开。

主要讨论方向与观点
线程把这个站同时当成 Flash 时代那种可玩广告,和一家文档公司的内容营销。lukasschwab 说 Extend 的营销埋得很顺。neom 写成「给 agent 做文档基础设施」的创业公司内容营销,并说他们想让人去旧金山的活动报名。kbyatnal 的回复就是上面那段:A24、观影会、用 API 解析 PDF。binlog 觉得它更像在给 Elizabeth Holmes 的纪录片做宣传,而不是在宣传他们自己。

场景细节也有人挑。baggachipz 说 iPhone 的 Notes 里有一条 “msg me on X”;他指出当时那个产品还叫 Twitter。binarymax 说笔记本的 Notes 里埋了一把 API key;daemonologist 回复那把 Extend 的 key 是无效的。tclancy 说随机听到一首 Sparklehorse。这些都是评论者点进场景后的描述,本文没有再打开对应界面核对。regus 把它比作 Adobe Flash 年代的促销网站。dijit 则觉得现在的 macOS 和 iOS 界面比那时差。lisp2240 记得 HN 在骗局曝光后很久仍有过对 Holmes 的追捧,觉得这条出现在这里很怪。kokanee 从 lidar 和 iCloud 备份联想到把真实生活做成可进入的快照。

专有名词解释

  • Theranos / Elizabeth Holmes / Edison:Theranos 是 Holmes 创办的血液检测公司,后被认定欺诈。Edison 是页面描述里可以操作的那台检测设备;本文没有从法院卷宗重述案情。
  • Extend:extend.ai,官网自称为 AI agent 做文档处理基础设施。这个场景的页面描述和提交者评论都说材料是用它解析的。
  • A24:评论里 kbyatnal 称为自己的客户、并要一起办观影会的那家制片公司。观影会的日期和片名不在这条评论里。
  • El Capitan / iOS 9:2015 年的 macOS 和 iPhone 系统。这里只说明样式表文件名指向那一代界面,不是一份系统模拟器的兼容性声明。

HN 讨论:thread · 262 分 · 112 评

3. Why isn’t the industry freaking out about DeepSeek 4.1 Flash?

背景介绍
这是 Jono’s Corner 上 2026 年 10 月 7 日的一篇个人博客,标签为 tech,站点用 Eleventy。关于页只署名为 Jono,没有展开职务。HN 提交者是 jonotime。文章是使用体验,不是模型卡。

作者写自己大约一个月里、在十几个项目上大量使用 DeepSeek 4.1 Flash。他的主观感受是:能力很强,比他所说的 frontier 模型便宜几个数量级;会话进行到一半时,如果不看模型名,分不清自己在用 DeepSeek 还是 Opus。他不在意没有 4.1 “Pro”,因为这个模型的表现让他把它当 frontier 用。文中链了 OneShotLM 的模型页 和 Artificial Analysis 上 Opus 5.5 与 DeepSeek V4.1 Flash 的对比。本文没有再打开这两页核对分数。

他的问题是:frontier 实验室为什么没有紧张起来。他认为中国实验室可能落后 Anthropic 和 OpenAI 一到两个月,但这些蒸馏出来的中国模型能做同样的工作。关于训练数据,他用 “they stole Claude’s training” 链到 2026 年 2 月 23 日的一篇 TechCrunch,并写 Anthropic 也从别人那里拿过数据,然后声明自己不展开数据归属。本文没有打开那篇 TechCrunch。

后半篇是成本和习惯。他认为现在的模型已经够好,可以做高质量的无人值守任务,追最新模型没有必要。他的 OpenCode Go 订阅是每月 10 美元,在这个价位上 DeepSeek 对他来说基本不限额。随便跑任务、做探索性的界面测试,他写一次大约 0.003 美元而不是 1 美元;他很少让一个会话的预期花费超过 1 美元,有时会话会跑大半天。复杂规划和调研他也用 4.1 Flash。偶尔的关键任务才拉 Opus 5.5 做最终代码审查,再让 DeepSeek 去改。他写 GLM 看起来和 DeepSeek 是同一路;换 Opus 或 GLM 更多是换一双眼睛,而不是因为能力不够。

缓存一节是作者的说法:相对他们的 V1,DeepSeek 把 KV cache 缩小了大约 437 倍;长编程会话的一大块成本是把这份缓存放在 GPU 内存里,所以他的全天会话能停在 1 美元以下。他接着推断这对环境更好,Claude 的缓存意味着 DeepSeek 一定更省水和电。这是推断,文中没有给出电量或水量测量。同一句 “cache magic” 链到 insufferable.dev 的一篇文章,用来说明 Opus 5.5 也得到过效率提升。本文没有打开那篇。作者写自己的工作提供 Claude、Cursor 等订阅,他在乎的是长期、可持续,以及高能力模型是否变得用得起。他批评只认高价的行业习惯,并链了 yegge.ai 上一篇关于把多份 Claude Max 订阅做负载均衡的文章,以及一条抱怨拿不到更多额度的帖子。对自托管者,他的结论是:若目标是省钱,4.1 Flash 的价格让自托管收不回成本;若目标是隐私,可以等这些缓存优化进本地。他写 4.1 Flash 在技术上已经可以自托管,实践上还不行。

主要讨论方向与观点
最高的几条评论把「便宜」放回订阅补贴和显存里看。vishvananda 认为大家没紧张,是因为多数人在用被大幅补贴的订阅。他在 OpenRouter 上选了最便宜的提供方,几天烧掉 50 美元;质量还行,他感觉也许略高于 Luna。这 50 美元是他 Codex 订阅的四分之一,而在那份订阅的每周重置里,他用 Astra 可以烧掉同样多甚至更多 token。他的判断是:补贴还在时,开放模型翻不了盘。mlinsey 也说自己付的是打折订阅而不是 API 价,所以个人没有明显价差。他比较过每月 100 美元的 Z.ai 订阅上的 GLM 5.3,和每月 100 美元 Claude 订阅上的 Opus 5.5,用量差距不大,并认为 GLM 5.3 明显不是 frontier;DeepSeek v4 感觉更接近,但他用得不够,不能对自己的工作量下结论。他不认为这些订阅是负毛利,而把价差看成价格歧视,并怀疑不能因为 API 标价更高就说西方实验室的环境影响更大。

用过一段时间的人把分工说得更具体。gregwebs 写自己也密集用了一个多月:整天跑大约 1–2 美元,速度快;以前在每月 20 美元的 Claude/Codex 计划上会很快撞上 5 小时窗口。他同时写 DeepSeek 不擅长他用来做技术决定的 grilling 会话,解释得不好,方案也不如 Opus/Sol。他把它用在编排、验证改动、探索代码或搜索,以及写代码库调研。以前是 Opus/Sol/Astra 做计划、DeepSeek 写代码、再由前者审查;Opus/Sol 降价之后,他改试让它们自己写,以减少来回审查。这些代理跑在 Pi 里,扩展是 @tintinweb/pi-subagents。他认为 Luna 价格有竞争力,但智能不够他的大部分用途;Haiku 的价格性能也不够看。p1necone 在一个新语言加编译器的项目里试过让 DeepSeek-V4.1-Flash 同时当编排者和实现者,代码审查代理用 MiMo v2.6 Flash。相对原先的 GLM-5.3 编排,他感到质量掉得不能接受:决策漏上下文、不讨论就拿出新设计、文档又长又散。规格写清楚的实现任务则没问题,所以编排又改回 GLM。lmf4lol 把个人助理默认放在 Flash(thinking high)上,更难的子任务再交给 GLM-5.3 写代码或 Kimi K.3 做研究和挑错,并说账单下降很多。hmontazeri 写自己做 Web 开发时几乎不再需要更强的模型,取消了 GPT 订阅,暂时留着 20 美元的 Claude。codeprimate 则说大约两周前从 DeepSeek 4.1 Flash 换到 MiMo 2.6 Pro,在他的 Hermes 系统管理和编码代理上智能更好、总花费更低,并链了 Artificial Analysis 的 MiMo 页。

另一边认为文章把差距说小了。user43928 写,这些开放模型仍没有打过 2 月的 Mythos / Fable 5;DeepSeek 4.1 Flash 落后于 GPT 5.6 Sol,而 Opus 5.5 又把 Sol 甩开。他接着说有传言 Anthropic 把更大的 Fable 5.5 留到 IPO。这是评论里的时间表和传言,不是 DeepSeek 或 Anthropic 在这篇帖子里的公告。xzjis 写,标价低被用量抵消:同样的任务 DeepSeek 4.1 Flash 用的 token 是 GPT-6.1 Sol 的 10 倍,结果还更差,所以每 token 便宜 10 倍并没有好处;同时 OpenAI 和 Anthropic 每月 100 或 200 美元的订阅给出的 token 远多于 API。10 倍是这条评论的说法。giancarlostoro 列出自己估算的显存:FP16 约 1,664 GB、INT8 约 832 GB、INT4 约 416 GB,并配了集群例子。这些数字出现在评论里,本文没有对照官方模型卡。

专有名词解释

  • DeepSeek 4.1 Flash / V4.1 Flash:文章标题和正文用 4.1 Flash;评论和 Artificial Analysis 链接里也写成 V4.1-Flash。本文没有另找一张参数表。
  • KV cache:推理时留下的键值缓存。作者说相对该系列 V1 大约缩小 437 倍,并据此解释长会话为什么便宜。437 倍是这篇博客的数字。
  • frontier:作者用来指 Opus 一类当时最强的闭源模型,文中没有给排行榜定义。
  • OpenCode Go:作者写自己每月 10 美元的那份订阅。额度规则以他的描述为准。
  • Luna / Sol / Astra / Opus / GLM / Haiku / Kimi / MiMo:评论里拿来比价格或分工的其他模型。谁更强、谁更便宜,各条评论并不一致。
  • grilling:gregwebs 写的是 /grill* 技能,用来逼问技术决定。DeepSeek 在他的使用里不擅长这一步。

HN 讨论:thread · 395 分 · 333 评

4. Man discovers his parents’ coffee machine used 1TB of data in 10 days

背景介绍
Dexerto 这篇由 Joe Pring 撰写,页面时间是 2026 年 10 月 7 日 16:07。它转述的是 @NomadsGalaxy 在 2026 年 10 月 6 日发的帖。fxtwitter 返回的原文是:招呼 @Keurig,问咖啡机到底在上传什么,让他再核对一下;十天 1TB;他立刻拔掉插头,并要给父母换一台。显示名是 Nomad,简介写 Technical Field & Community Specialist @Prusa3d。帖子附了一张网络客户端面板的截图。截图上的设备名是 Keurig-20CE2A28C5CE,旁边有 c5:ce;状态行是 “Disconnected from Appliance”;下行 9.94 GB,上行 1008.45 GB;Last Seen 为 Oct 5 at 9:32 PM,时长 10d 9h,信号 -64 dBm。界面没有标时区。1008.45 GB 就是帖子里的大约 1TB,方向是这台设备发出去的流量。fxtwitter 抓取时,这条帖大约 24,730 次点赞、1,239 次转发、539 条回复、约 242 万次查看。

Dexerto 写,帖子传开之后 Nomad 又做了解释:他做 IT 超过十年,决定再查;1TB 里的大部分留在父母家里的网络,没有送到互联网上。报道引用他的话:“This is likely a bug with this unit.”“It did saturate my AP, that sucked.” 也就是这台机器很可能有 bug,并且把无线接入点打满了。他考虑过继续挖它到底在做什么,然后认为不值得让一台会这样打满网络的物联网设备继续连着。咖啡机是父母的,他远程帮他们管网络,并不审查他们买什么。本文打开了原始帖和这张截图,没有打开后续回复,所以上面关于局域网和 bug 的说明来自 Dexerto 对 Nomad 后续解释的转述。

主要讨论方向与观点
技术争议集中在这 1TB 算什么。altairprime 概括说,推文线程里当事人确认两件事:打满的是本地网络,大约 1TB 的元数据嗅探扫描,不是到外网的上行;以及按 Keurig 的说法,机器在收集家庭数据以便卖给广告商。后面有人按这个概括表示惊讶,觉得 Keurig 直接承认了。Dexerto 的引语覆盖了「大部分留在家庭网络」和「很可能是这台机器的 bug」,没有写广告售卖。广告动机在这里只作为 altairprime 对线程的转述。doublepg23 补了一句:截图是 UniFi 面板,而这种面板以把带宽算错出名。这是评论者的判断。截图的布局确实是客户端详情(设备名、上下行、dBm、Last Seen),本文不能据此裁定 1008.45 GB 有没有被重复计算。

其余方向是该不该买会上网的咖啡机。jakub_g 问,走路按按钮和等一分钟,有什么必须做成智能的。eek2121 写自己有三台不会上网的 Keurig,并认为买了能连 Wi-Fi 的电器就等于租用:隐私或者订阅由厂商决定,厂商也可以以后把机器停掉再收费。BLKNSLVR 的做法是单独 VLAN、无线隔离、断开外网,并且只买能进 Home Assistant 的设备,然后问普通人有什么办法。drop_the_mike 设想用树莓派伪装成许多设备,往这类数据集里灌随机回应。alexpotato 写了自己家里的端口镜像:烤箱用明文 HTTP 向一台 EC2 发保活,这是他另一台设备的观察,不是这次咖啡机的抓包。

专有名词解释

  • 1TB / 1008.45 GB:原始帖的说法,以及截图上的上行数字。Dexerto 转述的后续说明是,其中大部分留在家庭局域网。
  • AP:无线接入点。Nomad 经由 Dexerto 说,这台机器把 AP 打满了。
  • UniFi:Ubiquiti 的网络管理界面。评论者认为截图来自这里,并提醒它的用量统计可能不准。
  • VLAN / Home Assistant:把物联网设备隔到单独虚拟局域网,以及用本地的 Home Assistant 控制设备。这是评论里的应对,不是这台咖啡机的功能。
  • Keurig:被 @ 到的咖啡机品牌。本文没有看到 Keurig 官方回复的原文。

HN 讨论:thread · 380 分 · 237 评

5. The value of not getting to the point (2015)

背景介绍
Ken Arneson 的这篇随笔写于 2015-11-06 9:42,页面标题是 The Value of Not Getting to the Point。HN 标题加了年份。标签是 Human Nature、Language、Personal、Philosophy、Technology、Vulnerability and Trust。

他从一句记不清出处的话写起:人们约出来喝一杯、喝咖啡或吃饭,食物和饮料的作用是让人不必整场都有话要说。他以前以为午餐的目的就是午餐,也以为自己作为内向的人不善交谈,而别人都很轻松。女儿当时是大学新生,发短信说想谈谈。他问谈什么,女儿因此不高兴,并说能不能先聊点蠢的。他打过去,先聊了很久 Donald Trump 和总统竞选,没有问真正烦她的事。大约半小时后,谈话才转到她想说的那件事。文章没有写出那件事是什么。

他把这理解成:敏感话题需要一段预热。他自己习惯直接说重点,或者干脆不说。语言不精确,感受常常没有直接对应的句子,人还会给感受找理由,而这些理由往往并不连贯。说话有社会代价,所以文化里有闲聊、咖啡这一类仪式,用来先建立足够的信任。他写自己活了将近五十年才把这件事说清楚,并认为别人多半是直觉上知道,而不是曾经把它说出来。接着他把 Twitter 当时的 140 字限制看成这个仪式的反面:它逼人直接说重点,没有闲聊和喝咖啡的位置,于是线下仪式本来要挡住的问题会涌进来。网上关于什么该说、该怎么说的争执,可能是因为在线谈话的文化和承载它的平台还没进化到像线下那样能用。他准备以后把对自己不明显、对别人也许很明显的事直接写出来,并为此可能浪费觉得这很显然的读者的时间。文章结尾承认,自己绕了这么一大圈,似乎也是因为需要这段预热。

主要讨论方向与观点
不少回复接受「先热身再谈正事」,但各自换了框架。nine_k 把它比作两台调制解调器建链:先交换可预测、没有惊喜的信号,用来看线路和对方支持什么;省掉这一步、直接说重点,可能让整次沟通失败。paimapi 更愿意把它看成情绪上的成熟,而不是修辞技巧:你不知道对方今天过得好不好、有没有想通、道德和意识形态停在哪里,开头的来回是在画这张地图,也是在看对方会不会否定你的经验。他写自己并不觉得闲聊使人恢复精神,以前觉得浪费时间,后来能接受对方还停在不舒服的经历里,即使这意味着自己无聊几分钟。momojo 感谢有人把这篇十一年的文章挖出来,并说人往往比他们的观点更有意思;工作之外只想要一个词的答案,会变得很抽取式。文中「将近五十年」是 2015 年作者对自己年龄的说法。

也有人认为这套仪式换了场合就失效。tyg13 写,网上缺的不是不着边际的谈话,而是社区:和没有连续关系的陌生人做闲聊,信任没有地方可投;他多年的在线评论没有换成一段持久关系。没有这层关系时,绕圈子只是给别人更多机会打断或错过重点。charcircuit 把女儿那条短信看成 asking to ask,认为半小时可以收成一分钟的文字。austin-cheney 描述的是相反的写作习惯:新闻体把更重要的话放在前面,军队里叫 BLUF,先说目标,只在被追问或和目标冲突时再补细节。jhallenworld 说这在荷兰人那里 famously 不是一回事,并链了《约翰·亚当斯》里会见荷兰人的一场戏。yipinwong 把作者读成很晚才理解破冰的人,认为办公室里由这种人来设计破冰练习会很危险;这是对作者性格的判断。hirako2000 问她到底想谈什么,文章没有回答。

ahyattdev 提醒趁还能打开时读:三级 .name 域名将由 Verisign 在明年停用,并链到维基百科的对应小节。该小节写,ICANN 在 2026 年 7 月 28 日批准了 VeriSign 停止三级域名注册和配套邮件转发的请求,既有注册将由 VeriSign 单方面终止。小节正文没有把终止日写成「明年」。评论里的「明年」是评论者的说法。.name 这个顶级域本身仍在;停的是它下面的三级注册。

专有名词解释

  • Dunning-Kruger:作者用在自己身上的说法:人会在某件事上无能到不知道自己无能。这里指他不理解女儿为什么不想被问「谈什么」。
  • grokking:作者用来表示直觉上懂了,而不是能把一条事实说出来。词来自 Heinlein,文章没有再解释来源。
  • 140 字:2015 年 Twitter 单条帖子的长度上限。文章认为这个上限挤掉了闲聊。
  • BLUF:Bottom Line Up Front。austin-cheney 的评论用它指先说结论。这和文章作者自认的习惯相同,和文章主张的预热相反。
  • .name:面向个人姓名、昵称和化名的通用顶级域。维基百科上述小节讨论的是三级域名注册和邮件转发的停止,不是整个顶级域下线。
  • asking to ask:先问「能不能谈」,而不是直接把事情说出来。charcircuit 用它描述文中那条短信。

HN 讨论:thread · 114 分 · 38 评

今日 Product Hunt 热榜对应太平洋时间 2026-10-08 日榜(上海时间 10 月 9 日上午抓取,太平洋时间当日尚未到午夜,名次和分数仍可能变化)。榜单页上的数字是抓取时的当前分数和评论数,前十按该页分数从高到低排列。前半段是把一群 Agent 放在同一块桌面上、把 SEO 数据接进 Agent,以及更便宜的小模型;中段是用真实电话给语音模型打分、在口语课里加上白板,以及让观测平台自己做事故调查。后半段是把 Claude 放进 Google 文档、表格和幻灯片,给线上应用做调查并开修复 PR,在终端里用套餐自带的模型改代码,以及一只跟着敲击的 Mac 桌面宠物。按日榜页顺序,前五是 OpenSwarm、OpenSEO、Claude Haiku 5.5、Cekura Bench 与 ChickyTutor,后五是 KloudMate 2.0、Claude for Google Workspace、Polylane for Vercel、NOVA CLI v1.0 与 Paw-Paw。

1. OpenSwarm · 官网

标语:A swarm of agents, in the same place you work

背景
OpenSwarm 日榜第 1,发布页标为免费,公司信息写 Launched in 2026,官网外链为 openswarm.info。发布说明把它写成 AI-first 的操作系统:应用自己长出来,浏览器自己操作,一群 Agent 一起干活;你从一次只做一件事,变成同时编排几十件。官网的说法更具体:这是一块桌面,多个 Agent 同时工作,每个有自己的浏览器、应用和工具,你可以在同一张画布上看它们、中途插手,再拿走做完的结果。页面上的例子包括一次提问打开六个浏览器、按描述生成一个应用并放进启动器、用多个来源验证一个问题,以及给线索准备第一封邮件。发帖回复的是 Eric F Zeng;Alex Dakhli 也以 OpenSwarm 身份发言。抓取时日榜页上的当前分数约 317、评论约 51。

产品要解决的问题
一个人和一群 Agent 工作时,上下文散在十几个聊天窗口里。能拆开的任务如果还是串行做,时间就花在等待和来回粘贴上。

产品市场分析
发布页标签是任务管理、开发工具和人工智能。变现信号是发布页标 Free。Eric 回复,私人测试期免费:可以用自己的 Claude、ChatGPT 或 Gemini 订阅,也可以填 Anthropic、OpenAI、Google、OpenRouter 或自定义路由的 API key。这次没有抓到测试期之后的价目。Eric 回复,它适合能拆成独立片段的工作,并且更偏向写,不只是读:同时研究十家公司再并成一张对比表,或让不同 Agent 分别做页面、数据和测试。一步依赖上一步的流程,他写一只 Agent 更合适。有评论者写自己用它跑广告,PPC 低于 0.20 美元、转化率 17%;这是评论里的说法,不是产品方公布的案例。对照是继续开很多个聊天,或把 Agent 一个个接到现有电脑上。

产品上下游
上游是你已经付费的模型订阅或自己的 API key,以及任务需要的应用。Eric 回复,它是跑在现有操作系统之上的桌面应用,不是裸机系统;今天有 macOS 和 Windows,还没有 Linux。已连接的应用不会默认对每个聊天打开,Agent 只拿到这次任务要用的。每个工具、每个应用里的动作可以设成 Ask、Allow 或 Never,也可以用只读模式。下游是画布上的结果:表格、临时做出来的工具、活动页,以及跨 Gmail、日历和 Slack 的活。向外的动作要等人批:Eric 回复,发邮件或跑敏感命令会停下来等批准,并有不同安全档。多个 Agent 可以共用一个文件夹,但不能悄悄覆盖别人的修改:编辑前必须先读文件,如果读完之后文件被别人改过,这次编辑会被拒绝,Agent 得重新读。他建议大的并行任务给每个 Agent 分开的项目或文件。看进度可以点开 Agent 卡片,也可以问任意一只其他 Agent 在做什么;停掉一只会连它的子 Agent 一起停。

2. OpenSEO · 官网

标语:The open source Semrush alternative

背景
OpenSEO 日榜第 2,是第 2 次发布,公司信息写 Y Combinator、Launched in 2026。发帖人是 Ben Senescu(@bensenescu)。他写 7 月第一次发布时项目刚起步,之后社区和产品都变大了,这次主打给 AI Agent 用的 SEO MCP(Model Context Protocol,让外部工具按约定读写产品的接口),并新加了 AI Visibility。产品页的介绍写:没有好数据,Agent 只能给泛泛的建议;关键词、竞品、外链和站点审计从每月 10 美元起,而不是一百多美元的月费。官网首页写连接 Claude、Codex、OpenClaw、OpenCode、Gemini,并列出 /seo-coach、/seo-audit、/keyword-research、/competitor-analysis 等技能。首页还写「Trusted by 3,000+ entrepreneurs」,这是页面上的说法。仓库在 every-app/open-seo。抓取时日榜页上的当前分数约 287、评论约 29。

产品要解决的问题
Semrush、Ahrefs 这类工具又贵又把界面做成升级推销。一个人或一个小团队优化自己的站时,付的是整座数据仓库的钱,Agent 也接不进去。

产品市场分析
官网定价页写一个 Base Plan,每月 10 美元,包含每月 10 美元用量;关键词研究、外链、竞品、站点审计、排名跟踪和 AI 可见度研究会计入用量,项目、设置和已经取回的数据不计。Google Search Console 的数据免费,不占这 10 美元。试用含 0.50 美元额度。用完可以买加量包,加量包不过期,但使用仍要有有效订阅;套餐内用量每周期重置。定价页的估算例子写:每月 100 次关键词搜索、20 次外链检查、50 个词每周跟踪,估算用量约 7.52 美元,落在 10 美元里面;同页把 Ahrefs Lite 标成每月 129 美元作为对照。自托管文档写应用本身 0 美元,数据费直接付给 DataForSEO,托管版在 DataForSEO 请求上加 28%。讨论里 Alex Marinov 写自己用它做 Stile 的关键词、竞品、博客规划和站点审计,也通过 Claude Code 和 Codex 用,并拿它查过约 50 页的元数据。有人问数据从哪来,Ben 回复用 DataForSEO,并链到 OpenSEO 与 DataForSEO 的差别。讨论里有人引用两边的关键词库规模,本文没有另行核对那些数字。有人问会不会做 GEO(generative engine optimization,让内容被 AI 回答引用);Ben 回复他们把 SEO 和 GEO 看成同一个产品。

产品上下游
上游是 DataForSEO 的数据,以及可选的 Google Search Console。自托管要自己的 DataForSEO API key。文档写新账号有 1 美元试用额度,最低充值 50 美元。两条自托管路径:Docker 适合自己的机器;Cloudflare 适合多设备或团队,文档写可以走 Cloudflare 的免费方案。Docker 模式的 AUTH_MODE=local_noauth,文档写不要直接暴露到公网,要放在自己的认证、隧道或私网后面。AI Visibility 还可以选填 OpenRouter key,用来做设置研究和提示建议,费用在检查前显示。下游是工作区里的关键词、报告,以及 Agent 技能读到的审计和竞品结论。官网写 Agent 会把学到的业务和写法存进项目上下文。MCP 接到 Claude、Cursor、ChatGPT 等;文档还写了 Claude Code 和 Codex 插件。

3. Claude Haiku 5.5 · 官网

标语:Anthropic’s fastest and most capable Haiku yet

背景
Claude Haiku 5.5 日榜第 3,公司信息写 Launched in 2026,外链指向 Anthropic 2026-10-07 的发布文。发布文称它是迄今最便宜、最快、能力最强的 Haiku 级小模型,面向大批量、对成本敏感的任务:摘要、压缩、数据库查询、分类,也可以当 Opus 5.5、Sonnet 5.5 的编码子 Agent,并适合客服和浏览器操作这类要速度的活。Product Hunt 发布页列出的要点包括:相对 Haiku 4.5,10 万 token 以内的提示价格低 90%;标准速度下是 Anthropic 迄今最快的模型;可调 effort(按单次请求在成本和智能之间取舍);通过 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 提供。模型 ID 写为 claude-haiku-5-5。抓取时日榜页上的当前分数约 281、评论约 5。

产品要解决的问题
小模型以前要在「够便宜能跑大量请求」和「够能干子任务、操作电脑」之间二选一。换一档模型往往要换整条工作流。

产品市场分析
对象是已经在用 Claude API 的开发者和把 Claude 嵌进产品的团队。发布文的价格表(每百万 token,斜线前是提示不超过 10 万 token,斜线后是超过)写:缓存读取 0.01 / 0.05 美元,缓存写入 0.125 / 0.625 美元,输入 0.10 / 0.50 美元,输出 0.50 / 2.50 美元。对照栏里 Haiku 4.5 为缓存读取 0.10、缓存写入 1.25、输入 1.00、输出 5.00 美元。脚注写:不超过 10 万 token 的请求比 Haiku 4.5 低 90%,超过的低 50%;Haiku 4.5 上约 90% 的请求落在前一档。同一脚注写 Haiku 5.5 换了分词器,同样的任务会多用一些 token,平均下来大约便宜 75%。另一条脚注写,它在各模型的标准速度下最快,但比 Fast Mode 下的 Opus 慢。同一篇发布文还写了两件旁边的价格改动:Sonnet 5.5 的缓存读取从每百万 token 0.20 美元降到 0.10 美元,发布文估计多数 Agent 工作因此便宜约 20%;本周起 Max 和 Team 订阅会有每月 API 额度,Max 5x 为 100 美元,Max 20x 为 200 美元,Team 最多 500 美元、在用户之间共用,可用于任意模型。讨论里有人在意 effort 可以按请求调,而不是先选定一档模型;有人问 effort 对延迟的影响是否和成本一样大,这次抓到的回复里没有对应答案。发布文引用了 Asana、HubSpot、AlphaSense、Box 等客户的早期测试说法,例如 HubSpot 写在其 CRM 套件上三次平均 92.8%,AlphaSense 写「Ask in Document」400 条查询上 0.84 对 Haiku 4.5 的 0.76。这些是 Anthropic 发布文里的客户引言。

产品上下游
上游是 Claude Platform 和三家云上的同一模型,以及现有的提示、工具和子 Agent 编排。发布文写 Python 与 TypeScript SDK 增加了 beta 的电脑操作和浏览器操作。下游是摘要、分类、客服回复、浏览器步骤,以及更大模型手下的子任务。安全部分写:对齐评估相对 Haiku 4.5 有改进;网络安全防护比 Haiku 4.5 更严,但比近期其他模型略松,允许比 Sonnet 5.5 更宽的防御性任务,仍会挡住渗透测试一类更可能被攻击者使用的技术。生物安全防护与 Sonnet 5、Sonnet 5.5、Opus 5 相同。更宽的生命科学或网络安全用途要申请对应的验证计划。迁移细节在发布文指向的迁移指南里。

4. Cekura Bench · 官网

标语:Speech-to-speech model benchmarks on live phone calls

背景
Cekura Bench 日榜第 4,挂在 Cekura 的产品页上。公司信息写 Y Combinator、Launched in 2024,这是第 5 次发布。Cekura 的产品介绍写:给语音和聊天 Agent 做上线前模拟、评测、生产通话监控,以及接进 CI/CD。这次发布的是可以核对的语音基准。发帖人 Sidhant 写,他们把多个实时语音模型放进同一个开源 Pipecat 电话 Agent(Pipecat 是做语音 Agent 的开源框架),提示、工具和电话线相同;场景覆盖诊所预约和 Medicare 接入(Medicare 是美国面向老年人的公共医疗保险),每个场景跑三次;一通算通过,必须既到达正确结果,又把每个字段存对。公开结果页 benchmarks.cekura.ai/speech-to-speech 写最后更新于 2026-10-07,方法说明署名为 Dileep Chagam。Sidhant 的帖写了 9 个实时模型;该结果页的表列出 11 个,场景数与帖里的 82 个一致:诊所短表单约 59 个,Medicare 长表单 23 个。抓取时日榜页上的当前分数约 143、评论约 17。

产品要解决的问题
语音模型的榜单经常是文本或实验室指标。接到真实电话上,可靠性、说错字段、长时间沉默和每分钟费用会一起出现,只看一个延迟数字不够。

产品市场分析
对象是在选实时语音模型或语音平台的对话式 AI 团队。Cekura 官网同时卖模拟、监控和红队,基准是这次拿出来公开比的一块。官网首页没有标出价目,本文不写价格。结果页用 pass³ 表示三次都通过。表上可靠性第一是 GPT Realtime 2.1,pass³ 79.3%,成功率 89.0%,数据准确率 92.0%,中位响应 1.94 秒,费用每分钟 0.085 美元。最快是 Phonic v1,中位响应 1.60 秒,停滞通话 0.0%,pass³ 68.3%,每分钟 0.140 美元。表上每分钟费用最低的是 GPT Realtime 2.1 Mini,0.020 美元,pass³ 50.0%。不参与排名的级联基线(cascade:先语音转文字,再语言模型,再文字转语音)是 Flux、GPT-4.1、ElevenLabs Flash,pass³ 82.9%,高于表上每一个实时模型。这些数字来自该结果页,不是本文另测的。仓库 cekura-ai/cekura-bench 的说明写,可以用同一套预约和 Medicare 场景跑自己接进 Cekura 的 Agent,需要 Cekura 的 API key。

产品上下游
上游是同一套提示、工具、模拟数据和电话线,以及各家的实时语音模型。结果页写每个模型听到来电、调用工具、再说话,连接方式相同。下游是带转录、工具调用和分数的报告,以及团队拿去选模型或卡发布的门槛。官网写的产品环是:标出问题、在模拟里复现、建议修改提示、再跑门禁。集成对象在首页写成你已经在用的语音平台;基准说明里点名的原生接入包括 Vapi、Retell、ElevenLabs 等,具体以仓库里的配置为准。首页还把 HIPAA、SOC 2 和 GDPR 写成默认要求。通话是否通过,由 Cekura 平台按预期结果和存下的字段检查。

5. ChickyTutor · 官网

标语:A private language tutor that knows you better every day.

背景
ChickyTutor 日榜第 5,是 ChickyTutor.com 的第 2 次发布,公司信息写 Launched in 2025,上一次发布日为 2025-09-21。创始人 Phanos Anastasiou 写,这次加上互动白板:可以在说话的同时问一个语言点、看例子、做练习,再和导师讨论。他还写了与 L’école de français 的合作,把老师带的法语课和课间的 AI 练习放在一起,页面在 chickytutor.com/hybrid/french,以及 Android 版。官网写它是口语练习对象:选目标语言、讲解语言、水平和练习方式,说出想说的话,得到一处语法、用词或发音上的修改,再在上下文里试一次。浏览器端支持 70 多种语言和地区变体。Phanos 在帖里确认支持 70 多种语言。模式包括讲解、更沉浸的对话,以及按章节走的 Journey。抓取时日榜页上的当前分数约 120、评论约 25。

产品要解决的问题
背单词和做题之后,真对话仍然说不出口。纯语音里的纠正一下子就过去了,事后记不住那条语法。

产品市场分析
官网写给独立学习者、重新捡起语言的人、传承语使用者,以及想在课间加口语练习的老师、学校和团队。它写自己补充老师和真人对话,不声称取代他们。变现信号是官网写订阅前有一段有限的免费口语,价目在一份机器可读的定价文件里;这次没有打开到那份文件里的具体数字。Phanos 回复学校的用法:可以用 ChickyTutor 的课程,也可以带自己的课文;导师跟踪进度并标出强弱和下一步,老师据此调整课上讲什么。他回复白板由导师判断何时生成,学生也可以随时要;有一些固定版式,也可以现生成一个新的讲解。有人问是不是可理解输入(comprehensible input,用听得懂的语言来学);他回复对话模式走这条路,引导模式更接近 Pimsleur、Assimil、Michel Thomas 那种听说法。讨论里有人拿 Duolingo 和 ChatGPT 语音作对照,理由是那些地方开口不够,或跟不上对方在说什么。

产品上下游
上游是学习者选的语言、水平和场景,以及学校带进来的课文或 ChickyTutor 自己的课程。官网还列了公开的写作、填空、水平检查和听力播客,作为对话前后的准备。下游是当次对话里的修改、白板,以及标给老师看的进度、强弱和下一步。Phanos 回复,和「本周老师讲了哪一课」对齐,靠的是学生进度而不是 AI 自动照抄周计划;也可以只把它当带反馈的口语练习。公司信息里有 Play Store,和帖里的 Android 发布一致。隐私页这次没有逐条核对。

6. KloudMate 2.0 · 官网

标语:AI-powered Full-Stack Observability & Agentic SRE-Ops

背景
KloudMate 2.0 日榜第 6,是第 2 次发布。公司信息写 Launched in 2023,上一次发布日为 2023-04-19。Pranab Buragohain 在帖里回顾:三年前它是 AWS 无服务器监控,这次变成全栈观测加 Agentic SRE-Ops(SRE 是站点可靠性工程,管线上事故和值班)。发布页写它把指标、日志、追踪放在一起,并用 AI 调查事故、找根因、处理工单。列出的四个 Agent 是 Assistant(回答)、Builder(仪表盘和告警)、Investigator(根因)和 Docs(文档)。Amitava Saha 补充:Investigator 可以自动调查告警,把日志、指标和追踪连起来,把相关告警收成一件事故;Builder 把自然语言变成仪表盘、查询和告警;采集走 OpenTelemetry(一套开源的遥测数据格式和采集约定),并有 MCP,可以把调查带进编辑器和 AI 工作流。产品描述里写能自动识别、诊断并解决超过 70% 的事故,这是发布页上的说法。抓取时日榜页上的当前分数约 111、评论约 11。

产品要解决的问题
告警只说明有事。日志、指标、追踪和基础设施事件分在不同工具里,小团队的资深工程师把晚上花在把它们对上。

产品市场分析
定价页写不按主机、不按席位收费,每个方案用户数不限。Free 为 0 美元:日志和追踪各最多每月 10 GB,指标最多每月 1500 万个样本,保留 7 天,含 Assistant、10 条告警规则、1 个工作区、10 个合成监控(5 分钟一次),每月 5 个 AI 额度。Pro 每月 99 美元,这 99 美元同时是用量预算,超出按量计:日志和追踪每 GB 0.40 美元,指标每百万样本 0.30 美元;日志和指标保留 14 天,追踪最长 1 年;含事故、值班、状态页、SLO、告警上的自动根因、SSO / SAML,最多 200 条告警、10 个工作区、50 个监控,每月 20 个 AI 额度。Enterprise 为定制,包含跑在客户自己基础设施里的 KloudMate Infinity,以及自带模型 key。FAQ 写可以不绑卡开始,或先做 14 天 Pro 试用。一次聊天消息计 1 个额度,一次完整调查计 5 个;额度可以预购。年付有折扣,页面写需要联系他们开通。官网写团队在 Austin、Bengaluru,并远程。对照是把日志、指标、追踪、值班和状态页拆开买。

产品上下游
上游是 OpenTelemetry、CloudWatch 或页面列出的其他集成送进来的遥测。注册入口写在 app.kloudmate.com/signup。通知渠道表上有 Slack、邮件、Microsoft Teams、Webhook、SNS 和 Jira。下游是仪表盘、告警、事故时间线、状态页,以及调查结论和文档。Free 的状态页用子域名,Pro 和 Enterprise 可以自定义域名。自动根因、值班升级和 SLO 在表上属于 Pro 及以上。Enterprise 的 Infinity 由 KloudMate 部署和运维,页面写遥测不离开客户自己的网络。MCP 让编辑器里的 Agent 读这些调查,而不是再导出一份截图。

7. Claude for Google Workspace · 官网

标语:Bring Claude directly into Google Docs, Sheets & Slides

背景
Claude for Google Workspace 日榜第 7。官网写 Claude 直接在 Google Docs、Sheets 和 Slides 里工作:文档里起草、改写和审阅修改;表格里做财务模型、分析数据、从数据源拉实时数字;幻灯片里按现有版式做页、改选中的内容、标出重叠元素。安装一次,三个应用都能用,从扩展菜单打开。FAQ 写附加组件处于 beta,所有付费 Claude 方案可用,浏览器为 Chrome、Edge 和 Safari。另一条路径是在 Claude 网页或桌面端打开 Google 文件的连接器(同样标为 beta),把文件拉到对话旁边一起改。抓取时日榜页上的当前分数约 109、评论约 5。

产品要解决的问题
写文档、改表格、做幻灯片时,人把内容复制到聊天窗口再贴回去。格式和权限在这一步容易丢。

产品市场分析
对象是已经付费使用 Claude、并且工作在 Google Workspace 里的人。变现信号是 beta 只对付费方案开放,这次没有抓到单独的附加组件价格。官网写修改以建议形式出现:文档里的建议编辑、表格里高亮的单元格、新幻灯片,都要你接受或忽略。它沿用现有主题和标题样式。可以从 Marketplace 安装,管理员也可以部署到整个域名或指定群组;官网写 Workspace 管理员可以控制谁安装。消费者方案按 Anthropic 隐私政策处理数据,团队和企业按商业条款和 DPA。对照是继续在 Claude 和 Workspace 之间复制,或用 Workspace 里别的侧边栏助手。

产品上下游
上游是当前打开的那个文件,加上你打开的连接器,以及侧边栏里放下的 PDF、CSV 或 Office 参考文件。FAQ 写附加组件里 Claude 只能看到侧边栏和当前文件,再加上打开的连接器;Google 会在授权前列出这两项权限。从 Claude 网页或桌面端编辑时,能碰到的文件范围跟你的 Google Drive 权限一致。管理员可以控制谁安装。下游是你接受之后留在 Docs、Sheets、Slides 里的修改。官网写可以把一套做成功的流程存成 skill,让团队在三个应用里按同样方式跑,也可以记住你做模型或写备忘录的偏好。支持入口是帮助中心或 Anthropic 客户团队。

8. Polylane for Vercel · 官网

标语:An AI on-call engineer for your Vercel apps

背景
Polylane for Vercel 日榜第 8,公司信息写 Launched in 2026,外链为 polylane.com。这次发布的标语写成 Vercel 应用的 AI 值班工程师。产品页上的较长说明是:不该有人被叫起来;Polylane 连接代码、基础设施和观测数据,调查每个问题,并开一个带修复的 pull request;如果代码修不了,就给出根因和建议。官网把公司写成 Coreplane Labs,创始人 Boris Tane,地点 San Francisco。FAQ 写它让软件自己运转:Agent 了解你在跑的东西,能修的就修,对照生产环境看每个代码变更,回答值班会被问到的问题,并把同样的生产上下文交给编码 Agent。抓取时日榜页上的当前分数约 105、评论约 10。

产品要解决的问题
告警在夜里把人叫起来,而很多问题要先把日志、最近的部署和代码对上,才能知道是不是该改一行。嘈杂的告警和真正的回归混在一起。

产品市场分析
定价页写价格都公开,只有 Enterprise 单独报价。Free 为 0 美元。方案卡上 Starter 每月 80 美元(年付显示 64 美元),Team 200(年付 160),Business 500(年付 400),Scale 800(年付 640),Premium 2000(年付 1600),Ultimate 5000(年付 4000)。年付比月付少 20%。额度是按模型成本加权的 AI 用量,覆盖线程、调查和修复,每月重置。用到 70% 和 90% 会提醒;用完后 Agent 暂停,不会自动扣费。Scale 及以上可以打开按量超出,并自己设月度上限。方案卡写 Free 含 2 名成员、2 个云账号、每月 10 次 PR review;同页 FAQ 写 Free 含每月 50 次 PR review。两处数字不一致,以页面当时显示为准。MCP 和 API 的读取在各档都不计入额度,调查、自动修复和 PR review 计入。首页客户引言包括 Depot 的 Jacob Gillespie、Supermemory 的 Dhravya Shah、Terminal 的 Connor Giles、Basedash 的 Derek Reynolds,其中有资源数量和合并 PR 数;这些是官网引言。讨论里 Boris 回复:它会处理流进来的告警,并认为多数噪声不值得调查;它还读代码、看基础设施和观测,把异常和最近的部署对上。也有人写它会给不稳定的测试和瞬时失败开 PR。

产品上下游
上游是云账号、代码仓库和已有的观测。官网列出的平台包括 AWS、Cloudflare、Vercel、Fly.io、Render、Kubernetes、PlanetScale、Supabase、Modal、Railway、Convex、ClickHouse、Turso,观测侧有 Datadog、Sentry、Honeycomb、Axiom、Grafana Cloud、Better Stack、OpenStatus、Logfire,协作侧有 GitHub、Slack、Linear,以及 Cursor、Devin、Factory、Conductor。安装命令写为在 macOS 或 Linux 上运行 curl -fsSL https://polylane.com/setup | bash。检测方式是 Agent 按节奏读指标、日志和追踪,对照每个资源平时的样子。下游是 pull request 和带证据的通知。FAQ 写它不未经评审改生产:每次写入都要你在屏幕上批准具体请求,代码变更走你自己的评审和 CI。REST API 在 api.polylane.com,MCP 在 mcp.polylane.com/mcp。信任页写有 SOC 2 Type II 和 ISO 27001:2022。Enterprise 可以自带模型供应商 key、AI 网关和云。

9. NOVA CLI v1.0 · 官网

标语:AI developer in your terminal

背景
NOVA CLI v1.0 日榜第 9,公司信息写 Launched in 2026,并写首次发布日为 2026-03-04,外链为 nova.bridgeye.com。发布方在帖里的名字是 Bridgeye。这次发布说明把 v1.0 写成第一次公开发布。较早的产品介绍写:写代码、运行、报错、把错误贴进聊天、再改,AI 工具只是把聊天窗口挪近了一点。列出的动作是 Build(按目标写文件)、Auto-Heal(运行后自动改错)、Janitor(按要求重构)、以及在终端里 commit、push、pull。v1.0 的说明写:用平常的话描述想要的改动,Nova 读项目、改代码、跑你已有的测试和构建、修它弄坏的地方,并说明它检查了什么。付费方案包含 160 多个模型,不需要另开一家模型账号或自己管 API key。发布页带有「1 Month Free」标记,安装命令写为 pip install nova-bridgeye。抓取时日榜页上的当前分数约 103、评论约 5。

产品要解决的问题
终端里的编码 Agent 往往还要另备模型账号和密钥,并绑在一家供应商上。建议停在聊天里时,测试和构建仍要人自己跑。

产品市场分析
对象是想留在终端里改项目的开发者。变现信号是可以免费试,付费方案带上那些模型;发布页有一个月免费的标记。这次没有抓到官网价目表上的具体月费。官网另给了一条安装命令 curl -LsSf https://nova.bridgeye.com/install.sh | sh,和发布页的 pip 命令不是同一条,两处都写了。官网首页还有若干未注明出处的比例和评价,本文不把它们当成已核对的结果。讨论里有人肯定它会改项目、跑测试并修问题,而不是只给建议;Bridgeye 回复,他们希望把「检查了什么」说清楚,方便判断改动能不能收。对照是自己贴错误信息,或使用要单独配 key 的终端 Agent。

产品上下游
上游是你已经有的仓库、测试和构建,以及套餐里的模型。发布说明写不需要为模型另开账号。下游是终端里的文件改动、测试结果,以及它说明已经核对过的部分。发布页还写了仓库内的 Git 操作。官网写在一个目录里初始化之后会记住项目结构,不必每次先加载文件。数据是否离开本机、哪些命令会自动执行,发布页和官网首页这次没有写成一张权限表,本文不补。

10. Paw-Paw · 官网

标语:A tiny desktop pet for your Mac that types along with you

背景
Paw-Paw 日榜第 10。发布说明写:一只插画小动物坐在 Mac 屏幕角落,跟着打字和点击做反应,你停下来它就打盹。可以选择哪个赛季获得经验,升级后解锁几十只 Paw-Paw 和 100 多件物品。免费、原生应用,另有一个可选的 2.99 美元附加内容。官网写由 Daystrom OÜ 的小团队制作。关于页写第一版在 2026 年 1 月发出,Season 2 在 2026-10-01 上线,带来新的角色和物品、资料库窗口、成就和隐藏配对。打字说明文署名为 John Johnson,更新于 2026-10-07。抓取时日榜页上的当前分数约 85、评论约 4。

产品要解决的问题
人想要屏幕上有一点陪伴,但不想再开一个聊天、习惯打卡或账号体系。现有的桌面宠物很多不跟着键盘动。

产品市场分析
对象是用 Mac 写字、写代码或学习的人。变现信号是应用免费,无广告;两个赛季和其中的角色、物品都免费。可选附加是 Illustrain Collection,2.99 美元,一档由 Illustrain 画的角色和物品。账号可以不建。官网写支持 macOS 13 Ventura 及之后,包括文中点名的 Sonoma、Sequoia、Tahoe 和 macOS 27;通用二进制,Apple 芯片和 Intel 都可以,从 MacBook Air 到 iMac、Mac Studio。下载由 Apple Developer ID 签名并经过公证,不经过 App Store。Windows 版官网写计划在 2026 年晚些时候,目前没有。对照是菜单栏像素宠物或只在自己窗口里走动、不响应键盘的桌面宠物。

产品上下游
上游是 macOS 的辅助功能权限:它用来察觉你在打字和点击。官网写它数按键和点击,用来做动画和经验,不记录、也不发送你打了什么字。使用分析和崩溃报告是安装时分开的选项,之后可以在设置里改。下游是屏幕角落里的宠物、经验、资料库里的角色和物品。默认坐在 Dock 旁边的右下角,镜像模式在左下角,可以拖走,也可以复位。点它会说一句,打得快会进入 On Fire。从 Shiba 或 Sheep 开始,每个赛季有自己的进度。Dock 图标的右键菜单和宠物菜单相同,包括打开资料库、换一只、以及点击穿透。

In React Native, logical AND may cause crash as below.

Conditional rendering in React Native may crash your app

This babel plugin here can replace all logical AND with ternary operators, with a little more configuration.

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
// .babelrc.js
module.exports = function (api) {
api.cache(true);

const presets = [];
const plugins = [
'./ternary-jsx.js',
// this two plugins below only parse but not transform code
['@babel/plugin-syntax-decorators', { decoratorsBeforeExport: true }],
['@babel/plugin-syntax-class-properties', { loose: true }],
];

return {
parserOpts: {
plugins: ['jsx', 'typescript'],
},
presets,
plugins,
generatorOpts: {
retainLines: true,
compact: false,
minified: false,
concise: false,
},
};
};

However, Babel will lose some code formatting in the process, as it works based on the AST..

引言

开发过程中经常会碰到相同的逻辑,一般为了代码的整洁性,都会进行复用。
但是是不是所有相同的逻辑都需要复用呢?

实际场景

有两个商品卡片需要实现,其中一个是热点商品,一个是普通商品
两个在长相上有一些区别,大概在30%左右
热点商品多了标签,背景色,按钮等功能

  • 复用型写法I
1
2
3
4
5
6
7
8
9
10
11
12
function ProductCard({isHot, price, productImage, productUrl}) {

return (
<div style={isHot ? styles.cardWithBg : {}}>
{isHot && <Tag />}
<span>{price}</span>
{isHot && <Button />}
<img src={productImage} onClick={() => Navigate.push(productUrl)} />
</div>
)

}
  • 复用型写法Ⅱ
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
function CommonProductCard({price, productImage, productUrl}) {
return (
<div>
<Price price={price} />
<ProductImage image={productImage} url={productUrl} />
</div>
)
}

function HotProductCard({price, productImage, productUrl}) {
return (
<div style={styles.cardWithBg}>
<Tag />
<Price price={price} />
<Button />
<ProductImage image={productImage} url={productUrl} />
</div>
)
}

function Price({price}) {
return <span>{price}</span>
}

function ProductImage({image, url}) {
return <img src={productImage} onClick={() => Navigate.push(productUrl)} />
}

复用型I的代码说不上来的别扭,绝对的垃圾代码
复用型Ⅱ是经常能见到的,看起来解耦非常不错,也容易理解,但是细想:
热点商品为什么要跟普通商品的UI复用?两者本来就应该长得不一样。现在只是恰巧有某些地方是一样的,后来我说不定就改了。

技术层面复用逻辑没有问题,但是回到需求本身,这种复用是没有必要的,本来这两个东西就应该是分开的。
所以不如复制粘贴再写一遍更好:

  • 分离型写法
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
function CommonProductCard({price, productImage, productUrl}) {
return (
<div>
<span>{price}</span>
<img src={productImage} onClick={() => Navigate.push(productUrl)} />
</div>
)
}

function HotProductCard({price, productImage, productUrl}) {
return (
<div style={styles.cardWithBg}>
<Tag />
<span>{price}</span>
<Button />
<img src={productImage} onClick={() => Navigate.push(productUrl)} />
</div>
)
}

总结

不要盲目的复用代码,即使他们在逻辑上有相同之处,也要看这种逻辑相同是否是需求所期望的,可能只是偶发性的相同。

How to add Category and Tag page

If you want one page list all categories, just create source/categories/index.md, and then write type: categories in it, which tells Hexo to create public/categories/index.html. “Tags”, “About” are the same.

1
2
3
4
cd source
mkdir categories
cd categories
vi index.md
1
2
3
4
5
6
<!-- index.md -->
---
title: categories
type: "categories"
---

今日 Hacker News 首页前五并不按分数排列。前两条和第五条是模型发布:Anthropic 的小模型 Claude Haiku 5.5,以及 OpenAI 把 GPT-6 的交互界面铺到更多 ChatGPT 用户。中间夹着 MIT News 上 Margaret Hamilton 的讣告,404 Media 写的陆龟 Jonathan 基因组,以及一个刚建一天、分数只有十几分的 TypeScript 编译器 Rust 移植。OpenAI 博文直连返回 HTTP 403,下面的页面原文来自 r.jina.ai 转写,并与 Deployment Safety Hub 上 2026-10-07 的系统卡核对。分数和评论数是抓取时的快照。

1. Claude Haiku 5.5

背景介绍
Anthropic 的发布页标注 October 7, 2026,标题是 Introducing Claude Haiku 5.5。页面称它是他们迄今最便宜、最快、也最强的小模型,面向摘要、压缩、数据库查询、分类这类高量、对成本敏感的工作,并适合作为 Opus 5.5 和 Sonnet 5.5 在编程任务上的子代理。页面还把它放到实时客服和浏览器操作这类看重速度的场景。脚注写明:它在各模型的标准速度下是目前最快的,但比开启 Fast Mode 的 Opus 更慢。

价格是这篇的主体。页面写,平均跑下来大约比 Haiku 4.5 便宜 75%。脚注把这个平均数拆开:相对 Haiku 4.5,不超过 10 万 token 的请求降价 90%,超过 10 万 token 的请求降价 50%;在 Haiku 4.5 上,大约 90% 的请求落在前一档。同一脚注还写,Haiku 5.5 换了和 Sonnet 5.5、Opus 5.5 相近的分词器,完成同一件事会多用一些 token,上面的降幅已经把这一点算进去。价目表按每百万 token、并以「10 万 token 以内 / 以上」两档列出:缓存读取 $0.01 / $0.05,缓存写入 $0.125 / $0.625,输入 $0.10 / $0.50,输出 $0.50 / $2.50。对照栏里 Haiku 4.5 是缓存读取 $0.10、写入 $1.25、输入 $1.00、输出 $5.00;Sonnet 5.5 是缓存读取 $0.10、写入 $2.50、输入 $2.00、输出 $10.00。页面说,10 万 token 以内的请求约占上一代 Haiku 请求的 90%,这一档尤其划算。

同一天还有两件配套调整。Sonnet 5.5 的缓存读取从每百万 token $0.20 降到 $0.10,页面估计这会让大多数 agent 任务便宜大约 20%。本周起,Max 和 Team 订阅会得到用在 Claude Platform 上的每月 API 额度:Max 5x 每月 $100,Max 20x 每月 $200,Team 最高 $500,在用户之间共用;额度可用于任何模型。开发者这边,Claude 的 Python 和 TypeScript SDK 增加了仍处 beta 的 computer use 和 browser use。模型 ID 写的是 claude-haiku-5-5,并已在 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 上提供。

它是第一代带可调 effort(Low、Med、High、Xhigh、Max)的 Haiku。页面上的基准是 Anthropic 自己的表,本文没有重跑。知识工作 GDPval-AA v2.1 的 Elo:Haiku 5.5 为 1620,Haiku 4.5 为 735,GPT-6 Luna 为 1437,对照用的 Sonnet 5.5 为 1840。AA-Briefcase v1.1:1578、614、1336、1824。计算机操作 OSWorld 2.1 的离线子集:72.4%、15.7%、48.9%、83.9%。Humanity’s Last Exam 无工具:45.9%、10.2%、表内对 Luna 是破折号、56.9%;有工具:57.4%、18.7%、破折号、64.5%。Terminal-Bench 4.0:39.2%、0.0%、16.4%、70.6%。FrontierCode 1.1(Main):46.4%、破折号、42.4%,Sonnet 5.5 那一格写成 52.1% Xhigh。视觉推理 Chartography、无工具:46.4%、6.4%、29.1%、61.6%。页面接着说,Terminal-Bench 4.0 这类复杂编程仍然更适合 Sonnet 5.5 和 Opus 5.5;Haiku 5.5 适合范围更窄、以前会因为太贵而不跑的工作。

客户引言都标了公司和作者,数字是对方的早期测试,不是本文复测。Asana 的 Aaron Vinh(Staff Software Engineer)写,AI Teammates 的评测里,任务完成延迟下降超过 30%,每个 agent 回合的推理最多快 2.5 倍。HubSpot 的 Ze’ev Klapow(Distinguished Software Engineer)写,模拟门户上的 CRM 任务三次平均 92.8%,是他们在较小模型上见过的最高分;其中一项找过期但含糊记录的审计,Haiku 5.5 最快,命中最高、误报最低。AlphaSense 的 Daniel Campos(Distinguished Engineer)写,Ask in Document 每周大约 800 万次生产调用;400 条查询上,相对 Haiku 4.5 是 0.84 对 0.76。Box 的 Yashodha Bhavnani(VP of AI Products)写,比 Haiku 4.5 高 11 分,延迟大约一半。Rogo 的 Alex Wang(Applied AI)把它放在查 10-K、抽分部收入这种子任务上。Cognition 的 Walden Yan(Co-Founder & CPO)写,Devin Fusion 用它做 sidekick 时 FrontierCode 为 66.2,同时降低成本和延迟,Devin CLI 里可以配 Opus 5.5 做主模型。

对齐一节写,相对 Haiku 4.5,几乎所有对齐评测都更好,不当行为和配合滥用的意愿都更少,细节在 Haiku 5.5 系统卡。网络安全护栏比 Haiku 4.5 更严,但比最近其他模型松一些:允许的防御性任务比 Sonnet 5.5 更宽,仍然拦截渗透测试和更像攻击者会用的手法。生物学护栏与 Sonnet 5、Sonnet 5.5、Opus 5 相同:研究性问题可以,被判断为可能造成伤害的请求会被限制。更宽的生物和网络安全用途可以申请 Life Sciences Verification Program 和 Cyber Verification Program。

主要讨论方向与观点
讨论集中在价格门槛和它适不适合当主力。minimaxir 把价目表念了一遍,认为 10 万 token 的分界太低,而且只加在 Haiku 上,Sonnet 和 Opus 没有;做 agent 很容易越过,做普通生成或分类则划算。他对照的 GPT-6 Luna 是输入 $0.10、输出 $0.50,并在编辑里补了一句,Luna 的门槛大约在 272k。simonw 说自己对 Haiku 4.5 的意见就是它比 Luna 贵 10 倍;现在两者在 10 万 token 以内同价,超过之后 Luna 更便宜,即便 Luna 在 27 万 token 再涨价,仍然低于 Haiku。272k 和 27 万都是这两条评论里的数字,Anthropic 这篇页面没有写 Luna 的分档。simonw 还说,Anthropic 自报的基准都高于 Luna。

simonw 用不同 effort 画了鹈鹕骑自行车。Low 会把车架画错,medium、high、xhigh、max 都画对了。max 花了 5 分 9 秒、3.3826 美分;最便宜的 low 是 0.0936 美分、7 秒。他写,最新的 llm-anthropic 插件直接查 Anthropic 的模型列表,所以不用为这个模型改插件,刷新之后可以用 claude-haiku-5.5。他链了一年前 Haiku 4.5 的鹈鹕,并说那张很差。

chriddyp 贴了 Plotly 的 DataAnalyticsBench:相对 Haiku 4.5 便宜 9 倍、字母等级高两档,并且是默认速度下最快做完这套题的模型。40 道较深的数据分析题花费 $0.38,对照是 Opus 5.5 的 $15 和 Astra 的 $20。他说简单分析都对,需要再看其他变量的统计题不够坚持。相对 OpenAI,他写 GPT-6 Luna 稍好,成本大约是 Haiku 5.5 的 30%;GPT-6.1 Sol 全部答对,但贵 10 倍。这些是该评论里的结果。

jjcm 用图像转 HTML 试复杂界面,结论是不够用,并发现它会把活交给 Opus 5.5。他认为适合小的子代理和范围收得很紧的工作。wyrdcurt 觉得终于有一个便宜、值得用的 Haiku,10 万 token 的门槛偏低,但自己本来也只把小模型用在小任务上。charlesabarnes 和 seaal 都把每月 API 额度当成实际好处:可以在订阅之外的 harness 里做功能,而不必另付 API 或完全依赖端侧模型。charlesabarnes 同时担心,这是在为以后对用户不友好的改动做缓冲。

专有名词解释

  • effort:页面给 Haiku 5.5 的五档是 Low、Med、High、Xhigh、Max。用户用它在成本和能力之间取舍。各档在三张图上的具体分数,正文没有从图表里再抄一遍。
  • 缓存读取 / 缓存写入:价目表里的 cache reads 和 cache writes,单位都是每百万 token。Sonnet 5.5 这次只把读取从 $0.20 降到 $0.10。
  • OSWorld 2.1:页面描述为衡量代理能否操作一台真实计算机、完成长的多步任务。表上的百分比标明是离线子集。
  • Humanity’s Last Exam:页面描述为专家级学术知识和推理测试。表上把无工具和有工具分开,Luna 两格都是破折号。
  • Terminal-Bench 4.0:页面描述为在命令行里完成复杂、多步的专业任务。Haiku 4.5 在这张表上是 0.0%。
  • Claude Platform 月度额度:本周向 Max 和 Team 发放、只能用在 Claude Platform 上的 API 抵扣。页面写可用于任何模型。

HN 讨论:thread · 659 分 · 329 评

2. Margaret Hamilton has died

背景介绍
MIT News 的讣告写,Margaret H. Hamilton 于 9 月 30 日去世,享年 90 岁。讣告称她领导了 MIT Instrumentation Lab 里为 NASA 阿波罗计划编写飞行软件的团队,发表超过 130 篇,并推动软件工程成为单独的学科。她 1959 年到 1970 年代中期在 MIT 工作,之后自己创办软件公司。

履历按讣告的顺序是:1936 年生于印第安纳州 Paoli;1955 年起在密歇根大学读数学,后转入 Earlham College,1958 年取得数学学士、辅修哲学;1959 年随丈夫到波士顿。她先在 MIT 气象系给 Edward N. Lorenz 写天气预报软件,讣告说这是她进入编程的入口,后来的工作也进入了 Lorenz 关于混沌理论的发表。1961 年她到 MIT 林肯实验室,参加美国第一个防空系统 SAGE,为原型机 AN/FSQ-7(XD-1)写软件,并开始关注当时几乎没人做的软件可靠性。1965 年,Instrumentation Lab 登广告招聘「把人送上月球」的软件人员。她应聘后成为该实验室阿波罗项目的第一位程序员,也是项目里的第一位女性程序员。她先做无人任务,再领导载人任务的 onboard 飞行软件。到 1968 年,她是指挥与服务舱团队的助理主任,参与阿波罗软件的人超过 400 名。

讣告用两件事说明她说的防御式编程和优先级调度。女儿 Lauren 四岁时在指令舱模拟器里玩,在「飞行中」启动了发射前程序 P01,模拟器崩溃。Hamilton 在技术文档里加了警告,并提议用软件阻止真实任务里发生同样的事,但被否决,理由是受过训练的宇航员不会犯这个错。1968 年阿波罗 8 号上,Jim Lovell 在飞行中启动了 P01,导航数据消失;她和团队被叫去处理,之后她提议的改动才进了程序。另一件是 1969 年 7 月阿波罗 11 号着陆前,计算机报 1202:一个硬件开关故障让计算机过载,系统可能处理不了着陆。讣告写,她们做过优先级驱动的软件,可以关掉不必要的后台任务、保住关键任务;休斯敦信任这份软件,让任务继续。

实验室后来从 MIT 独立成 Draper Laboratory。1976 年她创办 Higher Order Software,基础是防错和容错。大约十年后创办 Hamilton Technologies,主产品是 Universal Systems Language(USL),一种强调防错和防御式编程的系统建模语言。奖项包括 2003 年 NASA Exceptional Space Act Award、2016 年奥巴马颁发的总统自由勋章、2017 年计算机历史博物馆 Fellow、2019 年 Intrepid Lifetime Achievement Award,以及 2022 年进入 National Aviation Hall of Fame。讣告还写,2015 年她参与开发的阿波罗软件被完整放上 GitHub;2017 年她成为乐高人仔,原型来自 MIT 科学传播者 Maia Weinstock 设计的一套 NASA 女性人物。她遗有女儿 Lauren Hamilton、女婿 Richard Selesnick、两名孙子和四名曾孙。追悼会订在春天,地点是马萨诸塞州剑桥。

Olivier de Weck(阿波罗计划教授、MIT 航空航天系临时系主任)和 Draper 总裁兼 CEO Jerry M. Wohletz 的悼词都在这篇讣告里。关于「软件工程」这个词,讣告引用她 2018 年对《El País》说的话:她开始用 software engineering,是为了让软件和做软件的人得到与硬件及其他工程同等的尊重;起初这被当成笑话。这是她的自述,讣告没有把它写成有文献裁定的「全世界第一次使用」。

主要讨论方向与观点
线程大多是悼念,技术补充不多。diskzero 说大约三十年前见过她和其他 Instrumentation Lab / Draper 的阿波罗一代;当时自己的多媒体 CD-ROM 创业公司,投资方是那批人后来成立的风投。他记得她讲形式化的控制系统,内容超出自己的理解。WarOnPrivacy、marcelo-earth 和 dzonga 都提到那张站在打印出来的代码旁的照片;WarOnPrivacy 链的是 MIT 2016 年的一篇现场报道。

muunbo 写「我记得她创造了 software engineering 这个词」。这是评论者的记忆。讣告里能对上的是上面那段《El País》引语,不是一条独立的词源考证。EvanAnderson 推荐计算机历史博物馆的口述史,并说读完之后,他相信 Steven Levy《Hackers》里那个故事的程序员就是她:有人深夜在 TX-0 上折腾,弄坏了一位学者正在跑的天气模拟,那位学者是 Edward Lorenz。讣告确认她为 Lorenz 写过天气预报软件,没有写 TX-0,也没有写这起夜间事故。TX-0 的对应是评论者听完口述史之后的判断。

schaefer 问原始阿波罗代码还能不能读。dudewhocodes 回复了 chrislgarry/Apollo-11。讣告只说 2015 年被放上 GitHub,没有点这个仓库名。xtajv 另推荐 Frank O’Brien 的 The Apollo Guidance Computer: Architecture and Operation(ISBN 978-1-4419-0876-6),说读起来像主管带着新员工看代码。Kim_Bruning 推荐 timmg 讲 AGC 如何工作的视频。本文没有打开这些外部材料。

专有名词解释

  • Instrumentation Lab / Draper:MIT 当时为阿波罗做 onboard 飞行软件的实验室。阿波罗结束后从 MIT 分出,成为独立的 Draper Laboratory。
  • SAGE:Semi-Automatic Ground Environment,讣告称为美国第一个防空系统。AN/FSQ-7(XD-1)是她在林肯实验室写软件时用的原型计算机。
  • P01:讣告里的发射前程序。模拟器和后来的阿波罗 8 号都出现过在飞行中误启动它的情况。
  • 1202:阿波罗 11 号着陆前计算机发出的警报。讣告的解释是硬件开关故障导致过载;软件按优先级关掉非关键任务后,着陆继续。
  • USL:Universal Systems Language,Hamilton Technologies 的主要产品,讣告描述为面向复杂系统、强调防错的建模语言和方法。
  • AGC:阿波罗制导计算机。评论里用这个缩写指向讲解视频和 O’Brien 的书;具体结构以那些材料为准,这篇讣告没有展开指令集。

HN 讨论:thread · 640 分 · 71 评

3. ‘Jonathan’ is the oldest land animal on Earth

背景介绍
404 Media 这篇由 Becky Ferreira 撰写,页面时间是 2026 年 10 月 7 日下午 2:00,datePublished 为 2026-10-07T18:00:38.000Z。文章说,阿尔达布拉象龟 Jonathan(Aldabrachelys gigantea)大约 1832 年在塞舌尔孵化,查尔斯·达尔文发表《物种起源》时他已经二十多岁;1880 年代和另外三只龟一起,作为礼物送给圣赫勒拿岛的英国殖民总督,此后一直住在那里。文章称他即便在这个经常活过一百岁的物种里也是例外,将近 200 岁。照片说明写,1880 年代和今天的图像来自 Wikimedia Commons 和圣赫勒拿政府(页面拼写为 St. Helene Government)。他现在住在总督府 Plantation House,是岛上的旅游点之一。文章还写,拿破仑死在圣赫勒拿,时间比人们认为 Jonathan 孵化的年份早大约十年。

采样过程来自文章对作者 Stephen Clark 的电话采访。Clark 被写成非营利组织 Kallel Foundation 的衰老研究者、论文作者之一。他 2017 年就联系饲养员;抽血被认为太冒险,于是哄 Jonathan 张嘴做口腔拭子。早期样本不完整、新冠,以及后来限制接触 Jonathan 的新规定,把结果拖了很久。样本最终由美国太空军从圣赫勒拿送到佛罗里达。

文章对研究结果的表述是:相对其他龟(包括一只 36 岁、名叫 Tank 的个体),Jonathan 在大多数衰老通路上有独特基因变异,文章点名 DNA 修复、胰岛素调节、线粒体功能和「低熵」甲基化。Clark 说衰老有很多标志,这项研究还只是开头。文章接着写,一些变异是团队根据其他长寿个体预料到的,包括 DNA 修复、端粒维持和细胞自噬;意外在甲基化组,与线粒体过程有关的那一部分异常「干净」,也就是低熵。文章说他们还做了更年轻龟的甲基化组,其中和一只 5 岁龟相差 189 年。文章的对比是:基因组其余部分的熵与年龄相称,线粒体甲基化组则接近那只 5 岁龟。Clark 说这需要更多研究才能跟上。文章后段把目标写成 Kallel Labs 的公司目标:影响人类的健康寿命和寿命。Foundation 和 Labs 两个名字都出现在这篇报道里,报道没有解释二者的关系。

页面链到的论文是 Science Advances 的 10.1126/sciadv.adw8887。本文没有读 PDF,下面这句来自 Crossref 摘要,和报道不是同一层文字。论文题为 Epigenetic insights into extreme longevity in the world’s oldest terrestrial animal, Jonathan,期刊为 Science Advances 第 12 卷第 41 期;Crossref 记录创建于 2026-10-07,印刷日期为 2026-10-09。摘要写:他们测定了 194 岁的 Jonathan 的基因组和甲基化组;相对其他巨龟(A. gigantea 和 Chelonoidis abingdonii),他在大多数衰老通路上有独特基因变异;与四只从 5 岁幼体到老年的其他阿尔达布拉象龟相比,DNA 甲基化和甲基化熵变化明显;低熵区域富集在线粒体电子传递链和 RNA 代谢相关基因的启动子上。摘要据此建议,这些通路的高保真转录可能对长寿物种很重要,并把模型写成:启动子上保持低甲基化熵,与高效的线粒体产能、RNA 加工和基因组修复连在一起。Crossref 列出 22 位作者,第一作者是 Benjamin Vaisvil(Kallel Foundation 与 Igenbio),Stephen W. Clark 的单位是 Kallel Foundation、Epiphany Biosciences 和 Vanderbilt-Ingram Cancer Center。摘要没有出现 Tank 这个名字,也没有把通路列表写成胰岛素调节或自噬;那些是 404 Media 文章里的说法。

主要讨论方向与观点
评论很少,也没有人声称复核了论文。scun 引用「大多数衰老通路上的独特变异」,把它比成游戏里把点数全加在寿命上。dyauspitr 拿陆生和海洋动物比较:这只最老的陆地动物还没到 200 岁,海里的动物可以到五六百年。两个数字都是这句评论里的说法。repeekad 问为什么是太空军送样本。sublinear 回复:那里很偏远,美国太空军在附近的阿森松岛有行动。这是评论者的解释,文章只写了运送这件事。pil0u 觉得不必为了研究去打扰这只龟。其余是关于《The Leftovers》里 Jarden 的类比,以及「他连兔子都追丢了」这类玩笑。

专有名词解释

  • 阿尔达布拉象龟:Aldabrachelys gigantea。文章和论文摘要都用这个种名称呼 Jonathan。
  • Chelonoidis abingdonii:摘要里用来对照的另一种巨龟,没有在 404 Media 正文里展开。
  • 甲基化组:DNA 上甲基化修饰的全体,影响基因如何被读取。文章说线粒体相关的那一部分熵特别低;摘要把低熵区域具体到电子传递链和 RNA 代谢基因的启动子。
  • 甲基化熵:这里用来描述甲基化模式有多「杂乱」。摘要把较低的熵和更稳定的转录联系在一起,这是论文自己的解释。
  • 端粒 / 自噬:端粒是染色体末端的重复序列;自噬是细胞回收自身组分的过程。两者出现在 404 Media 对「预料之中的变异」的转述里,没有出现在本文所读的 Crossref 摘要里。
  • Plantation House:圣赫勒拿总督官邸。文章写 Jonathan 和同伴长期住在那里。

HN 讨论:thread · 43 分 · 11 评

4. Rust Port of TypeScript (Tsc)

背景介绍
GitHub API 显示 pingdotgg/ts-rust 创建于 2026-10-07T05:17:07Z,抓取时默认分支 main 的最近推送是 2026-10-08T00:58:22Z,语言是 Rust,许可证字段为 MIT,仓库描述是 “An experimental Rust port of the TypeScript 7 compiler (tsc)”。账号显示名是 Ping.gg,简介是 “We build tools for modern devs”,博客为 ping.gg。当时 API 上的星标是 453、分叉 26。README 没有署个人姓名。

README 在一条横线之前是作者自己的话,横线之后作者写明:「下面的一切是我的 LLM 写的,不是我。」横线之上的内容包括:他想知道 LLM 能否把 TypeScript 的编译器、检查器和语言服务移植到 Rust;token 花费超过 42 万美元,但他认为大概 2 万美元就能做成。动机列了四条:测试模型能力、做一个快的 TypeScript 类型检查器、做一个能在 WASM 里高性能运行的检查器,以及玩梗。他称这是早期发布,在测过的每一个真实项目里兼容性是 100%,对绝大多数应用可以当作直接替换,同时让读者去看 Known problems。他又写:「我也没读过这代码的任何一行。」安装命令是 npm install -D tsc-rs,后面跟着 “Be warned, I have no idea if this will actually work.”

花费一段区分了两批模型。他用 OpenAI 的模型做了很久:GPT-5.6 Sol 和 GPT 6 Astra 的 API 标价 token 超过 40 万美元,几个月的 /goal 循环写出超过 130 万行 Rust,兼容性一直没过大约 84%。换成 Opus 5.5 之后,10 小时就有一个能用的 v0。他原以为 Opus 是在 Codex 已有代码上接着写,后来发现不是:Opus 5.5 从头开始,用大约十分之一的时间超过了 Astra。这一段的 Claude 花费他写成大约 24,047 美元的 API 花费、历时两周;他用的是 Claude 账号,相当于每周 200 美元计划额度的 925% 到 983%。42 万美元和 40 万美元都是作者说的 token 标价,不是本文看到的账单。

横线以下、被作者标成模型所写的部分,声称这是微软用 Go 写的 TypeScript 编译器的直接移植。上游是 microsoft/TypeScript(以前叫 typescript-go),钉在提交 673a5f17d713(2026-09-29,TypeScript 7.1.0-dev)。它保留 Go 版的算法、行为和 tsc 命令行、语言服务与 API。npm 包名用 tsc-rs,以免和 typescript 包冲突。平台写的是 Linux x64(静态链接)和 macOS arm64;Windows 和 Linux arm64 还没有。Effect 诊断(代码 377xxx)内置,对应 Effect-TS/tsgo 0.46.1 的规则移植;语言服务的快速修复、重构、悬停和补全没有移植。

同一段里的测试与性能也属于「模型所写」的部分,本文没有重跑。它写:TanStack Query core 和 Hono 的诊断与 Go 版一致;移植的 181,711 个 Go 测试通过;60 个开源项目上,类型检查时间的几何平均大约是 Go 版的一半,而预览包没有用 PGO 和 BOLT,所以比那个测量构建慢。六款应用在 Apple M4 Pro(12 核、48 GB)、macOS 26.5.1 上,用 hyperfine、1 次预热后取 5 次中位数、--noEmit --incremental false。表上的几何平均相对 tsc 6 是:tsc 7 为 7.1 倍,tsc-rs 为 11.4 倍,bun check 为 20.9 倍;相对 tsc 7,tsc-rs 为 1.61 倍,bun check 为 2.95 倍。举例:VS Code 约 375 万行,tsc 6 为 54.56 秒,tsc 7 为 6.84 秒,tsc-rs 为 4.20 秒,bun check 为 1.62 秒。表下写 bun check 在 Sentry 和 tRPC 上会多报其他检查器没有的错误。已知问题包括:某些 monorepo 里 tsc-rs 可能比 tsc 多写出一些文件;tsc -b 在缺少 project reference 时可能报 TS2307;tsc -b --watch 在一些编辑后会以内部错误、退出码 70 停下;编辑器里长时间编辑会慢慢涨内存;tsc-rs --version 打的是所移植的 TypeScript 版本 7.1.0-dev,不是 npm 版本。许可证一节写项目本身是 MIT,并保留所移植代码的许可证:TypeScript 为 Apache-2.0,部分 Go 标准库为 BSD-3-Clause。

主要讨论方向与观点
抓取时只有两条顶层评论。fwlr 把 “The Slop Line” 和那句「下面是 LLM 写的,不是我」单独摘出来,说感谢这个约定。ingen0s 问是不是花了超过 40 万美元。回复都在猜这是标价而不是实付:hedgehog 说实际更可能是几百或几千美元的订阅费;spense 赌是几个月的几份订阅,而不是按 token 直接付钱;colomo 复述 42 万美元的 token,并说他相当确定对方用的是订阅。这些都是猜测。能对上 README 的是作者自己的用词:OpenAI 那段写的是 “API priced tokens”,Claude 那段同时写了大约 24,047 美元的 API 花费,以及 Claude 账号周额度的百分之九百多。

专有名词解释

  • tsc:TypeScript 的命令行编译器。这个仓库的 npm 命令是 tsc-rs,README 说参数与 tsc 相同。
  • typescript-go:README 横线以下对微软原生 TypeScript 编译器的旧称,现仓库为 microsoft/TypeScript,语言是 Go。Rust 移植声称钉在其中一次 7.1.0-dev 提交上。
  • API priced tokens:作者用来描述 GPT-5.6 Sol 和 GPT 6 Astra 那 40 万美元的词,指按 API 标价计算的 token,不是本文核实过的付款记录。
  • The Slop Line:作者在 README 里画的分界。线上是他写的,线下方按他的声明是模型写的。
  • Effect 诊断:横线以下声称内置的 Effect 语言服务规则,只在 tsconfig 配了对应插件时运行。编辑器功能没有移植。
  • PGO / BOLT:README 用来解释「测速用的构建」比 CI 预览包更快的两种优化。预览包没有开它们。

HN 讨论:thread · 11 分 · 5 评

5. GPT‑6 and Intelligent UI for everyone

背景介绍
openai.com 上这篇直连返回 HTTP 403。下面的产品描述来自 r.jina.ai 对同一 URL 的转写。开头写:上个月他们把第一批 GPT-6 给了付费用户,今天把下一代智能带给每周使用 ChatGPT 的超过 12 亿人。12 亿是这篇里的数字。

新能力叫 Intelligent UI。转写写,GPT-6 会按问题把文字、图像和交互元件组织在一起;回答里可以有图形、可点的按钮、表单、图表,以及能在对话里直接用的交互。形式随问题变化:比较可以并排,解释可以是交互图,简单问题仍然可以只给文字。举例包括:周日烤羊腿的时间表可以和菜谱放在一起,公路旅行的站点可以标在地图上并注明哪里值得绕路。转写在 “GPT‑5.6 Instant” 标题下收进了一整份文字版烤羊腿计划(人数、温度、下午日程),随后出现 “GPT‑6 Instant” 标题,但几乎没有跟着的正文,所以并排的视觉界面没有进入这份纯文本。后文还写到可以让 ChatGPT 现做一个工具,例如储蓄计算器、晚餐账单分摊或对话里玩的游戏。

实现一节写:他们做了一套可流式输出的原生组件库,以及一个在模型生成时就处理界面的编译器。组件库提供熟悉的外观,模型决定怎么拼;编译器让界面随生成逐步出现,不用等整段结束。训练上,他们评估界面是否清楚、有用、完整,并让模型学会何时用交互、何时只给文字。文中也写,设计判断和能做的东西都还有改进空间。

速度一节写,推理模型出现之后,难题要等模型想完才开始回答;现在 ChatGPT 可以把思考和回答交错进行。它被训练成考虑用户等待时间,用到当时为止的知识和发现,分段把答案补完,并让全文仍然像一次写完那样连贯。内部评测的说法是:在高价值的日常 agent 任务上,GPT-6 Extra High 开始回答的时间与 GPT-5.6 Medium 相同,总分则好于 GPT-5.6 Extra High。需要网页搜索的问题,GPT-6 Instant 平均比 GPT-5.6 Instant 早 44% 开始回答。同一节还写,GPT-6 更会判断何时检索,在另一项困难问题的内部评测里,也更经常碰到用户问题的关键点。这些百分比和「更好」都是博文里的内部评测,本文没有复现。

安全段落写,GPT-6 在识别现实风险、回答是否诚实、以及遵守用户设定的界限上继续推进,并借用了 Astra 的若干安全进展,以便比 GPT-5.6 Sol 更抗绕过、更遵守护栏、也更清楚自己能做什么。训练按真实使用里的教训做了更新,加强对网络攻击、生物威胁和暴力等高风险滥用的防护。对抗测试里,它对多轮、会适应的攻击抵抗更强。它也被训练成在较高风险场景里安全回答,同时避免无谓拒绝无害请求,并利用对话历史看出单条提示里看不出来的风险。博文把细节指到系统卡。

系统卡页面 GPT-6 Sol and GPT-6 Luna: October 2026 update 可以直接打开,标注 Published October 7, 2026。本文读的是这个 HTML,不是评论里的 PDF 链接。页面写,相对各自的 GPT-5.6 对照,GPT-6 Sol(October)在标准 self-harm 评测上有统计显著的退步;GPT-6 Luna(October)在标准 self-harm、gore 和 sexual content 上有统计显著的退步。人工复查认为违规案例处于边界、总体上仍然安全:两个模型更愿意回答关于自我伤害的信息性问题,同时指向专业资源;按他们的评测,模型不遵从协助自我伤害的请求。对 gore 和性内容,它们更可能接话而不是直接拒绝,但复查到的输出严重度更低。对抗性红队没有按他们的标准发现高严重度风险。页面同时写,这些评测没有计入 Trusted Contact、本地危机热线和针对年轻用户的 Parental Controls 这类系统层措施。图像输入评测里,两者与 2026 年 8 月的 GPT-5.6 Sol / Luna 大体持平,例外是 extremism 视觉评测上的退步;他们复查后认为不安全回答的严重度总体较低。另一处写,在合法请求的有用性上相对先前模型有改进,但在一些安全请求上分数更低;评测还表明它们更少拒绝无害请求,也更少加过长或说教式的保留。

可用性一节写:Intelligent UI 的 GPT-6 今天开始向 ChatGPT Plus、Pro、Business 和 Enterprise 的 Chat 标签全球推出;从明天起扩展到 Free 和 Go。企业是否可用取决于管理员。付费的 Plus、Pro、Business、Enterprise 使用 GPT-6 Sol,Free 和 Go 使用 GPT-6 Luna,两者都为日常对话调过。这次不改动 Work 和 Codex 所用的模型。

主要讨论方向与观点
界面口味分成两边。revolvingthrow 觉得多数人会更喜欢 6 而不是 5.6 的周日烤肉比较,但自己几乎排斥那些留白和清单,感觉被当成小孩。他担心 OpenAI 把 Work 和聊天合并后,这种界面会渗进工作工具;博文写明这次不改 Work 和 Codex。他还失望聊天用的不是 6.1:视觉解释有用,但 6.1 更强,而越来越多人把模型当知识来源。6.0 和 6.1 的对比是这条评论的说法;博文写的是 Sol 与 Luna 的分档,没有用 6.0 / 6.1 这两个名字。mortenjorck 拿 Bartosz Ciechanowski 的手工交互讲解作对照,认为那些仍然会像机械钟相对于塑料石英表一样留下来,同时承认计算机已经能为冷门题目做出能用的交互解释。xpct 更习惯一次只讲几句、来回追问,担心新界面像以前的和弦图一样反复贴同一张、而且很难关掉。jjcm 把它叫做一次性的 “disposable UI” 或 “paper plate UI”,担心该给一句普通回答时也会强行做界面,并想知道对延迟的影响。

ankit_mishra 把系统卡里的退步摘到评论里,认为公司一边在 PDF 里写下这些安全指标下降,一边把发布焦点放在新界面上。上面那些退步和「边界案例、仍然安全、不协助自我伤害」的复查,都在系统卡页面上,不是评论者的转述。virtuosarmo 推测这是为了在 ChatGPT 里放广告,并链到几天前的视觉广告格式页面。本文没有打开那个广告页面,博文正文也没有把 Intelligent UI 写成广告位。giancarlostoro 不喜欢 OpenAI 和 Sam Altman,但觉得发布页的呈现和苹果同一水准,并说自己两年前就认为这些公司该离开纯聊天界面。

专有名词解释

  • Intelligent UI:博文里的名字。模型从一套原生组件里选文字、图形、按钮、表单和图表,编译器边生成边把界面流式显示出来。
  • GPT-6 Sol / GPT-6 Luna:博文写,Chat 里 Plus、Pro、Business、Enterprise 用 Sol,Free 和 Go 用 Luna。Work 和 Codex 的模型这次不变。
  • Extra High / Medium / Instant:博文用来比较开始回答时间的档位。44% 是 GPT-6 Instant 相对 GPT-5.6 Instant、在需要搜索的问题上平均提前开始回答的内部数字。
  • self-harm / gore / extremism 视觉评测:系统卡页面上写出退步的项目。同一页写了人工复查的严重度判断,以及评测没有计入危机热线等系统层措施。
  • Astra:博文说 GPT-6 的安全进展建立在 Astra 的若干安全工作之上,用来对照绕过防护、遵守界限和说明自身限制。博文没有在这篇里定义 Astra 的产品形态。

HN 讨论:thread · 489 分 · 255 评

今日 Product Hunt 热榜对应太平洋时间 2026-10-07 日榜(上海时间 10 月 8 日上午抓取,太平洋时间当日尚未到午夜,名次和分数仍可能变化)。榜单页写明:分数是此刻的活跃分数,名次反映所查看时段结束时按分数的排序;这次抓到的前十按分数从高到低排列,与页面顺序一致。前半段是把人和 Agent 放进同一间办公室或同一本数据笔记本、让落地页跟着广告和名单变化,以及在自己的电脑上把演示过一次的操作收成可再跑的流程。后半段是把第一人称视频收成机器人训练数据、在 Figma 画布上改设计和做原型、预览一个在欧洲训练的万亿参数模型、让买家边点演示边提问、把文件和模型放在欧盟的一台云电脑上,以及从公开讨论里找出正在描述你所解决问题的人。按日榜页顺序,前五是 Velozity、GenPage 3.0、IrisGo for Solopreneurs、Databench by Alkera 与 Pegasus 1.6 by TwelveLabs,后五是 Figma Agent、Mistral Large 4、Supademo AI Demo Agent、Rool 与 Ownfeed。

1. Velozity · 官网

标语:The Multiplayer AI Office where your team and agents work.

背景
Velozity 日榜第 1,发布页标为有免费方案,公司信息写 Launched in 2026。发帖人 Darshan(@ishudarshan)写自己是联合创始人;Akash Mandal 在帖里以 CTO 身份补充实现。Darshan 的原话是:AI 是单人的,真正的工作是多人的。团队里每个人各自付费、各自提问,再把答案贴回聊天。Velozity 把聊天、音视频(带转录)、任务、日历和文件放进同一处,并让 Agent 用你已经在付费的订阅(页面举例 Claude、Codex)工作,不另开一张 AI 账单。内置 Agent 名叫 Speed,官网写它从第一天就在团队里,不需要 Claude Code 或 Codex 订阅。人可以看见谁在线,敲同事的「cabin」直接说话,不用发会议链接。这次发布是他们自己在 Velozity 里排的。支持时间写为周一到周六 10:00–20:00 IST,回复时间 24–48 个工作小时。抓取时日榜页上的当前分数约 385、评论约 112。

产品要解决的问题
同一次工作被拆进聊天、会议和各自的 AI 窗口。换一个同事或换一个 Agent,上下文就要重讲一遍。

产品市场分析
发布页写给创业公司,以及研发、产品、销售、运营团队,或同时用好几个 AI 的个人。变现信号是「free to start」。这次没有抓到公开价目表。团队回复:任务按人分配,管理员在 Pro 上有团队活动仪表盘,也可以问 Agent 谁的未完成任务最多。自动标出过载的视图还没有。Akash 复述了按负责人查看任务和询问未完成工作,并确认自动检测过载仍未做。官网首页有四段客户引言,并附了他们自己的结果数字:Devcansol 写日常协作摩擦少 85%;Drivigo 写协调比原先快 4 倍;Sumit Nirmal 写每人每月少花 214 美元;Suraj Lal Mehta 写工具切换少 97%。这些是首页引言里的数字,不是独立审计。对照是继续用分开的聊天、会议和各自的 AI 订阅。有人把它比作从桌面 Office 到 Google Docs;Darshan 回复,治理是起点:离开工作区的东西要人批准。

产品上下游
上游是你已经付费的模型订阅、放进 Space 的文件,以及个人连接的邮件、日历和会议记录。团队回复,个人邮件、日历和会议笔记只由本人的 Agent 只读,不会因为同处一个 Space 就给同事的 Agent。放进 Space 的文件属于这个 Space:里面的人和 Agent 都能打开,Space 内今天没有按文件再分权限;私有 Space 只限被加进来的人。Agent 只在其主人已经加入的 Space 里跑,不会扩大别人的权限。工作区角色写为 admin、member、guest。下游是草稿,而不是直接发出去的邮件、消息、付款、签名或代码提交。Darshan 回复三步:Agent 把草稿放进 Space;对应的人批准、要求修改或拒绝;只有批准之后才发出。草稿在批准后若再改,需要重新批准。团队其他人也能看见草稿。每次运行记在 Space 里:谁问的、做了什么、改了什么。团队回复,Agent 可以改代码仓库并开 PR,合并仍走原来的评审;也可以设重复运行的 routine。聊天方面,团队一条回复写 Velozity 自己就是聊天,不架在别的聊天工具上面;同一问题下另一条回复写可以连接 Slack、Microsoft Teams、Discord、Telegram 和 WhatsApp Business,把那些对话的上下文拉进来,并自带聊天和 Spaces。官网演示里 Speed 读取的来源标为 Gmail、转录和文件。

2. GenPage 3.0 · 官网

标语:Build, personalize, and optimize landing pages with AI

背景
GenPage 3.0 日榜第 2,是 GenPage 的第 2 次发布,公司信息写 Launched in 2024。联合创始人 Samy Barbier(帖里署名 Sam)写,第一次在 Product Hunt 发布时产品还没有 AI,只做一件事:给每封冷邮件的对象单独一页,而不是同一套推销。他写 3,400 多个团队、超过 250,000 页之后,他们认为外联只是更大问题的一个症状:广告、关键词和名单都已按人分开,点击之后却落在同一张首页。3.0 按活动生成页面:ABM(account-based marketing,按目标客户单独做销售)给每个目标账户一页;Google Ads 给到活动、广告组和关键词;LinkedIn Ads 对准点击的受众;外联给每个潜在客户一页。流程写为:从网站、幻灯和文档学习品牌;连接 HubSpot、Salesforce、Clay 和广告账户;用提示、网址、截图或文档生成页面;按融资、招聘、LinkedIn 或新闻做研究;用 Variables Agent 填变量;把 URL 推回 CRM、序列工具或广告平台;用 Autopilot 持续测试;用 Concierge 做访客资格判断;并提供分析、热图、回放和实时提醒。他还写了 40 多个集成、API 和双向 MCP(Model Context Protocol,让外部工具按约定读写产品的接口)。发布日优惠码 PRODUCTHUNT50:任意付费方案 3 个月五折,年付则一整年五折。抓取时日榜页上的当前分数约 375、评论约 52。

产品要解决的问题
获客已经按受众、账户和关键词分开,落地页仍是同一张。做一页一活动要设计师和开发,团队没有这个时间。

产品市场分析
官网写给营销、增长和 GTM(go-to-market,把产品送到买家面前的销售与市场动作)团队。定价页在选中年付时列出:Free 每月 0 美元,页头写年付相当于少付两个月;Pro 每月 79 美元;Scale 每月 249 美元;Ultimate 为定制。月度额度在表上对应 100、500、2,500 和定制。Free 含 1 个席位;Pro 写无限席位、自定义域名、去掉「Made with GenPage」、MCP 与 API、GTM 与 CRM 集成。Scale 在此之上写自定义脚本与 HTML、Webhooks、SDK、BYOK(bring your own key,用自己的模型密钥)、会话回放与热图、无限工作区。Ultimate 写包含 Autopilot、品牌知识库、专属客户经理,以及 SSO、RBAC、可选欧盟或美国存储。广告模块标为附加,从每月 399 美元起,更高档显示为已包含。积分:发布一个变体 1 分,10 次 AI enrichment 1 分,生成页面随模型和复杂度变化。月度积分每周期重置;另购积分滚动保留 12 个月,100 分 25 美元起。已发布页面保持在线不耗积分。Samy 在帖里写现在可以免费开始、100 积分、不需要付款。Autopilot 和品牌知识库出现在发布说明里,定价页则把它们放在 Ultimate。他回复 Autopilot 仍是近期上线的 Beta,还没有可以公开的指标。销售外联的 A/B 测试里,他写相对纯文本外联看到 2–3 倍转化;LeadCat 的案例是会议多 3 倍。官网另写「up to 3x higher conversions」、会议平均 3 倍、头部活动转化提升 30% 以上、今年创建 20 万页以上、G2 平均 5/5,以及 3,400 多个团队。Webtouch 案例页写 55 万美元管道、12 个新客户、30% 回复率、6,678 封邮件,并写他们把用法扩到 20 多个客户。有人拿 Mutiny 比较;Samy 回复两边都做个性化页面和 ABM,Mutiny 现在更宽,包括账户研究、提案和 deal room;GenPage 把页面接到外联名单和广告账户,并加上点击之后的分析和 Autopilot。官网导航里还有与 Clay + Webflow、Unbounce、Instapage 等的对比页,本文没有逐页核对。

产品上下游
上游是现有网站和设计、品牌文档、CRM 或 Clay 里的名单、广告账户里的关键词,以及 GenPage 自己的研究。动态变量是页面里的占位符,例如公司名或痛点,由名单、CRM 或研究填上。Samy 回复:先做好基础页,再指定哪些区块固定、哪些可变;Autopilot 在你划定的范围内生成变体并分流,你选择上线的变体和赢家。他写不能保证每次改动都提高转化。下游是放在你自己域名上的页面、推回 CRM 或广告平台的 URL,以及热图、回放和 Slack、Gmail 提醒。FAQ 写 GenPage 本身不直接改变邮件送达率,链接是落地页;他们建议小批量外联时可以把链接放进第一封邮件,大批量时先把个性化页面当作软性邀请。积分用完后已发布页面仍在线。

3. IrisGo for Solopreneurs · 官网

标语:AI workflow automation: show it once, let it run

背景
IrisGo for Solopreneurs 日榜第 3,发布页标为免费,公司信息写 Launched in 2026,并写首次发布日为 2026-04-16。这次发布页把 IrisGo 写成 Windows 和 Mac 上的 AI 操作系统:Watch & Learn 看你做一遍,收成可复用流程,再换输入重跑;另有每日简报、重要邮件和下一步。面向一人公司的页面写,Beta 期间免费,用来交待重复的行政工作。讨论里回复的是 Jeffrey Lai 和 Yuan Sun。官网首页把 Watch & Learn 写成录下工作流、变成可自主运行的技能,并写利用本机 NPU(神经网络处理器,电脑上专门跑模型的芯片)和 GPU 做本地推理。首页列出的支持方包括 Andrew Ng 的 AI Fund、Pegatron Ventures、Intel、Google for Startups 和 NVIDIA Inception,并写与 Intel 及 AI PC 厂商合作,图标里有 Acer、Windows 和 Apple / Mac。公司 2026-05-20 的新闻稿写,Watch & Learn 在 Windows 和 Mac 进入公测,并提到 Acer Swift 16 AI 等设备上的预装;同一稿称创始工程师来自 Apple 的 Siri 团队。下载页抓取时 macOS 为 Apple silicon 的 DMG,版本 v0.2.5,另有 Windows 64 位安装包。抓取时日榜页上的当前分数约 362、评论约 82。

产品要解决的问题
一人公司的收件箱、跟进和跨工具报表每天都要重做。把这些写成脚本或宏,界面一改就断。

产品市场分析
这次发布页写给 solopreneur(一人经营的创始人)。Yuan Sun 回复,产品可以跟着业务变大:一个人时它处理重复的桌面工作和跨工具报表;有团队之后,录下的流程变成可共享的 playbook。这次发布特意展示创始人和一人公司。变现信号是发布页写 Beta 期间免费。这次没有在官网抓到现行价目;第三方对「大约每月 20 美元」的转述没有放进本文。Jeffrey 回复,自动化要操作系统权限。有人问界面改版或 A/B 测试会不会让流程断掉;他回复,这不是按固定坐标点击的宏,而是用视觉模型理解界面元素,并配合实时导航、校验、按指令重放或重录,以及绕过界面的直接集成。下载页同时提供 Mac 和 Windows,发布讨论里也有人专门因为 Windows 支持而来。对照是自己做宏、或只用只支持 Mac 的电脑 Agent。

产品上下游
上游是你演示的那一遍操作、屏幕和本机应用,以及你设下的运行时间、日程和结果送到哪里。Jeffrey 回复,自主运行前你会先批准这套流程。简历下载这种条数不固定的列表,他写系统把演示当成模式:逐条处理,并用视觉或无障碍检查判断何时没有下一条,重放时还可以用自然语言改命名格式。有人问它算不算另一套操作系统;抓取到的讨论里没有团队把这句话收成「替换 Windows 或 macOS」。下载物是跑在这两套系统上的应用。下游是本机上的技能、简报和跨应用动作。Jeffrey 回复隐私结构:录下的流程、屏幕快照、音频转录和记忆库存在本机,不持续同步到他们的服务器;只有处理某一步所需的文本或界面上下文会发给 LLM API;不出售数据,也不用个人活动训练公开模型;可以查看、删除、暂停或清空。邮件分拣里哪些步骤不经人确认、有没有每周回顾,Sara Ford 在帖里问过,这次抓到的回复里没有对应答案。

4. Databench by Alkera · 官网

标语:Open-source collaborative agentic workspace for data teams

背景
Databench by Alkera 日榜第 4,发布页标为免费,公司信息写 Y Combinator、Launched in 2026。它是 Alkera 产品里可自托管的开源子集,仓库 AlkeraAI/Databench 许可为 Apache-2.0,抓取时约 0 star。README 写:同一本笔记本里混用 SQL 和 Python,SQL 单元把结果交给后面的 Python 当 dataframe;笔记本是兼容 marimo 的普通 Python 文件。marimo 是一种会按依赖重跑过期单元的开源笔记本,发布页也写了这一点。Agent 和人一起实时改单元格。组织有密码登录、嵌套团队、邀请、角色,以及记录每次决定的授权层。每个组织一块共享盘。Agent 聊天在你选定的机器上的沙箱里跑,模型网关用你自己的提供方密钥。默认 harness(发起并约束这次 Agent 运行的程序)是 vendored 的 opencode,MIT 许可;Claude Agent SDK 写为进行中。计算来自本机 Docker 或通过 SSH 加上的服务器。另有网页客户端和带本地 daemon 的 CLI alkera。联合创始人 Tony 写,另外两位联合创始人是 Rick 和 Andrew;他以前做交易数据时,管道散在 Python 文件和仓库里,编程 Agent 不擅长跨工具的数据。一位以 CTO 身份发言的人写,Jupyter 配 VS Code Live Share 会单元格失步,Agent 加进来更乱,而且有意思的分析往往不在笔记本上、尤其涉及 GPU。抓取时日榜页上的当前分数约 264、评论约 15。

产品要解决的问题
数据结论要能指回代码和数据,人和 Agent 还得同时改同一本笔记本。远程计算通常是后补上去的。

产品市场分析
发布页写给数据科学、分析和工程团队,可在 alkera.ai 用免费额度,或自己托管。README 写 Alkera 是功能更多的商业产品,并带有 generous free tier;这次没有抓到 Alkera 的价目数字。有人问竞品;团队回复,面向终端用户的对照包括 Hex,相对 Hex 和 Sigma,他们能看见整层数据,从而做原本要数据工程师搭的分析管道,并把可复现和「这个结论怎么来的」放在企业场景的前面。官网首页同时又把 Hex、Sigma 和 Snowflake、dbt、BigQuery、Databricks 等列在可连接的工具里。自托管的单机栈需要 Docker Compose v2 和 Anthropic 或 OpenAI 的 API key;README 写该栈使用开发用密钥、端口绑在本机,只适合自己的机器。给别人访问的部署用另一套生产 compose,并要求真实密钥。

产品上下游
上游是 SQLAlchemy 能连的数据库(发布页举例 PostgreSQL、SQLite、MySQL 等)、你的模型密钥,以及通过 SSH 加进来的 Linux 机器(x86_64 或 arm64,systemd)。官网首页还列出仓库、编排、BI 和知识库一类连接,包括 Airflow、dbt、Fivetran、Looker、Tableau、Notion、Slack、GitHub。下游是笔记本、图表、可分享且会跟着变的仪表盘,以及带来源、并标明是否人工核对过的知识条目。首页写列级血缘横跨仓库、转换和分析,并可以在沙箱里试改动。GPU 部分写给笔记本内核一台专用 GPU 节点;首页示例标了 8x NVIDIA B200,这是页面上的示例配置,不是本文另找的套餐价格。Agent 的编辑和人的光标出现在同一本笔记本里,结果要能追回数据和代码。

5. Pegasus 1.6 by TwelveLabs · 官网

标语:Transforms egocentric video into robot training data

背景
Pegasus 1.6 日榜第 5,是 TwelveLabs 的第 7 次发布,公司信息写 Launched in 2025。联合创始人兼 CTO Aiden Lee 写,机器人和物理 AI 团队堆着第一人称素材,用来做动作标注和下一动作预测,而通用视频模型主要在转播和第三人称画面上训练,对着可穿戴相机或机器人自己的相机时会漏掉正在发生的事。Pegasus 是他们的视频语言模型:看着视频,生成摘要、标签、时间戳或按自定义结构抽出的文字。1.6 在 1.5 的 Time-Based Metadata(按你定义的字段,抽出带时间戳的结构化元数据)上增加第一人称视频和任务叙述,并加强手、工具和物体交互的识别,以及长视频上的实体识别(凭上下文说出画面里是谁)。文档写新增:可穿戴和遥操作(人远程操控机器)画面、每次请求 1 到 20 张图像、不太依赖分段定义的元数据、分段内部的时间戳事件,以及去掉 token 上限后的分段(结果不完整时任务仍结束,并标明可能不全)。上下文窗口 261,120 token,输入和输出都算在内。单段分析最长 2 小时;整文件最长 4 小时时只能分析其中一段。语言上英文为完整支持,中文等 12 种为部分支持。Aiden 写,标注可以进训练管道,而不必做他称为每小时素材 4 到 22 美元的人工标注。迁移指南写:把模型名改成 pegasus1.6 即可,其余请求可以不动;不写模型名时仍用 1.5;批量分析还不支持 1.6。抓取时日榜页上的当前分数约 250、评论约 19。

产品要解决的问题
第一人称和遥操作录像是机器人训练的原料。通用视频模型看不懂手在做什么,人工把它们收成带时间戳的动作标签又很贵。

产品市场分析
发布页的标签是 Robots、Artificial Intelligence、Video。文档把新增用途写成动作标注、对照预期行为做质检、预测遥操作里的下一步、图像对比,以及视频分段。官网仍把平台卖给媒体、体育、广告、政府和安防等大规模视频库,模型分 Marengo(嵌入,用来搜索)和 Pegasus(生成文字)。公司页写 SOC 2 Type II、可部署到你指定的位置。这次发布没有单独的价目;官网是 Try Free 和 Talk to Sales。有人问是否依赖现有商业模型;抓取到的讨论摘录里没有团队对这句话的直接答复。有人问第一人称视频会不会成为机器人训练的主要数据来源;TwelveLabs 的 Yash Gugale 回复,这是他们在这个方向上看到的主要 traction,模型按质量和规模来做。有人问 Bedrock 托管,摘录里没有答复。对照是继续用第三人称视频模型,或继续人工标注。

产品上下游
上游是原始的可穿戴、遥操作或机器人机载录像,以及你定义的分段字段;也可以是最多 20 张静止图像。文档写视频分辨率从 360×360 到 5184×2160,文件不超过 10 GB,格式需 FFmpeg 支持;图像为 JPEG、PNG、WebP、GIF、BMP,单张不超过 20 MB。通过公开 URL 上传时要直接指向原始视频文件,视频网站和网盘分享链接不支持。下游是带时间戳的动作标签、合规类评分和可进训练管道的元数据,以及分段内的事件列表。Aiden 写 1.6 不要求特定相机。官网另写索引速度大约为实时的 60 倍、每天 1 万小时以上,那是平台页的基础设施说法,不是这次单独为 1.6 标出的基准。

6. Figma Agent · 官网

标语:Prompt, edit and prototype without leaving the canvas

背景
Figma Agent 日榜第 6,是 Figma 的第 34 次发布,公司信息写 Launched in 2015。发布说明写:Agent 就在 Design 画布上,使用真实的组件、变量和团队文件,而不是一张扁图。它可以生成布局方向、跨屏幕批量修改、把评论变成改动,并用提示做原型;通过 MCP 从 Notion、Slack、GitHub 和 Linear 取上下文;生成插件和 shader(在画面上做玻璃、折射这类视觉效果的小程序);把重复流程存成技能,用「/」运行。Hunter Kate Ramakaieva 强调,许多 AI 设计工具先给一张图,再由人在 Figma 里重建。帮助中心写,在图层上点 Agents,或按 Cmd / Ctrl + Enter 打开画布上的提示框;也可以从左侧栏打开持续侧栏。Full seat 且对文件有编辑权的人可以让它改文件;View、Dev、Collab 或只读访问只能聊天不能改;Drafts 里任何人都可以让它改。2026-06-23 起,新对话默认对同一文件里有编辑权的 Full seat 可见,更早的对话保持私有,除非你公开。The Verge 在 2026-10-06 写,这个设计 Agent 从 5 月的 Beta 进入普遍可用,并可以加入指南、看到同事的 Agent 在做什么。抓取时日榜页上的当前分数约 184、评论约 7。

产品要解决的问题
设计反馈和批量改字、改间距仍要人在画布上逐项点。另开一个 AI 工具生成图片之后,还得用自己的组件重做一遍。

产品市场分析
帮助中心页首写所有方案可用,表下又注明部分能力需要付费方案,Starter 免费方案没有。积分按任务复杂度变化,页内没有给固定单价。原型营销页则写 Agent 在所有付费方案里,当前开放 Beta 不消耗 AI 积分,并描述它会把屏幕连成可点击的流程。帮助中心的能力表把「Prototyping and interactions」标为 Coming soon,把矢量编辑、造图标、slots 也标为即将推出,把导出资源标为不支持。同一张表把技能、MCP、网页搜索、shader、插件、批量改内容、改组件实例、变量和样式、评论处理、设计反馈标为已支持。两套官方页面和 The Verge 的「已普遍可用」并不一致,本文并列。有人问能不能用 ChatGPT 订阅来驱动、能不能一次预览并撤销全部改动、组件实例会不会被拆离;抓取到的发布讨论里没有团队答复。帮助中心写聊天里的 Undo 撤销最近一次改动,并建议先复制再撤销以便对照。实例编辑写为改属性、切换变体、覆盖文字和图片,另有一项是修改主组件;这没有直接回答「会不会 detach」。对照是 Figma Make:帮助中心写 Make 用来生成可交互应用并发布到网页。另一个对照是 Figma MCP 的 write to canvas:外部编程 Agent 用插件 API 把内容写进文件,画布上的 Agent 再接着改。Agent 目前只在 Figma Design 的桌面应用或网页里,不在移动端。

产品上下游
上游是当前选中的图层、连接的设计库、用 @ 点名的组件和变量、贴上的文件或图片、网页搜索,以及 MCP 连上的 Notion、Slack、GitHub、Linear。下游是画布上的真实图层、评论、插件和 shader,以及发布说明和原型营销页所描述的交互原型。帮助中心仍把原型标成即将推出。可以并行跑多个提示,每个在画布上有进度。可以在聊天里停止当前任务。改动可以撤销,帮助中心写决定权仍在设计者。

7. Mistral Large 4 · 官网

标语:Mistral’s 1T parameter open weight frontier model

背景
Mistral Large 4 日榜第 7,是 Mistral AI 的第 24 次发布,公司信息写 Launched in 2023。2026-10-06 的官方公告把公开预览叫做 ML4,昵称 le Chonk:可在 Mistral Studio 使用预览 API,权重在本月内放出。公告写它是原生多模态、1 万亿参数、520 亿活跃参数的模型。文档页写更细:细粒度 MoE(mixture of experts,每次只激活其中一部分参数)、520 亿活跃参数、总量 1.05 万亿,另有 16 亿参数的视觉编码器;上下文 100 万 token;文档日期同为 2026-10-06,状态为 Public Preview、Open v26.10。产品页的发布摘要写的是 490 亿活跃参数,与公告和文档的 520 亿不一致,本文以公告和文档为准。文档上的模型名是 mistral-large-4+1。标价以促销价显示:输入每百万 token 0.68 美元(原价 1.36)、缓存输入 0.07 美元(原价 0.14)、输出 2.09 美元(原价 4.18)。功能列表包括结构化输出、函数调用、文档问答、批处理,以及 Agents 与内置工具。抓取时日榜页上的当前分数约 157、评论约 2。

产品要解决的问题
机构希望模型能力强,同时能在自己的机器上跑、自己定策略。闭源接口可以拒答,也可以在事件中途失去访问。

产品市场分析
公告写给金融、工程、制造、物流、制药、科研、航运和公共部门等他们正在合作的行业,并写欧洲区域由 Mistral 端到端运营、独立于其他数字服务商、适用欧洲法律。权重放出前,他们与网络安全方面的负责人、受邀伙伴和国家机构做真实场景的红队,这些对象使用同一模型的降低审核、扩大网络能力的版本。公告称这是 30 亿欧元 D 轮之后的第一个里程碑,并把该轮称为欧洲科技公司最大的股权融资;这是公司自己的表述。变现在预览期走 API 标价,权重按公告将在月底可自行部署。许可文本不在这次抓到的公告页上,发布标签写了 Open Source。文档列出的促销价如上。公告中的部分自测:Artificial Analysis Cyber Index 全球前五,并领先中国以外的开放权重模型;其中「复现开源软件里的真实漏洞再打补丁」一项为 82%,他们称为所有模型里最高;Cybench 40 道题解出 93%。他们写 Claude Opus 5.5 和 GPT-6 Astra 等闭源模型在同一项上接近 0 分,因为拒绝做这件事。编码方面:DeepSWE v1.1 为 61.7%,SWE-Atlas-QnA 为 59.4%,Terminal-Bench 4 为 28.3%,Coding Agent Index 合计 49.8%。Surge AI 的盲评里,ML4 Preview 在五个模型中编码质量第二(3.74),低于 Claude Opus 5(4.22)。视觉定位 Dense 200 为 42%,他们写超过 GPT-6-Astra 的 41%。AutomationBench 657 个业务流程为 59.9%。这些数字都来自 Mistral 的公告,不是本文复测。架构、更多基准和后训练方法,公告写将在放权重时一并公布。训练仍在进行,他们写还没有饱和。

产品上下游
上游是文本和图像,包括他们在演示里提到的工程图、图表、PDF 和大幅卫星图。训练侧,公告写从零开始,用 Mistral 自己在欧洲数据中心里的 3,800 块 NVIDIA Grace Blackwell GPU;预览也由这套基础设施提供。训练数据里有超过 160 种语言,包括欧盟全部官方语言。后训练用他们称为 Mistral Forge 的同一套训练、定制和强化学习环境;公告写当前规模约 3,000 GPU 时,一次训练每天大约产生 330 亿 token,其中约 160 亿是过滤和掩码之后可训练的补全 token。下游是 Studio 上的预览 API,以及月底起他们承诺的可下载权重,供私有云或本地部署。放权重之前,扩大后的网络能力只对公告里点名的那类红队对象开放。

8. Supademo AI Demo Agent · 官网

标语:Agentic demos like your best salesperson, without the salary

背景
Supademo AI Demo Agent 日榜第 8,是 Supademo 的第 4 次发布,公司信息写 Launched in 2022。联合创始人 Koushik Marka 写,互动演示已经做了多年,缺的是买家在夜里点完演示之后有人回答「这适合我的团队吗」。联合创始人兼 CEO Joe 写,他们想去掉预约演示的表单。Agent 用语音或文字提问、理解买家、调出对应的互动演示、视频或文档,按你的标准做资格判断并约会议,发布说明写大约 50 多种语言。买家自己点真实的分步演示,可以跳转、后退,而不是看一个不停讲的虚拟头像。Fredo Tan 回复,整个会话可以换成用户的语言,中途也能换,被调出的演示也会本地化;他并写 Supademo 网站已有日文版。用你已有的演示、视频、文档和网站训练。会话页有完整转录、AI 摘要和购买意向分;知识缺口标出答不好的问题。访客的赞踩还没有,Koushik 写已记入清单。抓取时日榜页上的当前分数约 155、评论约 13。

产品要解决的问题
买家在没人值班时看完演示,问题要等到下一个销售时段。约到演示之前,对方可能还没看见产品。

产品市场分析
定价页按创建演示的席位收费,外部观看不限。Free 每月 0 美元,1 个创建者,5 个引导式互动演示,50 段 4K 录像。Scale 每月 50 美元,年付折合每月 38 美元,按创建者计费。Business 每月 249 美元(年付折合 199),含 1 个创建者,额外创建者每月 50 美元。Growth 每月 450 美元(年付折合 350),含 5 个创建者。Enterprise 定制,从 10 个创建者起,含 SSO、数据驻留和多工作区。AI Demo Agent 是 Scale、Business、Growth 和 Enterprise 上的按量附加,不按席位。信用点:每次 Agent 回复 1 点,语音再按每 15 秒 Agent 音频加 1 点;买家自己点、Agent 没说话的时间不计费。典型 15 分钟通话大约 20 点。每个工作区起步 1,500 点(大约 75 通),页面写不需要信用卡,积分不过期。套餐 99 美元 1,400 点、299 美元 5,500 点、500 美元 12,500 点,也可在 99 到 5,000 美元之间自选。可选自动充值:余额低于 500 点时充 299 美元。Koushik 在帖里写前 75 通免费、不需要订阅;定价页则把 Agent 放在付费方案的附加项里,同时给每个工作区 1,500 免费点。两句都在公开页面上。Enterprise 的 Agent 页写额外有工作区治理、审计日志和限定来源。对照是预约表单、只说话不展示产品的聊天机器人,以及带虚拟形象的演示通话。

产品上下游
上游是你已经做好的互动演示、视频、文档和网站,加上你在构建器里写的话题范围、回避话题和自定义指令。Koushik 回复 Sara Ford:Agent 被限制在公司自己的内容上,无关请求(例如做作业)会被带回产品。下游是买家当时看见的那一段演示或文档、约到的会议,以及会话里的转录、摘要、意向分和知识缺口。积分按回复和语音计,不按买家独自点击的时间计。自动充值默认不在「必须开启」的描述里,定价页写它是可选的。

9. Rool · 官网

标语:Your private AI machine. Files, ideas, AI in one workspace.

背景
Rool 日榜第 9,发布页标为有免费方案,公司信息写 Launched in 2026。官网把它写成欧盟托管的一台云电脑:保存文件、运行软件,并使用他们在欧盟自托管的模型。聊天只是表面,后面是一台在任务之间保留工作和记忆的机器。发布说明写数据存在芬兰、适用欧盟法律;不卖数据、没有广告、不用你的内容训练模型。Casper Wilstrup 在帖里回复。他把 Rool 放在自托管和普通云服务之间:由他们运行足够多的栈(他点名 GPU)来支撑隐私承诺。多位使用者写用它做房屋翻修和申请的长期项目、统计软件里的编码、研究和图像;有人写它不像一味称赞用户的模型,Casper 回复他们有意压低这种讨好倾向。抓取时日榜页上的当前分数约 131、评论约 76。

产品要解决的问题
把文件和对话交给主流聊天产品,就要接受对方的数据用途。完全自托管又要自己准备 GPU 和运维。

产品市场分析
官网写给在意隐私的个人、团队和创作者。定价页抓取到三档,每档都从免费机器升级而来。Standard 永久免费,不需要信用卡:每天 240 点 AI 额度、2 台机器、每台 1 GB,余额每小时补充、上限 1,000,含完整 Object Memory 和前沿模型。Plus 每月 9 欧元:每天 1,200 点(页面写为 Standard 的 5 倍)、2 台机器、每台 2 GB,每小时补充上限 2,000,自定义子域名,以及连接器和 MCP。Pro 每月 25 欧元:每天 4,800 点(页面写为 20 倍)、5 台机器、每台 10 GB。抓取在 Pro 的存储一行结束,更高档或 Pro 的其余项目这次没有收全。讨论里有人提到从 ChatGPT、Claude 换过来,并担心能力差距;Casper 回复会尽量在质量上对齐,同时守住对方商业模式复制不了的隐私条件。本文没有独立的质量对比。

产品上下游
上游是你放进机器的文件和你发出的任务,以及 Plus 起可接的外部连接器和自定义 MCP。模型由他们在欧盟自托管,不走「把你的内容拿去训练」这条产品说明。下游是留在这台机器上的文档、软件运行结果和跨任务的记忆,以及你邀请的人。Casper 没有在抓取到的回复里反驳使用者的说法:这台机器在你提问时才做事。个人数据是否离开欧盟,以他们「机器和模型都在欧盟」的页面表述为准,本次没有另找审计报告。

10. Ownfeed · 官网

标语:A social feed of people who need your product

背景
Ownfeed 日榜第 10,发布页标为需要付款,公司信息写 Launched in 2026。运营者是日本神奈川的个人事业主 Shunsuke Nakagawa,支持邮箱 support@ownfeed.dev。用法是贴上产品 URL,系统读页面,每天从 Reddit、X、Bluesky 和 Hacker News 里留下「需要你所做的东西」的帖子。没有关键词设置,没有提醒收件箱,也不自动回复。你每天滚动大约五分钟,自己写回复。Shunsuke 回复排序:每条帖子有一个「值不值得回复」的分数(作者是不是在描述真实痛点、是不是在找工具),再加时间衰减;评论数和点赞数显示在卡片上,但不影响顺序。他写一条上百条评论的帖子常常是泛讨论,两条评论的帖子反而可能正是你要回的人。Sara Ford 问过要不要把讨论热度放进排序;他回复这还没做,已列入清单。发布当天他在帖里承认两处故障,并写当晚修好:托管在 Framer、Vercel 或 Webflow 上的站点被误判为私有地址;Stripe 结账页还在加载时按钮可以再次点击,第二次点击使第一次会话失效。抓取时日榜页上的当前分数约 128、评论约 43。

产品要解决的问题
需要你产品的人今天就在公开讨论里描述问题。用关键词盯收件箱,或者整段时间泡在论坛里,都会错过或看错对象。

产品市场分析
FAQ 写给做完产品、想找到正在寻找它的人的独立开发者。价格:1 美元试用 1 天,之后每月 39 美元,除非在试用结束前取消;或每 3 个月 89 美元。均自动续费,美元计价,结账时可能加税。取消后用到已付周期结束。三个方案都包含 Reddit、X、Bluesky 和 Hacker News。3 个月方案额外有小批量、无保证的 Beta 来源:LinkedIn、Threads、TikTok、Instagram、YouTube 和 Product Hunt。有人建议自动拟回复、翻译非英文帖、以及用赞踩训练相关性;这些是评论里的建议。Shunsuke 回复,匹配不依赖产品名,只描述问题的人也可以排到前面。对照是关键词提醒、自动代发回复的工具,以及自己搜索。首页用一个虚构的发票产品 Tidybill 走通流程,那些帖子是页面示例,不是客户案例数字。

产品上下游
上游是你贴上的产品页,以及上述平台的公开帖子。FAQ 写他们读产品页、搜索公开帖,再用 AI 留下产品用得上的那些。下游是你自己的时间线,不是代发的评论。Ownfeed 不登录你的社交账号,回复在你原来的账号里由你自己写。试用会准备最近一段时间的帖子;Shunsuke 在修好误判后,给一位用户准备了最近 7 天。首页写生成订阅源通常大约 15 分钟。评论里提出的翻译和相关性反馈,在抓取到的回复中还不是已上线功能。

今日 Hacker News 热榜前五里,两条都指向 OpenAI 刚公开的数学预印本库:第一条是整批结果的发布说明,第五条单独讨论其中的整数乘法。中间是 Mistral Large 4 的公开预览、把 PS5 可执行文件重链接到 PC 的 AnyPS5,以及 OpenAI Decisions API 的公测。数学仓库写明稿件处于不同核验阶段,并非篇篇都有 Lean 形式化;Mistral 的新闻稿和文档页对激活参数的写法也不一致。以下按 Firebase topstories 当时的顺序整理,分数与评论数为抓取时快照。

1. Sharing AI progress in mathematics

背景介绍
OpenAI 这篇发布页直连返回 HTTP 403,下面的页面原文来自 r.jina.ai 转写,并与 openai/math 的 README、CONTENTS.md 核对。页面说,他们放出一批由一个内部前沿模型做出的数学结果,模型链接指向此前的 Navier–Stokes 页面。发布方式参考了普林斯顿高等研究院「数学与人工智能咨询组」(AGMAI)的意见和公开建议:这次先放在 GitHub,并附上修订和引用规则;他们还在看有没有符合该委员会要求的社区托管方案。许多证明会用 Lean 写成可机检的形式化,拿到之后再补进仓库。页面还说会公开 10 份推理过程摘要、按 ChatGPT Pro 用量估算的算力,以及尝试过多少问题。平均每个结果所用的算力,大约相当于三小时的 ChatGPT Pro 思考。页面写,他们打算资助围绕这些结果的研讨和项目,并在准备把产出这些结果的模型负责任地放出来。

仓库 README 写得更具体,也更谨慎。稿件和证明附件来自一个尚未发布的内部模型;现有数学评测饱和之后,他们把评测扩到开放研究问题上,有些输出建立在模型更早的结果之上。目录里目前是 722 篇手稿、372 个族。一族可以包含主结果、伴随论证、推论或另一条证明。核验阶段并不整齐:不是每篇都有 Lean,README 写「有些尚未形式化的结果可能有问题」,并说会尽快修。绝大多数结果用同一套流程:平均每个结果三小时 ChatGPT Pro 算力,整个评测大约抛了 4,000 个问题,再按族和显著性收成现在的目录。README 点名的例外有两处:黎曼 ζ 函数的无零点区域,以及对 CM 阿贝尔簇的 Hodge 猜想的证明。另外,Re(s) > 11/12 这一无零点区域的文稿经过人工编辑,以便阅读。GitHub API 显示该仓库创建于 2026-10-06 21:47 UTC。

CONTENTS.md 里抽查到的几条,都是目录自己的表述,不是本文重新证明过的定理。第 102 族写,证明了 Khot 的 Unique Games 猜想:对任意固定的 ε、δ ∈ (0, 1/2),给出从 3SAT 到有限字母表 Unique Games 的确定性多项式时间归约,完备性至少 1−ε,soundness 至多 δ。同一族还写了若干直接归约,包括在无权图上、超过 Goemans–Williamson 比例的 Max-Cut 近似是 NP-hard。这一族标了 Lean 链接。第 180 族写,证明 Barnette 猜想:每个有限、简单、三正则、二部、平面、三顶点连通的图都有 Hamiltonian 圈;也标了 Lean。第 124 族写,解决 Garey 与 Johnson 书里的三台相同机器、单位工时、带优先约束的调度问题,给出确定性多项式时间算法,并标了 Lean。第 003 族写,每个 Dirichlet L 函数(含 ζ(s))在 Re(s) > 7/8 没有零点,并称之为拟黎曼假设的解决;伴随稿另给 Re(s) > 11/12 的证明,这一族同样标了 Lean。README 说 11/12 那篇文稿经过人工润色,无零点区域的工作和 CM 阿贝尔簇上的 Hodge 猜想不属于上面那套固定流程。整数乘法是第 109 族,放在本文第 5 条。

主要讨论方向与观点
讨论集中在「如果这些稿子成立,分量有多大」,以及还没人逐篇核完。enoether 说 Unique Games 猜想是复杂性理论里的基础猜想,很多不可近似结果以它为前提,一份站得住的证明是大事。prideout 点名 Barnette 猜想:几个月前用当时的前沿模型自己试过,没做出来;这份证明乍看还读得进去。NotOscarWilde 做调度,认为三机单位工时不如 Unique Games 重要,但从 Garey 与 Johnson 1979 年的书起就是开问题。他引用论文里的 Theorem 1.1:在确定性多带图灵机上,步数是 O((L+2)^150020),L 是输入的二进制长度。目录摘要只写「多项式时间」,这个指数来自该评论对论文的摘引,本文没有从 PDF 里再对一遍。他说自己今天核不了正确性,但希望这个指数是真的。

xanderlewis 引用 Kevin Buzzard 的话:Buzzard 在 2020 年《Notices of the AMS》里问过,若有一个人同时理解全部现代纯数学,他立刻还能多看多远;六年后开始看见答案的形状。schleck8 贴了 Anthropic 数学家 Levent Alpöge 的一段评论,把证明、零和计算机这一类历史进展,与「把过去十年糊在一起看、再用今天来度量」做对比,说没有可比较的东西。这段是 HN 上的转述,本文没有打开 Alpöge 的原帖。gizmodo59 认为这是一次没有伴随戏剧的进展,并建议把仓库交给自己的 agent 去估分量;评论里还有「相当于人类 50 到 100 年数学进展」的说法,那是评论者的判断。foota 引用了仓库里「平均每个结果大约三小时 ChatGPT Pro」那句。bashtoni 问的是就业:数学家会被替换,还是会多出一批审这些证明的工作,现在还不清楚。againstapples 以「AI doomer」的身份问非 doomer:这类结果在未来一到五年里,是平台期,还是只停在数学里。zone411 对照 proofatlas.ai 的开放问题榜,称这份目录声称完整解决了前 500 个问题中的 90 个,并列出他认为排名最高的若干项,其中包括有理数上的 Hilbert 第十问题、Unique Games、Anderson 模型的扩展态和时空 Penrose 不等式。本文没有核这 90 条;仓库里确实有标题对应 Hilbert 第十问题(有理数)和 Unique Games 的手稿目录。sebmellen 建议去读 reasoning_traces/,README 的十份摘要表里包括三维相对论 Vlasov–Maxwell 系统。

专有名词解释

  • AGMAI:页面上的全称是 Institute for Advanced Study 的 Advisory Group on Mathematics and Artificial Intelligence。OpenAI 说这次的发布形式参考了他们的建议。
  • Lean:可让计算机检查证明的形式化语言。README 写许多手稿已有形式化,但不是全部;未形式化的结果可能有问题。
  • Unique Games 猜想:Khot 提出的复杂性猜想。目录第 102 族声称用从 3SAT 出发的归约证明了它。完备性是「原问题可满足时,新实例里能满足的约束比例」;soundness 是「原问题不可满足时,任何赋值至多能满足的约束比例」。同一族还由此写到一批近似问题的 NP-hard 门槛。
  • Goemans–Williamson:Max-Cut 的一种半定规划近似算法。目录说,在无权图上,任何固定地优于该比例的近似都是 NP-hard。目录没有写出这个比例的小数。
  • Barnette 猜想:每个有限、简单、三正则、二部、平面且三顶点连通的图都有一条经过每个顶点恰好一次再回到起点的圈。目录第 180 族声称证明了它。
  • 拟黎曼假设:目录第 003 族用这个名字称呼「Dirichlet L 函数在 Re(s) > 7/8 无零点」。ζ 函数是其中之一。Re(s) > 11/12 是伴随稿,README 写那篇文稿经过人工编辑。
  • ChatGPT Pro thinking:OpenAI 用来给这批结果估算算力的单位。页面和 README 都写,平均每个结果大约三小时。

HN 讨论:thread · 362 分 · 299 评

2. Mistral Large 4

背景介绍
Mistral 于 2026 年 10 月 6 日发布 Introducing Mistral Large 4。HN 提交的 URL 末尾多了一个反斜杠,文章本身的地址没有它;模型卡在 docs.mistral.ai。博文称公开预览,非正式名字 ML4,正式绰号 “le Chonk”。预览 API 可在 Mistral Studio 试用,权重写在本月底放出。

参数有两套官方写法。博文写:原生多模态,1 万亿参数,490 亿激活,是他们至今最大的模型,并且还在变好。文档页 meta(页面标注 October 6, 2026、Public Preview、Open v 26.10)写:细粒度 Mixture-of-Experts,激活 52B,总参数 1.05T,另有 1.6B 视觉编码器。同一文档页的价格数据是:输入每百万 token 0.68 美元(划掉的 originalPrice 为 1.36)、缓存输入 0.07 美元(原 0.14)、输出 2.09 美元(原 4.18),上下文 1M。本文没有另找第三方价目表。

博文写,ML4 从零训练,用了 Mistral 自己位于欧洲的数据中心里 3,800 张 NVIDIA Grace Blackwell GPU,公开预览也由这套设施提供。权重放出前,他们与网络安全方面的负责人、受审合作方和国家机构做红队,对方使用同一模型,但审核更松、网络能力更宽。博文强调欧洲端到端部署,按欧洲法律、不依赖其他数字服务商;训练数据里有相当一部分是多语的,覆盖 160 种以上语言,包括欧盟每一种官方语言。定制和强化学习环境与卖给客户的 Mistral Forge 相同。博文还写,更细的架构、更多基准和后训练方法要等权重一起公布。

博文中的基准是 Mistral 的表述,本文没有重跑。Artificial Analysis Cyber Index 上,他们写 ML4 位于全球前五,并大幅领先在中国以外开发的开放权重模型;其中一项「在开源软件里复现真实漏洞再打补丁」的测试为 82%,是该项任何模型里的最高分。Cybench(40 道来自安全竞赛的练习)为 93%,称为开放权重模型里最高分之一。博文接着说,Claude Opus 5.5 和 GPT-6 Astra 在同一测试上接近 0 分,因为它们拒绝做这件事;而防守往往要从证明漏洞真实开始。内部测试里,模型被用于分析恶意软件、给漏洞排序和写检测规则。博文同时写,在 JailbreakBench、StrongREJECT 和 AgentHarm 的网络安全提示上,ML4 的平均拒绝率高于所有开放权重模型。

编程数字:DeepSWE v1.1 为 61.7%,SWE-Atlas-QnA 为 59.4%,Terminal-Bench 4 为 28.3%,Coding Agent Index 合计 49.8%,博文称高于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。Surge AI 的盲测里,职业标注者按 1–5 给编程质量打分,ML4 Preview 在五个模型里排第二(3.74),低于 Claude Opus 5(4.22),高于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40)。AutomationBench 的 657 个业务流程(Gmail、Google Sheets、Slack、Salesforce 等)为 59.9%。AA-Briefcase 的 Elo 为 1,393。视觉定位 Dense 200 为 42%,GPT-6-Astra 为 41%。开放权重模型里,SciCode-Verified 被写成领先;博文举例说它可以一次生成完整的 Hartree–Fock 模拟。法律和金融任务经由 vals.ai,博文称两项都超过 GPT-6-Astra;HarveyAI 的 Legal Agent 上超过所有开源模型。Lakera 公开的 B3 基准上挡住 93.3% 的攻击。KORA 为 1.691,满分 2,博文称为他们在开放权重模型里测到的最高。内部标注者拿它和 GLM-5.3 比:CAD 和 STEM 更偏好 ML4,金融和编程接近或持平。

后训练一节把预训练的 3,800 张卡和当前强化学习规模分开写:当前规模是 3k GPU,单次训练一天大约产生 330 亿 token,过滤和掩码之后约 160 亿是可训练的 completion token。博文写这次预览背后的强化学习还在跑,没有饱和的迹象。文末把 ML4 称为 €30 亿 Series D 路线图上的第一个里程碑,并称这是欧洲科技公司最大的一轮股权融资。这是博文自己的说法。

主要讨论方向与观点
simonw 试了推理档位:只看到 “none” 和 “high”。两边的思考痕迹都很少,high 的输出 token 甚至更少,但 high 画出的自行车车架更好。他把自己的鹈鹕骑自行车结果链出来,并说这是他见过的 Mistral 模型里最好的一张。chriddyp(Plotly)贴了他们的数据分析基准:相对 4 月的 Mistral Medium 3.5,价格约为十分之一,正确率从 58% 到 74%;还没站上帕累托前沿,但他认为再过几个月会很好。这些百分比和倍率是该评论里的结果,不是博文的数字。jakozaur 用 Vals Index 做了更宽的比较:48.05% 对 GLM-5.3 的 53.51%,每次测试 13.78 美元对 7.25 美元,并说很多公司仍会因为它不是中国模型而选用。他把 82% 叫成 CyberGym-E2E;博文的 82% 写在 Artificial Analysis Cyber Index 的那一项漏洞复现测试上,两个名字本文没有再对齐。

abixb 问基础设施:若大约 4,000 张 Grace Blackwell 就能把 1T 模型训到接近 Kimi K3、并在部分项上追上中国实验室,美国超大规模集群里的几十万张卡是在做什么。评论里点名的集群规模是评论者的说法。eigenspace 觉得这至少说明早期并不是赢家通吃、追赶不可能;Large 3 摔过之后 Mistral 还在,他希望它「够好」,成为欧洲的默认选项。michaelkdev 把卖点放在欧盟主权:在欧盟训练、在欧盟推理。prodigycorp 认为视觉和网络安全数字够做日常模型,网络安全上也许会成为首选,并说不该无缘无故贬 Mistral。simjnd 认为它比 DeepSeek 4.1 Flash 略低、规模大约两倍;对一个「本该几个月前发布」的模型来说已经不错。manlymuppet 的语气相反:讨论像在给最后冲线的孩子加油,Mistral 的进度比美国实验室和中国实验室都慢。

专有名词解释

  • MoE:Mixture-of-Experts。文档页写 ML4 是细粒度 MoE,所以激活参数远小于总参数。博文的 490 亿激活和文档的 52B 激活没有对齐。
  • Grace Blackwell:NVIDIA 的 GPU 平台。博文写从零训练用了 3,800 张,放在 Mistral 自己的欧洲机房;后文的强化学习规模另写为约 3,000 张。
  • Cybench:博文描述为 40 道来自安全竞赛的练习。93% 是博文里的分数。
  • Dense 200:博文用来比较视觉定位的基准。42% 与 41% 都出自这篇博文,不是本文复测。
  • Hartree–Fock:量子化学里近似电子结构的一套计算。博文说 ML4 可以一次生成完整模拟。
  • le Chonk:博文给 ML4 起的绰号。权重仍写在本月底,预览期间先走 API。

HN 讨论:thread · 1580 分 · 960 评

3. AnyPS5: Port PS5 binaries to PC without emulation (87% system libraries mapped)

背景介绍
AnyPS5 的 GitHub 描述是:把 PS5 可执行文件自动移植到 Linux 和 Windows。README 写,relinker 把可执行文件转成目标系统的原生格式,并提供一批可动态链接的系统 PRX 库实现。没有仿真,也没有单独的运行时进程。语言是 C++,许可证是 GPL-2.0 only。仓库创建于 2026-08-03。README 没有署个人真名,账号是 boykopovar。

HN 标题里的 87% 和页面徽章不是同一个数字。抓取时 libraries 徽章 为 86.62%,shaders 徽章 为 97.34%。README 的脚注写明:系统库百分比是项目迄今已知、并在 core/libs/prx 里声明过的函数所占的比例,不是全部 PS5 系统函数;分母会随着新声明变大。着色器重编译器在打开 ANYPS5_ENABLE_SPIRV_TOOLS 时,会用 SPIRV-Tools 校验生成的 SPIR-V。未支持或意外状态一律抛 std::runtime_error,把 what() 打到 stderr 后进程退出。

兼容表 COMPATIBILITY.md 里目前只有一行:Dreaming Sarah(ID PPSA02929),Windows 为 “In game, playable”,Linux 为 “?”。GTX 1050 Ti / i5-7500 3.4GHz 上 60 FPS,Intel HD Graphics 620 / i5-7200 2.5GHz 上 36 FPS。用法要求一份干净的 ELF,配套模块放在可执行文件旁的 sce_module/、sce_modules/ 或 prx/。relinker source/input.elf app.elf 产出 Linux ELF;加 --windows 产出 PE。--to-intel 给 Intel 主机。输出格式默认是 Linux ELF,只把文件名改成 .exe 并不会变成 Windows。手柄走 SDL 映射;键鼠用 anyps5-input.ini。

免责声明写:项目用于互操作、研究、保存和兼容,不包含、不分发、也不要求版权软件、固件、密钥或专有库;使用者自行遵守法律和许可。技术债文档写,Windows 构建需要特定的 MinGW-w64 GCC 15.2.0,并且若干对话框库是静默桩:存档、消息、错误和登录对话框不画出真正的界面。

主要讨论方向与观点
someperson 建议本地做 git 镜像,因为项目以后可能被法律投诉下架,并举 Yuzu、Ryujinx,以及 Nintendo 在一天内清掉大批 Switch 模拟器仓库的报道。causesothere 好奇是谁在做这种东西:太受欢迎的话,像是在请政府上门;同时认为问题本身在技术上有意思,也高兴有人在保存游戏。weakened_malloc 支持打破厂商锁定,但担心这会推动 Sony、Nintendo 和微软更偏向云游戏,让这类移植更难发生。dukodk 问会不会在发售日就有 GTA 6 的 PC 移植。vuurmot 接着问:若第一天就能把游戏剥出来,谁还会付钱,软件产业权重大的国家会不会被压垮。这两问都是推测,兼容表里并没有 GTA。

emkoemko 问这是不是 WINE 那种做法。Xirdus 回复:介于 Wine 和 Rosetta 之间;二进制本身会被改写,但源和目标都是 x86,所以没有指令转译。isityettime 接着问,这听起来不就是 Wine。README 的原话是重链接到原生格式,加上系统库的重新实现,没有仿真,也没有单独的运行时进程;它没有使用 Wine 或 Rosetta 这两个名字。dsedgwick 认为,既然 PS5 已经是 x86-64,摩擦主要在专有图形 API,并问 GNM 命令缓冲是在静态重链接阶段预先编成 Vulkan,还是游戏排队绘制时仍有运行时拦截。README 确认着色器重编译器产出 SPIR-V,没有写 GNM 命令缓冲的处理方式。

专有名词解释

  • PRX:PlayStation 上的可重定位系统库模块。AnyPS5 重新实现的是项目已经声明的那一部分,徽章分母会变。
  • relinker:仓库里的转换器,把 ELF 收成 Linux ELF 或 Windows PE,再链到这些库。
  • SPIR-V:着色器的中间表示。README 写重编译器能生成它,并用 SPIRV-Tools 做校验。
  • GPL-2.0 only:GNU 通用公共许可证第 2 版,不含 “or later”。
  • Wine / Rosetta:Wine 在非 Windows 上翻译 Windows API,而不是仿真 CPU。Rosetta 是苹果在不同 CPU 架构之间翻译指令的兼容层。Xirdus 用这两个名字描述 AnyPS5;README 没有使用它们。

HN 讨论:thread · 54 分 · 15 评

4. Decisions API is in public beta

背景介绍
OpenAI 的 Decisions API 指南 写,这个接口评估文本、图像或两者,返回带类型的答案,速度大约是 Responses API 的 10 倍。用途是判断条件是否成立、从固定选项里选一个,或按量表打分,用来分类、路由和排优先级。接口处于公测,文档预期未来几周进入 GA。目前唯一可用的模型是 gpt-6-luna,端点是 POST /v1/decisions。

三种问题类型:predicate 检查一个条件,返回 0 到 1 的概率,表示模型估计该条件为真的程度;choice 从调用者给出的选项里选一个,并返回各选项概率和一个 confidence;score 按从低到高的等级打分,返回的分数是等级下标的概率加权平均,因此可以落在两个等级之间。文档里的例子:0.1、0.7、0.2 三个概率得到 1.1。需要自由生成、符合自有 JSON schema 的对象时,文档建议用 Responses API 的 Structured Outputs;需要模型发起工具调用时用函数调用。相互独立的问题可以放进同一次请求;若后一个问题依赖前一个答案,则要分成两次。

图像必须是内联的 base64 data URL。托管的 HTTP/HTTPS 图片 URL 和 file_id 不受支持。定价写在 gpt-6-luna 上:输入每百万 token 0.10 美元,只对输入 token 收费,没有缓存读、缓存写或输出 token 的费用。区域处理加价和长上下文乘数仍然适用;同一模型走其他接口时,按那些接口自己的价格。文档写,符合条件的客户可以使用 Zero Data Retention 和 HIPAA;数据驻留和区域处理支持美国,以及欧洲(EEA 与瑞士)。

主要讨论方向与观点
simonw 贴了一次真实调用:输入 “I am angry about the new product feature”,两个 predicate 分别问是不是投诉、是不是夸奖,返回概率 0.91 和 0.06,output_tokens 为 0,输入 310 token。他把这收成一个 llm 插件 llm-openai-decisions,并说 OpenAI 单独开一个端点时,常常会变成其他供应商跟着做的事实标准。TSiege 把这次发布读成对 Jev 的回应,并认为这能说明 AI 生意是大宗商品:Jev 证明了又快又便宜的是/否/置信度就够用,开源版本涌进 Hugging Face,大实验室若想留住客户,就得把原本靠输出 token 赚钱的一块让出去。sidcool 说 Jev 震动了行业,事后看很明显。jasonjmcghee 回想起早期补全 API 和指令 API 分家,问这种接口以后会不会被折进模型的后训练,让校准过的输出变成模型本身的能力。swader999 问,为什么不直接做进所有模型,而要单独一条路由。

Topfi 用不到 600 次调用,经 OpenRouter 把自己的决策评测(界面组件选择、聊天图表、标签、个人知识管理)拿去对 Jev 和 Mercury Decide。他的初步结果:比 Jev 慢,延迟和 Mercury Decide 差不多,但并不随输入变长而线性增长(p50 346ms,p95 860ms);在他那些含糊的界面任务上置信度更低,0.6 及以下常常达不到他的用途;失败调用 4 次,两家对照都是 0;平均比 Jev 贵约 3.1 倍。他尚未测试图像输入,并说这套评测绑在自己那个带无限画布的 Firefox 分支上,不能当成通用结论。MiroslavPokorny 针对文档里「罐头有没有凹痕」式的商品损坏示例,问知道这一点有什么价值。mrkn1 另指了一条在 CPU 上跑决策模型的项目 gutsy,本文没有展开那条线程。

专有名词解释

  • predicate / choice / score:Decisions API 的三种答案。第一种是条件为真的概率;第二种是无序类别;第三种是有序等级的期望下标。
  • confidence:choice 和 score 在概率分布之外另给的字段。文档建议用自己的标注样本来定路由阈值。
  • gpt-6-luna:文档写明,公测期间这个端点只有该模型。这里的 0.10 美元/百万输入 token 只适用于 /v1/decisions。
  • Zero Data Retention:文档中的零数据保留选项,限于符合条件的客户。
  • Jev:评论里用来对照的决策模型。TSiege 把它描述成便宜的是/否/置信度接口,并说开源版本已经很多。本文没有另抓 Jev 的产品页。
  • Responses API:OpenAI 用来生成文本和工具调用的接口。Decisions 文档用它做速度和用途上的参照。

HN 讨论:thread · 121 分 · 51 评

5. Integer multiplication below n log n

背景介绍
这一条是第 1 条同一个仓库里的单篇预印本,日期写着 2026 年 9 月 23 日,作者栏是 OpenAI。目录里的 README 只有标题、日期和 BibTeX,正文在 paper.pdf。CONTENTS.md 第 109 族的摘要是:在一台固定的、有限字母表、有限条一维纸带的图灵机上,对每一个输入长度,把两个 n 比特整数精确相乘,确定性最坏情况时间为 O(n (log n)^{1−κ}),其中 κ = 2^{−182}。目录说,这在普通多带比特模型里否定了 Schönhage–Strassen 关于 n log n 最优的猜想。手稿简介里的对数写成 lg,族摘要写成 log;两者都在同一个大 O 和同一个指数下面。

和第 1 条里几篇不同,这一族的标题下没有 Lean 链接,仓库里也没有 lean/docs/109。第 102、124、180 和 003 族则标了 Lean。本文没有运行那些形式化,也没有把这篇 PDF 逐页核完。第 1 条的 README 仍然覆盖它:未形式化的结果可能有问题;平均结果大约用了三小时 ChatGPT Pro 量级的算力。那是整批目录的平均值,不是这篇单独标出的耗时。

主要讨论方向与观点
线程几乎全在谈这个指数有多小,以及没有机器检验时该不该信。shmoil 说自己对着 n lg n 的 (1 − 2^{−182}) 次方笑出声。12390asdjkas 写,这适合「数组至少有 2^118000 个元素」的场合,除非加速是真正一般的,否则不会在意各种乘法加速的提案。2^118000 是这则评论里的说法,不是目录里的门槛。MinimalAction 问,既然看起来没有低出阈值多少,为什么还值得注意。isaac-harvey 回复:只要任何一点低于 n log n,就说明上面可能还有空间;理论上很小的突破,常常会引来后来真正把差距拉开的工作。Kotlopou 把兴趣放在应用之外:用上万亿美元的技术,才知道两个数可以乘得稍快一点;数学比大模型大,声称数学正在被「解决」、开放问题快要用完的人,还没有朝这口深渊里看够。infocollector 说,若有人真能读懂,这会很惊人。

wk_end 直接问有没有配套的机器检验证明。他写自己工作里已经是 vibe-code,所以既知道前沿模型有多强,也知道它们会很有把握地讲出错事。没有 Lean 开发或充分的人工核验,他就保持怀疑,甚至有点希望结果是错的:一部分是因为他对 AI 并无好感,一部分是因为 n log n 比现在这个界漂亮得多。目录现状和他的要求对得上的地方是:整数乘法这一家没有挂上 Lean 链接。

专有名词解释

  • n log n:n 比特整数相乘时,人们长期对照的复杂度标尺。目录把 Schönhage–Strassen 猜想表述为:在普通多带图灵机上,这个量级已经最优。算法文献里,2019 年 Harvey 与 van der Hoeven 给出过 O(n log n) 的算法;本预印本声称再低一个 (log n) 的极小幂。
  • κ = 2^{−182}:目录里的指数。相对 n log n,比值是 1 / (log n) 的 2^{−182} 次方,所以对任何写得下来的 n,改进都极小。评论区笑的是这一点。
  • 多带图灵机:这篇复杂度陈述所用的计算模型。目录写明是一台固定机器、有限字母表、有限条一维纸带,而且每个输入长度都精确,不是近似或平均情况。
  • Schönhage–Strassen:1971 年的快速整数乘法,以及目录所否定的那条最优性猜想。猜想的原始论文不等于这份预印本。

HN 讨论:thread · 40 分 · 27 评

今日 Product Hunt 热榜对应太平洋时间 2026-10-06 日榜(上海时间 10 月 7 日上午抓取,太平洋时间当日尚未收盘)。前半段是把已经在用的编程 Agent 放进浏览器、给一次 Agent 运行留下跨系统的成本记录,以及在自己的电脑上组一支 Agent;后半段是用语音把点击和打字交出去、把 LinkedIn 外联交给自己的 Agent、用一套接口搭销售栈,以及把听写偏好从常用模型里导进来、用短课学编程、让 Agent 操作一台真 iPhone,和从收件箱发起删除个人数据。按日榜页名次,前五是 Rill Browser、AUDR by Chargebee、OpenBot、Incredible 与 Extrovert,后五是 Fuse AI、Willow Knowledge、Coddy、iphone-use 与 Ghostifier。前六名的分数和评论数取自同周周榜页上这些发布的当前分数(页面写分数是此刻的活跃分数);后四名这次没有核对到单独标出的分数字段。收盘前名次和分数仍可能变化。

1. Rill Browser · 官网

标语:The browser where Claude Code and Codex work beside you

背景
Rill Browser 日榜第 1,发布页标为免费,产品页写 Launched in 2026。发帖人 William(@williamgaoharvard)写,自己做这个浏览器是为了不用在「正在看的页面」和「编程 Agent」之间来回切换。它基于 WebKit(苹果的浏览器引擎),系统要求是 Apple silicon(M 系列芯片)和 macOS 14 及以上,页面标为 Beta。浏览可以不登录 Agent;AI 功能调用的是这台 Mac 上已经登录的 Claude Code 或 Codex,不另买订阅,也不要 API key。在任意页面按 ⌘E,把眼前的内容说成一项任务,Rill 从 Claude Code 和 Codex 的历史里找项目并把上下文带过去。也可以按主题整理标签、把历史收成可搜索的一天,以及把各项目里 Agent 做过的事放在同一张图上。语音输入在设置的 Talking 里,按住 Fn 说,页面写仍是 beta。William 回复进度显示:正在工作的 Agent 会出现在右下角的 At Work 托盘里,用颜色区分状态,并有一行当前进度。有人问为什么不做 Chrome 扩展;他回复扩展只能改浏览器里的东西,而他想把 Agent 放进「人产生想法的地方」,并感谢 WebKit,说他们看过 Chromium 的内部、复杂度很高。有人拿 Atlas、Comet、Dia 比较;他回复那些产品是在浏览旁边加 AI,Rill 要接的是能跑长时间任务的编程 Agent,并举 Astra 和 Fable 作为这类能力的例子,本文不另释这两个名字。抓取时周榜页上这条发布的当前分数约 361、评论约 55。

产品要解决的问题
想法往往出现在读网页的时候。要切到终端、找到仓库、把刚看到的内容再讲一遍,这一步会把想法丢掉。

产品市场分析
官网写给已经有 Claude Code 或 Codex 方案的人。变现信号是浏览器免费,模型费用走用户自己的方案。对照是继续用系统浏览器加终端,或使用在页面旁边加助手、但不把编程 Agent 当作一等公民的浏览器;后一句是 William 的区分。目前没有 Chrome 扩展。有人说因此用不了 1Password;William 回复密码存在 Mac 的 Keychain(系统钥匙串),可以从 Chrome 等浏览器导入,并写愿意以后支持第三方密码管理器。他另写将来会做「用一句话做自己的扩展」,左上角的画是留给这个功能的位置,今天还没有。

产品上下游
上游是当前页面、用户点出的位置,以及本机已登录的 Claude Code 或 Codex 和它们的项目历史。下游是落在对应项目里的任务,以及浏览器自己的标签、历史和钥匙串。官网 FAQ:新任务在你允许编辑之前是只读的,git 仓库里的每次编辑可以撤销。网页上的任务会在付款、下单、发送、发帖或删除之前停下,除非你明确说做完;它不能往密码、银行卡或一次性验证码栏里打字。Agent 把页面当成不可信文本。在项目里,Agent 用自己的标签浏览,不带你的登录,点击或输入要你允许;直接对网页下的任务会用到你的登录,限制同上。FAQ 写这降低提示注入(页面里的文字假装是指令)的风险,但去不掉。标签整理和「一天摘要」可以在设置里关掉。历史以文件形式留在这台 Mac 上。

2. AUDR by Chargebee · 官网

标语:Open standard for tracking agent run costs

背景
AUDR by Chargebee 日榜第 2,是 Chargebee 的第 6 次发布,发布页标签含 Open Source、Developer Tools、GitHub。AUDR 是 Agent Usage Detail Record 的缩写:一次 Agent 运行的用量明细记录。官网把它比作电信业的 CDR(Call Detail Record,通话详单):先记下用量,以后再定价。一条 JSON 记录带着 token、工具调用、计算秒数,以及客户、功能、环境这些业务字段。三条规则写为稳定、不经主版本不会改:运行 ID 由 harness(发起这次运行的应用)生成并传到后面的每一层;每个字段只有一个权威来源;汇合时冲突就拒绝,更正是新记录,不是改旧记录。规格页面为 openaudr.dev/spec/v1.0.0/。协议为 Apache-2.0,仓库 openaudr/audr 抓取时约 10 star。Chargebee 的 Akash Sharma 在帖里感谢早期审阅和倡导者,点名 Merge、Mastra 和 OpenHuman。讨论里有人问要不要把现有订阅迁过来;回复写不需要,AUDR 是用量记录格式,不是计费系统。有人问能不能接到已有的 Stripe;回复写计费仍留在 Stripe,需要一个把 AUDR 事件送进 Stripe meters 的 sink(接收端),已发布的第一个 sink 是 Chargebee 的,规格允许别人再写一个 Stripe sink。有人问能不能在用到月度上限之前自动告警;Dinesh Kumar 回复这是计费系统的事,AUDR 只规定怎么记。抓取时周榜页上这条发布的当前分数约 296、评论约 46。产品页上另有 14 和 214 两个数字,紧挨着奖项区,本文不把它算进这次发布。

产品要解决的问题
一次运行会经过应用、路由和工具。每一层都能看见自己的那一段,拼不成「这次是谁发起的、一共花了多少」。

产品市场分析
官网写给要回答功能成本、单客户用量和毛利、以及哪条工作流或哪个模型在烧钱的团队。变现信号不在规格里:规格没有价格和计费逻辑,SDK 里没有套餐或发票。Chargebee 是起草方和当前 steward(照管方),页面写采用变多之后希望把成本治理交给一个独立基金会。可以不接任何计费系统,把记录写到本地文件、仓库或可观测平台。Chargebee 公司介绍里的「6,500+ 企业」是计费产品的说法,不是 AUDR 的采用数字。

产品上下游
上游是 harness、路由和工具在运行时已经知道的标识、用量和时间;适配器页面写它们读这些,不读提示词和输出。已发布的适配器:NVIDIA NeMo Relay、LiteLLM、Merge Gateway、Vercel AI SDK、Mastra,以及可直接发记录的核心 SDK(Python 包 audr、TypeScript 包 @openaudr/audr)。OpenRouter 的支持页面写为还在做。下游是 sink:官网 FAQ 写今天有 Chargebee 和 Lago。PyPI 上的 audr-sink-chargebee 写它把记录打到站点的用量批量接口,没有 attribution.subscription_id 的记录不会送出。官网写发送在请求路径之外异步进行,正常情况不加同步延迟;若启用可选的出发前预算检查,那一次检查会发生在运行开始之前。和 OpenTelemetry(OTel,一套观测数据的开放约定)的关系写成叠在上面:可以沿用 GenAI 语义约定,也可以把记录发成 OTel span;OTel 不管「缺了归属怎么办、重试如何保持幂等、更正如何表达」,用量记录不能像丢掉一条 span 那样算了。和 FOCUS(云厂商账单的统一格式)的关系写成互补:FOCUS 统一你从云厂商收到的账单,AUDR 统一运行发生时你自己发出的用量,定价仍在后面。

3. OpenBot · 官网

标语:Grok Bot alternative: free, local, open-source, multiplayer

背景
OpenBot 日榜第 3,发布页标为免费,产品页写 Launched in 2026。讨论里以 OpenBot 身份回复的是 Kamil(@kamil_cyrek)。另有一条评论说 Norbert 已经介绍过产品是什么,本文没有再核对 Norbert 的职务。它是桌面应用:每个 Agent 有自己的名字、说明和工作区,可以互相发消息、移交任务、共享文件。提供方包括 Codex、Claude Code、Gemini、Grok、OpenCode、Cursor、Cline,也可以接 OpenAI 兼容端点、Ollama 或 LM Studio。换提供方之后,工作区和对话还在。内置浏览器、任务队列(可暂停、继续、取消)。工作区、对话、文件和浏览器数据放在运行 OpenBot 的那台电脑上。手机应用连到这台电脑;Kamil 回复远程查看是做移动版的主要原因,远程访问需要账号,单机使用不需要账号。有人问一个 Agent 把任务交给另一个时,原来的上下文还在不在;回复写各自保留自己的线程和工作区,移交走消息或共享频道,频道里看得到共享讨论,私人线程仍分开。有人问不同成员能不能给同一个 Agent 各写一套说明;回复写目前说明是团队共享的,要分开就得用不同的 Agent。Kamil 写过去一个半月发了 67 个版本。仓库 nightly-labs/openbot 抓取时约 399 star。抓取时周榜页上这条发布的当前分数约 272、评论约 34。

产品要解决的问题
云端的多 Agent 环境把文件和登录放在别人的电脑上。想自己留着数据、又让几个 Agent 分工,就要自己拼工作区、队列和互相发消息。

产品市场分析
官网把它写成 Grok Bot 的本地方案,对照页标注核对日期为 2026-10-02。目标是已经在为 ChatGPT、Claude、Gemini、Grok 或 Cursor 付费,或自己跑模型、又希望文件留在自己电脑上的人。软件本身标价 0 美元,没有锁功能;模型费走用户自己的方案。许可是 PolyForm Noncommercial 1.0.0:可以读、改、为非商业目的运行;FAQ 写这不是 OSI 定义下的开源许可证,商业使用要另拿许可。仓库说明写到 0.1.11 版(含)仍以 Apache-2.0 提供。不想一直开着自己的电脑时,对照页写可以租一台托管在欧盟(德国、芬兰或法国)的 Linux 服务器,起价每月 €20 或 $25,该页数字截至 2026-10-02。发布页标语里的 open-source,和 FAQ 里的许可限制,本文并列入上面两句。

产品上下游
上游是用户写下的任务、已登录的提供方,或本机的 Ollama / LM Studio。下游是本机 SQLite 里的工作区和对话、内置浏览器里的操作,以及可选的手机连接。用云端模型时,提示仍会发给那个提供方;Kamil 回复若改用 Ollama 或 LM Studio,提示留在这台机器。FAQ 写这是开发预览:Agent 可以不经逐次询问就读改文件、跑命令、用网络并控制内置浏览器,只适合交给你信任的任务。GitHub 连接写在更新日志里:装上 OpenBot 的 GitHub App 后,gh 和 git 以你的身份使用那些仓库,不需要个人访问令牌。

4. Incredible · 官网

标语:Vibe computing. Control your computer with your voice.

背景
Incredible 日榜第 4。这是产品页上的又一次发布;公司信息写 Launched in 2025,主页介绍仍是「替你在电脑上做点击和打字的桌面 AI」。按住激活键说话,也可以打字。它在你已经打开的浏览器、文件和应用里操作,激活之后才能看见当前屏幕,其余时间页面写屏幕保持私有。发送之前会先问你,可以改了再批,也可以随时停。系统要求定价页写为 macOS 13 或 Windows 10 及以上。首页举的例子包括把一封介绍邮件里的联系人放进 HubSpot、整理收据、筛简历、约会议。安全页写 SOC 2 Type 2(由 Sensiba 审计)、GDPR、静态和传输加密、不用客户数据训练。日榜页上 Sara Ford 问实现走的是操作系统无障碍树、网页 DOM,还是录鼠标轨迹,以及目标用户是不是低灵巧度人群;这次抓到的日榜摘录里没有团队答复。抓取时周榜页上这条发布的当前分数约 243、评论约 34。

产品要解决的问题
聊天机器人可以写出一段话,把这段话填进每一个应用仍要人做。重复的点击和粘贴占掉原来想做的事。

产品市场分析
定价按席位、按月,试用结束前不锁功能:Pro 每月 50 美元,Max 每月 179 美元(用量为 Pro 的 3 倍,支持靠前),Ultra 每月 500 美元(用量为 Pro 的 10 倍,可选和创始人共享的 Slack 或 Teams 频道,并写可用于 CRM、ERP 这类旧系统)。7 天试用包含 Pro 的全部功能,不需要信用卡;试用结束不会自动扣款,除非试用期内已经加了卡,那时会按 Pro 每月 50 美元继续。用量按人计算,不在团队内共享;加人或减人按剩余天数折算。团队方案本身没有单独的 7 天试用,同事可以各自先试用。大团队可以谈发票。首页写可以直接连接的应用超过 3,000 个,其余能在浏览器里打开的应用也可以用。首页另有一句「14 倍」:写明是在若干重复工作流上测的,结果因任务而异。CellMark 的 Håkan Enhager(VP Global IT & Digital)有一段使用引言,页面写 CellMark 在瑞典、法国和美国的办公室使用。替代方案是继续用聊天窗口再自己粘贴,或使用只在浏览器里操作的 Agent。

产品上下游
上游是你说的任务、激活后的当前屏幕,以及你已经登录的网站和本机文件。下游是它在这些应用里点完、填完的结果,以及到点的提醒。到达用量上限时它会暂停并告诉你何时恢复。无障碍树是否被使用,本次没有从讨论或文档里核对到。

5. Extrovert · 官网

标语:Run LinkedIn outreach from your agent

背景
Extrovert 日榜第 5,发布页标为 Free Options。这是第 5 次发布,产品页写 Launched in 2024。创始人 Oleg Sobolev 写,这次从「你自己操作的外联副驾」变成「你的 Agent 也能跑的外联」:找人、建活动、看评论、写私信、跟进,都可以交给 Claude、ChatGPT 或其他 MCP 客户端;原来的界面还在。它不按同一套步骤推所有人,而是看对方的帖子、你们的对话和你设定的节奏,决定下一条评论或私信。跟进可以发生在对方回复之后。联合创始人 Dmitry Bergelson 在讨论里被 Oleg 点名。有人问代理商能否让每个客户有自己的 Voice 和 playbook;Oleg 回复可以,一个人也可以为两套身份或两类客户各存一套。Sara Ford 问风格从哪来、能不能纠正反复的错误,以及「agent-in-the-loop」是什么意思。Oleg 回复:三到四条真实评论,加上几条你怎么开口、怎么跟进的消息,就可以开始;最好是你自己写过的。语气和内容分开,评论和私信分开设置。助手或你自己的 Agent 可以从帖子、旧评论、消息、网站或销售文档里帮你建 Voice,不是必须去解析整段 LinkedIn 历史。打开 Auto-learn 后,你改过并批准的评论会变成新例子;他写大约 20 条评论是一个起点。反复的错误要改底层指令,例如不要每条私信都以夸奖开头。agent-in-the-loop 指的是:Extrovert 仍准备优先级和草稿,审阅的人可以换成你的 Agent,它在你允许的范围内改和发,你留下想自己做的决定。抓取时周榜页上这条发布的当前分数约 231、评论约 45。

产品要解决的问题
一条一条看 LinkedIn、记住该跟进谁,质量高,也占掉大半天。群发序列又常常对所有人走同一步。

产品市场分析
Oleg 写最匹配的是 B2B 创始人、销售团队和代理商,尤其是销售周期较长的;求职者用同一套去认识招聘经理「说得通」,但他说经验和数据主要在 B2B 销售。定价页:每席每月 49 美元(一席对应一个 LinkedIn 账号),含全部功能、250 个被跟踪的潜客、1 个话题、每月 300 Credits;不连接 LinkedIn 的队友免费。页面写席位变多时单价会下降,具体阶梯这次没有从页面文本里取出。可选加购:多 250 个潜客每月 20 美元或每年 200 美元,多 2 个话题每月 15 美元或每年 150 美元,2,000 Credits 一次 29 美元,10,000 Credits 一次 99 美元。Credits 按来源计价,例如 Lead Finder 每个潜客 1 Credit,按关键词找帖子每个 50 Credits。未用完的月度 Credits 不结转,一次买的 Credits 结转。代理商页写订阅终身八折,或客户直接向 Extrovert 付费时终身 20% 佣金。定价页写 1,000+ 用户。Oleg 在讨论里给的使用数据是:事先没有评论时连接接受率 27.4%,两条评论之后是 41.1%。首页另有「60%+ 连接接受率」「回复率 2–5 倍」「52% 的回复发生在第 2 次及以后接触」等句子,和讨论里的 27.4% / 41.1% 不是同一句,本文不把它们合成一个数字。产品页 12 条评价、5.0 分,其中多数评价早于这次「交给 Agent」的发布。

产品上下游
上游是你描述的理想客户、LinkedIn 上的帖子和互动、你提供的写作样本和销售 playbook,以及可选的 CSV、CRM 或 Sales Navigator 导入。下游是待批准的评论和私信;Oleg 回复它不做邮件,也不管你的帖子或 newsletter。MCP、API 和 webhook 在定价表里列为包含。讨论里 Extrovert 写自己在底层使用 AI Ark 的数据做人和公司的补充,这是产品页「built with」里的自述。

6. Fuse AI · 官网

标语:Build a Custom GTM Stack. One SDK. One MCP.

背景
Fuse AI 日榜第 6,发布页标为 Free Options,并写有 20% off。产品页写 Launched in 2026,公司页有 Y Combinator 标记。发帖人 Saurav Bubber 把这次发布写成:用一个 SDK 和 MCP 覆盖原来要拼起来的 GTM(go-to-market,把产品卖到客户那里的整套动作)。他在帖里的类比是 OpenRouter、Apollo、Clay 和 Zapier 放在一起。涵盖的步骤他列为网页自动化、数据补充、多渠道触达、工作流和 AI Agent。MCP 地址写为 https://mcp.fuseai.com,登录后由 Agent 接上。Jay Smith 问它是否只管销售、不管营销漏斗;Saurav 回复营销漏斗也做。有人问自定义工作流难不难;回复写可以用平台上的自动化层,或把数据和发送基础设施接到自己的 CLI。Product Hunt 用户当周全部方案九折,是 Saurav 在帖里写的。抓取时周榜页上这条发布的当前分数约 230、评论约 29。

产品要解决的问题
外联常常同时开着找人、补数据、发邮件、发 LinkedIn、打电话和看意向的好几件工具。每换一步就要再接一次 API。

产品市场分析
官网写给销售和营销人员,并写被 1,000+ 家初创和企业的此类人员使用,这是站上自述。定价页(美元,月付;页上有年付八折开关):Free 为 0,每年 24,000 credits,1 个席位,数据补充、序列、研究 Agent 和实时信号都有限额;Solo 每月 60 美元,每年 48 万 credits,含 40+ 提供方的联系人补充、邮件 / LinkedIn / 拨号序列不限,以及 CRM、MCP、API、Slack;Team 每月 200 美元,每年 120 万 credits,5 个席位,研究 Agent、实时信号和并行拨号不限;Enterprise 另询,含 RBAC、SSO 和审计日志。首页对照表把 Fuse 的数据准确率写成 95%,Apollo 74%、ZoomInfo 82%、RocketReach 78%,表是 Fuse 自己放的,本文没有独立复核。首页还写 8.5 亿以上联系人、补充准确率 90% 以上、50 个以上实时信号,同样是站上自述。安全区写 SOC 2 Type I 为审计进行中,并列出 GDPR、CCPA 和 CASA Tier 2。替代方案是继续分别购买数据、序列和自动化工具。帖里的九折和定价页的年付八折是否叠加,本次没有核对。

产品上下游
上游是你的 ICP 描述、自有客户知识,以及 Fuse 接上的数据提供方和意向信号。下游是补充后的联系人、邮件 / LinkedIn / 电话序列,以及你在 MCP 或 SDK 上搭的 Agent。护栏页写可以规定 Agent 能碰什么、哪一步必须先经过人。

7. Willow Knowledge · 官网

标语:Your AI already knows you. Now Willow can too.

背景
Willow Knowledge 日榜第 7,发布页标为免费。这是 Willow Voice 的第 8 次发布,公司页写 Y Combinator、Launched in 2025。Willow 本身是语音听写:在任意应用里说话,它排版、改错、去掉口头语。这次的 Knowledge 由 Sharath Kuruganty 发布。做法是把 Willow 给的一段提示词贴进 ChatGPT、Claude、Gemini 或其他你在用的 AI,再把回答贴回 Willow,从而带入写作偏好和个人背景;可以先审、再改、也可以自己加。可以要求邮件短一点、用固定的结尾、避开某些说法;工作和随意消息可以各有一套偏好;还可以把 Notion 和 Google Docs 这类应用编成组。Sharath 写 Knowledge 可用于 macOS 和 Windows。Sara Ford 问这是不是 Willow 的「agent skills」;他回复可以这么理解:导入之后,听写和写作助手 Scribe 会更像你。Tori Seidenstein 问工作和私人账号的上下文能不能分开;Sharath 的回复集中在 Scribe 会读屏幕上下文加上你给的说明,没有直接说明多账号切换今天是否做好。产品页历史评价 11 条、4.9 分,针对的是 Willow 听写本身,不是这次的 Knowledge。这次发布的分数没有在抓到的产品页文本里单独标出。

产品要解决的问题
听写工具能把话说成字,但不一定知道你在邮件、Slack 和文档里各是什么写法。这些偏好已经存在于你平时用的模型里,却进不了听写。

产品市场分析
目标是已经用 Willow、又在别的模型里积累了写法和背景的人。Knowledge 这次发布标为免费;Willow 本体另有定价。抓取时定价页在月付和「省 20%」的年付切换旁,把 Pro 写成 15 美元和 12 美元(user/mo),Business 写成 35 美元和 28 美元每月,Enterprise 另询。免费档写为较弱模型不限量、Scribe 每周 20 次。帮助中心另写 Individual Pro 每月 15 美元(年付八折)、Team Pro 每人每月 12 美元且至少 3 席。两处计划名称没有在本次抓取里对齐,本文不把 12 美元同时解释成「年付折算」和「团队席位价」。帮助中心写 Enterprise 含 SOC 2 Type II、HIPAA、可强制的零保留和 SSO。替代方案是继续在每个应用里手写风格说明,或使用 Wispr Flow、MacWhisper 等听写工具;后几个名字来自产品页上的用户对比,不是 Willow 的官方对照表。

产品上下游
上游是你贴回来的模型回答,以及随后在 Willow 里改过的偏好。下游是 Scribe 和听写在当前应用里生成的文字。导入是否会把模型对话里的敏感内容一并带入,取决于你贴回去的那一段;Sharath 写可以审完再留。

8. Coddy · 官网

标语:Learn to code 20+ languages in a fun way with short lessons

背景
Coddy 日榜第 8,发布页标为 Free Options,产品页写 Launched in 2026。讨论里回复的有 Barak Glanz 和 Nethanel Bar。它用短课教编程:浏览器里的编辑器配测试用例,过关条件是代码真的跑过。语言列表在发布页写有 Python、JS、C++、SQL、Rust、Go 等 20 多种。AI 导师叫 Bugsy,给提示而不是直接给答案;Nethanel 回复,提示会给到它判断学习者已经太受挫的时候,然后才提供解答。Barak 回复 Sara Ford:练习的精神接近 coding kata(小而可重复的编程练习),另有每日挑战把学过的东西再用一次;路线可以是一门语言从基础到进阶,也可以是「做一个网站」这类把多门课串起来的目标路径。首页写共同学习的人数为 5,680,627、覆盖 202 个国家;发布页写 5M+,两处本次没有互相换算。平台为 Web、iOS 和 Android。发布页写 Product Hunt 访客 72 小时内任意方案五折,自动生效。这次发布的分数没有在抓到的产品页文本里单独标出。

产品要解决的问题
很多编程课是长视频或长章节,人在第二周左右离开。想每天只学几分钟、并且从第一分钟就写能跑的代码,课程结构对不上。

产品市场分析
Barak 写他们优化的是「三个月后还在学」,不是「一个周末把课刷完」。首页 FAQ 写可以免费开始,另有可选的付费档;具体价格这次没有从定价页核对到。FAQ 另写大多数初学者持续每天练习 1 到 2 个月能写出有用的代码,到可求职通常要 6 到 12 个月,这是站上的学习时长说法。每门完成的课有可核验的证书,可放进 LinkedIn 或简历。首页写 iOS、Android 和 Web 的评分为 4.9 星,没有附上评分人数。替代方案是长课程平台、只看不写的视频,或直接把题目交给会给完整答案的模型。

产品上下游
上游是课内的说明、测试用例,以及学习者写下的代码。下游是通过测试的练习、连续打卡和联赛积分,以及证书。Bugsy 的提示发生在课内编辑器旁边;Nethanel 写它和真正可交互的平台连在一起,不是单独一个聊天窗口。

9. iphone-use · 项目

标语:Let AI agents drive a real iPhone, even apps with no API

背景
iphone-use 在两次抓取的日榜页上都排第 9。产品页后来被站点拦截,讨论回复这次没有从产品页核对。项目仓库是 leeguooooo/iphone-use,作者写为郭立(Guo Li / leeguoo),抓取 GitHub API 时约 81 star,许可证 MIT,语言为 Rust。README 写:Mac 上的守护进程通过 USB 连接的 iPhone,跑一个基于 XCTest 的设备运行器(它替换了 WebDriverAgent,并说同一套 API),把屏幕读成文字,执行点击、滑动和输入,并明确告诉你动作有没有落到屏幕上。它不碰 Mac 自己的屏幕、光标或焦点。仓库简介仍写 WebDriverAgent 和 21 个 MCP 工具;README 写 MCP 服务器有 23 个工具,供 Claude Code、Claude Desktop 和其他 MCP 客户端使用,两处本次没有再对哪一版为准做第三次核对,功能描述以 README 为准。没有单独的营销站点,仓库主页字段是一条演示视频链接。

产品要解决的问题
没有 API 的 iPhone 应用,包括会挡住屏幕录制的银行和支付应用,Agent 看不见也点不了。只截 Mac 的屏幕,会漏掉这些应用,也会占用你正在用的电脑。

产品市场分析
README 写给要让 Agent 或脚本操作一台真实 iPhone 的人,并提供给人用的网页和原生 iOS 应用(实时画面、点击、输入)。变现信号是 MIT 和自托管,没有标价。重复任务可以存成 flow:按应用复查过的脚本,回放时不再调用模型,因此不耗 token。官方 flow 仓库为 leeguooooo/iphone-use-flows。替代方案是有 API 的应用直接调 API,或在 Mac 上做屏幕级 computer-use。系统要求:macOS 15 及以上、登录了开发团队的完整 Xcode(免费的 Personal Team 可以)、打开了开发者模式并用 USB 信任的 iPhone,以及 libimobiledevice。

产品上下游
上游是 Agent 通过 HTTP(/agent/*,默认端口 44321)或 MCP 发来的点击、滑动和文本,以及手机上的当前界面。下游是落在手机上的操作结果,以及可选的、不经过模型的 flow 回放。每次响应会说明动作是已应用、未发送还是未知,以及能不能安全重试;点在被挡住或隐藏的元素上、没有写进去的输入,会被拒绝或报告,而不是假装成功。README 的安全说明:密码只保护 44321 端口;手机上运行器自己的端口没有认证,应在可信网络里使用。安装文档包含一条从仓库拉取的安装脚本,是否执行由使用者自己决定。

10. Ghostifier · 官网

标语:Companies have your data. Ghostifier gets them to delete it.

背景
Ghostifier 日榜第 10,产品页写 Launched in 2026。作者 Jonathan Wise 在讨论里回复。它从 Gmail 出发,找出给你写过信的公司,退订、要求对方停止出售或共享,等过退货窗口后再发删除请求,并跟踪回复。银行、保险、医生、学校、雇主,以及密码管理器、邮箱、网盘、域名和加密资产,页面写永远不会被要求删除;近一年用过的和 Google、Spotify 这类家庭常用名字也不会被删除,但仍可按设置要求停止出售。数据经纪商即使没给你写过信也会被问到,页面写 220 家已登记的经纪商,包含在 Cleanup 和 Autopilot 里。没有模型,决定按固定规则走。Sara Ford 问如何只读邮件头;Jonathan 回复用的是 Gmail API 的 metadata 范围:发件人、主题、退订链接等头部,不包括正文。这个范围属于受限制范围,Google 要求第三方安全评估,他写评估还在早期,所以连接时可能看到 Google 的警告。有人拿 Aura 和 Incogni 比较;他回复那两家从经纪商名单做起,Ghostifier 从收件箱做起,希望在数据进经纪商之前碰到实际交易过的商店、应用和通讯;Incogni 覆盖的经纪商更多,Aura 还有信用监控和身份盗窃保险,Ghostifier 不做这两项,可以同时用。退货窗口他写为:距上一笔订单 45 天,或距上次送达 30 天,取较晚的那个。部分删除的持续监控,他写是以后想做的,不是今天的功能。这次发布的分数没有在抓到的产品页文本里单独标出。

产品要解决的问题
每家公司一份删除表格,很难做完。只向数据经纪商发信,又碰不到因为你下过单、注过册而持有姓名和地址的那些公司。

产品市场分析
官网写给想从自己的收件箱清理数据、并且使用 Gmail 的人。定价:免费档永久 0 美元,可看到扫描结果,并对支持一键退订的列表退订;Cleanup 一次 29 美元,含至今扫到的公司的选择退出和删除、220 家经纪商、按有法律规定的截止日期跟踪并在错过时跟进一次、每封请求留底;Autopilot 每年 59 美元(约合每月 5 美元,或按月 8 美元),另含之后新出现的公司、每天检查收件箱、退订后仍来信的跟进和每周摘要。60 天内从 Cleanup 升到 Autopilot,29 美元计入第一年。付款经 Stripe,页面写 Ghostifier 看不到卡号。页面上的「412 家公司」「已幽灵 17」等是示例仪表盘,不是本次抓到的用户统计。替代方案是 Jonathan 点名的 Incogni、Aura,或自己向每家公司提交请求。

产品上下游
上游是 Gmail 的邮件头(metadata 范围)和你批准的计划。第一次扫描大约回看两年,什么都不发,直到你确认。下游是 Ghostifier 用自己的地址、凭你签过的授权发出的退订、选择退出和删除信,以及公司回复的记录。回复在请求完成后加密保留 30 天,也可以提前删;页面写不保存你的邮件。很多公司会直接写信到你的邮箱核实身份,Ghostifier 看得到「有这样一封信」并放进 Needs you,但不能替你读正文或从你的地址回复。

今日 Hacker News 热榜前五落在生成图片的署名、一份尚未放出权重的开放模型、旧金山的缓坡路线、example.com 的改版,以及不用反向传播来预训练 Transformer。排第一的是 Nieman Lab 的报道:ChatGPT 会在仿《纽约客》漫画的角落签上真人漫画家的笔名。第二是 Reflection 的 Beam,501B 总参数、23B 激活的稀疏 MoE,博文写权重计划本月以 Apache 2.0 放出。后面是在浏览器里计算旧金山步行或骑行的「最平」路线,DebugBear 梳理 example.com 二十多年的版面变化,以及 QLabs 的 Dust:用激活扰动估计梯度。以下按 Firebase topstories 当前顺序整理,分数与评论数为抓取时快照。

1. ChatGPT is adding real cartoonists’ signatures to fake New Yorker cartoons

背景介绍
Andrew Deck 在 Nieman Lab 报道,ChatGPT 生成仿《纽约客》单格漫画时,会在角落签上杂志真人作者的笔名。文章以一张流传很广的图为例:Dolly Parton 与扮成 Dr. Frank-N-Furter 的 Tim Curry 站在天堂门口。文章写,这是 8 月下旬两人去世后几天里先在网上传开的图,右下角笔名是 “BLOPER”,也就是《纽约客》漫画家 Brendan Loper 的署名,但 Loper 没有画这张图,也没有签名。图是一位 Dolly Parton 的歌迷发到 Facebook 的,她在评论里写,自己只是让 ChatGPT 画 “a New Yorker-style cartoon”。Loper 告诉作者,先是双胞胎兄弟发来短信,随后陌生人也来问这是不是他的作品。

文章写,这不是第一次。5 月就有人在 Instagram 上提醒 Loper;夏天他又在 Reddit 的 ChatGPT 论坛里看到更多例子。作者自己的测试里,ChatGPT 签过 Harry Bliss、Emily Flake、Joe Dator、Pat Byrnes、Peter Vey、Jason Adam Katzenstein,以及 George Booth、Liza Donnelly、Ellis Rosen、Saul Steinberg 等人的名字;作者统计,至少记下了 15 位以上《纽约客》漫画家的署名被未经许可、也未付费地用上。不是每张图都有签名,有的笔名是乱码,但能认出来的经常是真人。Flake 说能看见自己画风的痕迹,整体却更像好几位作者的拼合;签名本身则是她的 “e. flake”。Byrnes 从少年时代就在 “P.Byrnes” 末尾加句点,作者找到的十多张签了他名字的生成图,每一张句点都在。

OpenAI 发言人的声明写,他们相信创造力的未来根本上属于人,并感谢社区指出模型的意外行为。作者通知 OpenAI 之后,再要求生成《纽约客》风格漫画时,ChatGPT 会回一句提示可能违反「与第三方内容相似」的护栏;但到文章发表时,一些普通漫画仍会被签上真人笔名。

版权关系在文中写得很具体。2024 年 Condé Nast(杂志母公司)与 OpenAI 签了多年授权,条款未公开;《纽约客》发言人告诉作者,Condé Nast 从未允许任何大模型开发者用其漫画训练,协议里也不允许把杂志标志放进模型输出。作者看过几份漫画家模板合同:稿件是投稿、录用才付费,不是 work for hire,版权留在作者手里,合同也没有把作品许可能用于 AI 训练。OpenAI 没有回答模型是怎样吃进这些签名的。文章引用纽约时报诉 OpenAI 案上月公开的文件,以及微软备忘录里把训练数据称作 “the largest theft of labor in human history” 的说法;另一份备忘录里,时任 OpenAI 政策负责人的 Jack Clark 写,他们在 AI 与创造力上的工作会越来越做出替代文化劳动者的系统。Clark 后来参与创立 Anthropic。

Katzenstein 把这件事说成比版权更接近假冒:模型把他的名字安在他不认可的作品上。他参加过 2024 年作家协会对 Anthropic 的集体诉讼,因为自己的漫画收进过一本 HarperCollins 选集,而这批盗版书被用来训练 Claude。文章写,法官于去年认定用作者作品训练属于合理使用,但下载并保存盗版书构成大规模侵权;文中接着说,7 月联邦法院批准和解,向作者和出版商支付 15 亿美元。Dator 的对比是:信用卡被盗时,对方至少没有打扮成他。

康奈尔大学法学院的 James Grimmelmann 在文中说,签名表示真实性,但署名只占合理使用分析的很小一部分;这类输出通常不是在复制某一张具体漫画,而是在模仿一种风格,这才是版权诉讼的难点。他提到另一种可能是州法上的公开权(right of publicity),那需要证明生成图被用于商业目的,而不只是玩笑。作者写,自己没有看到这些图被买卖的证据,但已经看到编辑漫画岗位被替换:去年《巴尔的摩太阳报》解雇了在该报画了三十多年的普利策决赛入围者 Kevin Kallaugher,今年意见版开始经常刊登 AI 漫画;用 OpenAI 的水印识别工具核对,这些插图来自 OpenAI 的产品。美国社论漫画家协会主席 Marc Murphy 在公开信里谴责用 AI 替代原创。文章也写,《纽约客》本身没有改去刊登 AI 漫画,但受访者说单靠杂志稿费养不活自己,杂志署名是接到商业稿和书籍插画的名片。

主要讨论方向与观点
讨论分成「该不该告」和「这到底是什么错误」。Insimwytim 认为问题不是模型会这么做,而是事后没有被诉讼压垮。MarkusQ 把它叫成 “Plagiarism as a Service”。回复里,jrflo 说这是一句适合社交网站的嘲讽,并不是 OpenAI 的商业模式;walrus01 则把矛头转回实验室之间互相指责「蒸馏」:被蒸馏的模型本身就建立在大规模版权争议上。GolfPopper 引用了与文章相同的那句微软备忘录。

gwern 写,自己用 Nano Banana Pro 和各代 ChatGPT 画漫画时,假签名是老问题,常常要再编辑一次擦掉,多数用户懒得做。WD-42 说,公司工程经理把一张签着 “bloper” 的漫画放进冲刺演示,并不好笑,问过之后确认是 ChatGPT,对方没注意到签名。dyauspitr 认为这说得通,因为训练样本里几乎都有签名。userbinator 补充,写实生成也会带上变形但仍能认出的水印,因为训练数据里就有;并认为年轻学画的人一开始也是在抄自己见过的东西。cm2012 主张,除非用户要求,模型默认不该在作品上签名。

ThrowawayR2 认为这拆掉了「大模型会推理」和「人也犯这种错」两种说法。antonvs 回复说,这是把图像生成模型和语言模型混为一谈,没有人声称图像模型会推理。baubino 把文章里 Katzenstein 和 Dator 的话收成「冒充」,AnimalMuppet 认为这已经够得上起诉的门槛。SchemaLoad 写,艺术家应能在每次伪造签名时亲自告 OpenAI 诽谤。

专有名词解释

  • BLOPER / e. flake / P.Byrnes:文章里的笔名,分别对应 Brendan Loper、Emily Flake 和 Pat Byrnes。Byrnes 的署名以句点结束,作者看到的生成图保留了这个习惯。
  • work for hire:受雇作品。文章写《纽约客》漫画家合同不是这种安排,版权仍归作者。
  • 合理使用(fair use):美国版权法里的抗辩。Grimmelmann 在文中说,署名只是其中很小的一部分;风格模仿通常拷不到「某一幅具体作品」。
  • 公开权(right of publicity):各州保护姓名和身份不被擅自商用的法律。文章写,要走这条路,需要商业使用的证据。
  • Cartoon Bank:文章用来对照授权原作的《纽约客》漫画授权库。

HN 讨论:thread · 183 分 · 79 评

2. Beam: Reflection’s 501B open-weight model

背景介绍
Reflection 于 2026 年 10 月 5 日发布 Introducing Beam。博文称 Beam 是该公司第一个开放权重模型:稀疏 Mixture-of-Experts,总参数 501B,激活 23B,面向编程、推理和 agent 工作负载。预训练用了 23.8 万亿 token,来源包括网页和专有授权数据。博文写,高算力强化学习在 10,500 张 NVIDIA GB300 上跑了 4 周,产生超过 1 亿次 rollout,RL 阶段最大上下文 256K token;训练和评分大约用了 13 亿个 sandbox,环境大约 100 万个。预训练则写在 6,144 张 GB300 NVL72 上、不到 4 周跑完,接近结束时 goodput 为 92.3%,中途有 9 次半自动回退。

能力表述是他们自己的定位:Beam「推进西方开放权重前沿」,在编程和 agent 任务上与更大的 GLM 5.2 有竞争力,并接近 Qwen 3.8-Max;Kimi K3 在原始能力上仍然领先,Beam 自称的优势是推理时的效率。高级推理基准上,博文写分数与 GLM-5.2 相当,推理计算约少 3–4 倍。模型是纯文本的。图注还写到推理专家约占全部 1 亿多次 rollout 里的 8,000 万次,并用来对比 Inkling 的 3,000 万次和 MiMo 的 75.3 万次。这些对比数字出自该博文,本文没有另找第三方榜单核对。

权重现在还不在公开仓库里。博文写 Beam 正在做最后的红队测试和评估,可以登记早期访问;本月将以 Apache 2.0 放出权重、技术报告、模型卡,以及运行、评估和微调所需的材料,并接入一批分发伙伴和开源工具。架构段落还写了交错的局部/全局注意力、细粒度路由专家、52 层上残差流保持有界,以及预训练结束时最忙专家的负载约为均匀值的 1.04 倍。中期训练把有效上下文拉到 100 万 token。

第二张演示图的图注是一次陆地/海洋实验:让 Beam 画固定的 180×90 网格,经度 −179° 到 179°、纬度 −89° 到 89°,共 16,200 个点;图注写覆盖正确率为 95.5%,介于 Opus 5 的 92.5% 和 Fable 5 的 97.8% 之间,并称之为对新任务的泛化。抓取当天的这段 figcaption 没有写「谜题只有几天、因此不可能在训练数据里」。

主要讨论方向与观点
主线是「数字不错,但权重呢」。htrp 摘了参数量和 RL 规模之后说,现在只有早期访问登记。wronglebowski 认为没有 Hugging Face 仓库的发布没有意义。wren6991 列了一张和 DeepSeek V4.1 Flash 的对照表,并引用 Linus 的 “Talk is cheap, show me the weights.” 这张表把 Beam 的预训练 token 写成 28T,和博文里的 23.8 万亿不一致;表中「无视觉、Apache 2.0、权重本月放出、激活参数 23B」几格与博文一致。表里 DeepSeek 一列的数字是评论者写的,不是这篇博文的内容。onlyrealcuzzo 觉得它比 DeepSeek v4.1 Flash 更大、更贵,而且每项指标都更差。aeetes 认为性能图把更强的开源模型折到视线之外,读起来像 Beam 赢了,其实没有。brumbelow 说这条链接只让自己更想去看 DeepSeek 4.1 Flash。

也有人接受「先入场、再迭代」。michaelkdev 承认它不如顶尖的中国开放权重模型,但把「西方也加入」本身当成事情。dotancohen 认为每个新进入者不需要首发就破纪录。swiftcoder 指出博文原句 “Western open-weight frontier”,猜测卖点是给不能用外国模型的政府合同,而不是给个人用户。vanuatu 把它说成面向美国公司和西方政府的「美国版 DeepSeek」。eaf7e281 则肯定博文承认 Kimi K3 仍然更强,而不是把图表说满。

Ariarule 引用的图注比当前页面多出一句:谜题只有几天,所以不可能出现在训练数据里。评论认为这句不成立,并链到 LessWrong 的 How Does A Blind Model See The Earth?。该页数据里的 postedAt 为 2025-08-11。extr 记得原始讨论更早,但觉得「没有专门对这个任务做 RL」这一点仍然成立。charlieyu1 认为谜题的年龄也许不重要,因为现在的模型都会搜索。

astrostl 希望更多 90B–133B、能把一部分专家放到磁盘上的 MoE,好放进 64–128 GB 内存的 Mac。minimaxa 写自己会等权重和 GGUF。drubs 说自己预训练第一天就在现场看着任务启动;这是评论者的自述。

专有名词解释

  • MoE:Mixture-of-Experts。博文写总参数 501B、每步激活 23B,所以推理成本按激活参数而不是总参数计。
  • rollout:强化学习里模型在一个环境中走出的一整段轨迹。博文的 1 亿次是这次 RL 的规模,不是下载量。
  • GB300 / NVL72:NVIDIA 的 GPU 以及按机柜交付的形态。预训练和 RL 用的卡数在博文里是分开写的:6,144 与 10,500。
  • goodput:博文定义为最终模型里保留下来的训练步,占墙上时钟的比例;接近结束时写成 92.3%。
  • Apache 2.0:博文承诺的权重许可证。到抓取时,权重、技术报告和模型卡都还没发布。
  • GGUF:评论里等待的本地量化格式。博文没有写 GGUF。

HN 讨论:thread · 296 分 · 77 评

3. Find the flattest route between any two points in SF

背景介绍
Flatten SF 页面署名为 Drew Edwards,仓库在 almostimplemented/flattensf。页面说明:路线在浏览器里、对大约 16 万条街段求解,高程用 USGS 1 米激光雷达,路网来自 Overture / OpenStreetMap。滑块从最短走到「还值得走的最平」:最平那一端,1 英尺爬升按 200 英尺步行计;再往右,路线就不再像路线。往右滑不会让路程变短,也不会增加爬升。爬升是沿途累计升高,不是起点和终点的海拔差。步行允许台阶,骑行排除台阶。地点搜索是离线的,路口、地址和地名打进页面,不调用地理编码接口。

README 把全市分析收成一句:在全部 1,260 对有序社区组合上,最少爬升的步行路线平均只比最短路线长 14%,却少爬 39% 的升幅,典型最陡坡度从 27% 降到 17%。资源管理器示例写,从 Bayview 到金门公园,最平步行是 7.67 英里、爬升 353 英尺,最短是 7.01 英里、爬升 1,076 英尺。分析代码是 MIT;街道几何来自 OpenStreetMap(经 Overture,ODbL),USGS 3DEP 高程为公有领域。README 还写,页面为了把图压小,会把长度量化到 5 厘米、爬升到 1 厘米,所以浏览器里的总数可能和 Python 差几十厘米。

主要讨论方向与观点
有人拿它和旧工具比。andalinmicphew 推荐自己和朋友维护了约五年的 Bike Hopper:湾区骑行会同时看坡度、自行车设施和公交,旧金山用 1 米 DTM,郊外用 50 米;并认为在旧金山做坡度路由必须用 DTM,因为建筑和树会让别的高程模型失效。verst 希望把同样的 1 米 DTM 扩到西雅图或 Puget Sound。cheeaun 贴了自己 2014 年的 steepless。pokpokpok 和 wmichelin 都把它连到 “the Wiggle”,也就是市场街一带骑去金门公园时故意绕开陡坡的那条走廊。

目标函数也有人觉得还不够。jez 希望有一个同时加长距离和总爬升、但压低坡度的选项:从 SOMA 到 Nob Hill,按累计爬升,「最平」可以是从 Market 顺着 Taylor 直上,骑起来却不如绕到 Polk 再上 California,或从 Embarcadero 转 Broadway。cowthulhu 担心如果真去最小化坡度,上山会变成无休止的之字形。scaredginger 描述自己以前的启发式:不远离目的地,能不下山就不下山,必须上坡时选更缓的那条,只用局部信息。ziofill 问爬升是不是跟路线无关;页面写明爬升是累计升高,所以跟路线有关。nerdtalker 希望加上驾车,给还在开手动挡的人用,并说自行车模式的结果已经比较合理。

具体路线有人报错。askjdfksdbfhk 写,在 Mission 的 22nd 与 San Jose 一带,工具不让人沿 22nd 直走,而是拐上 San Jose 再折返;同一条评论还把配色、连续滑块和海拔图上的高度标签叫成 “Claude UI”。danserfaty 写,从外里士满 Cabrillo 街的住处到 4th Avenue,工具让人去爬 25th Avenue 再走 Geary,而不是走完全平坦的 23rd Avenue。仓库在 2026 年 10 月 5 日有一条提交,说明 Overture 里 Slow Streets(包括 Page、Shotwell、Cabrillo、12th Avenue)的通行规则按文档顺序读时,最后一条「所有方式仅限目的地交通」盖过了前面的步行允许,于是 Cabrillo 在 23 号大街以西完全不能走;修好之后,点名某种交通方式的规则后生效,252 条边、共 9.9 公里恢复步行。HN 上 almstimplmntd 的回复与此相符,并写已经部署。这条提交的作者栏是 Claude,并带有 Co-Authored-By: Claude Fable 5.1。jeffbee 则从数据分辨率说起,认为换 USGS 3DEP 的 25 厘米 DTM 会更好,并补了一句该数据在 AWS S3 上免费。

专有名词解释

  • 累计爬升:沿路线把每一段上升加起来,下坡不抵消上坡。起点和终点海拔可以差不多,中间翻一道脊,累计爬升仍然很大。
  • 帕累托路线:页面说滑块上的每一步都是「没有另一条路在距离和爬升上同时更好」的路线。最短和最平是这条折中曲线的两端。
  • DTM:数字地形模型,表示地面。Bike Hopper 作者强调要把它和含建筑、树冠的模型分开;本站页面写的是 USGS 1 米激光雷达,仓库许可证段落写高程来自 USGS 3DEP。
  • Overture / OpenStreetMap:页面使用的路网。仓库写街道几何经 Overture 取自 OSM,再分发要遵守 ODbL。
  • Slow Streets:旧金山把一些住宅街道限制为低速、以本地出行为主的计划。上面的提交写,解析器曾把这类街道对步行也关掉。
  • The Wiggle:旧金山骑行者对一条低爬升走廊的叫法,从市场街附近绕到金门公园,专门躲开陡坡。评论是在用这个名字认路,不是网站的功能名。

HN 讨论:thread · 100 分 · 30 评

4. Example.com Just Launched the Biggest Redesign in Decades

背景介绍
DebugBear 的 Conor McCarthy 在 2026 年 9 月 30 日发文(10 月 2 日更新),回顾 example.com 的版面史。example.com 是 IANA 保留给文档示例的域名,从上世纪九十年代末就可以当例子用。文章写,到 2026 年 9 月 28 日为止,页面还是一份静态英文;改版用 JavaScript 加入阿拉伯语、中文、法语、俄语和西班牙语,并每 5 秒换一种语言,每个字符包在自己的 span 里、用递增的 transition-delay 做透明度过渡,JS 还会插入一个书本 SVG。英文句子是:这个域名用于文档示例,不需要许可;它不是一项服务,不要把它当成测试或监控的依赖。

文章引用了 IANA 的说明:改动通常要么是为了降低带宽,要么是为了让页面更有用;本周把内容拆成一个更小的基本页,再加上单独的 JavaScript。多数访问是自动化的,往往不取 JS,因此总流量下降。域名的用途是文档里的示例。有人会把示例配置粘贴出去后忘记替换,从而带来附带流量;但它不是用来做可用性探测的通用端点。履行保留域名的用途并不要求主机上一定有 HTTP 服务,网站只是 courtesy。

文章按 Wayback Machine 排了时间线。它引用维基百科,称网站在 1999 年 1 月 1 日上线;能看到的最早快照是 2002 年 1 月 20 日,当时是 ICANN/IANA 保留域名列表,Apache 1.3.22。大约 67 天后出现今天还能认出的那句「你输入了 example.com」。2003 年 2 月加上 RFC 2606 的链接,服务器换成 Apache 1.3.27。此后七年几乎没动;2010 年 7 月 30 日 example.edu 也指向这个落地页。2011 年 1 月起改为跳转到 IANA 网站;2013 年 7 月 29 日取消跳转,改由 EdgeCast 直接提供 “Example Domain” 卡片页。文章接着写 EdgeCast 被 Limelight 收购、改名 Edgio,Edgio 于 2024 年末申请破产,Akamai 接收了部分客户合同;2025 年页面再次改版并压缩 HTML;随后响应头出现 Cloudflare。2026 年 6 月 9 日加上空的 <link rel="icon" href="data:,">,避免浏览器再去要 /favicon.ico。「不要用于运维」这句话是 2025 年加上的。DebugBear 用自己的可用性监控看到,example.com 偶尔会不正常响应。

同一主题还有 Kim Davies 的 Being Exemplary。文中写,2026 年 9 月某一周这项服务大约收到 500 亿次请求,合每秒 8 万次以上;软件用它测网络、跑发布前测试、大学演示、触发酒店和机上 Wi-Fi 的强制门户,作者也怀疑自动系统和会浏览网页的 AI agent 在添流量。Cloudflare 通过 Project Galileo 支援带宽之后,他们才把说明做成联合国六种语言,并把页面拆成小的首包加一份 JavaScript:只检查「页在不在」的程序拿到更小的响应,浏览器用户才看到全文。

抓取当天(HTTP Last-Modified 为 2026 年 10 月 2 日)的首页本身只有英文段落和 <script src=/s.js>。s.js 把另外五种语言插进页面,按 navigator.languages 把匹配的段落挪到最前,没有匹配则保留英文,并用脚本插入书本 SVG。这里没有 DebugBear 所写的每 5 秒轮播。

主要讨论方向与观点
不少人在对「依赖一个声明自己不是服务的域名」开玩笑,也在认真讲后果。selcuka 问这次改版弄坏了多少自动化测试,并引用 Hyrum 定律:观察得到的行为都会有人依赖。chews 回复说,如果测试只对响应做哈希,而后续请求仍然稳定,测试可以继续过。lifeisloving 写自己已经改用 example1.com 做可用性测试。zahrevsky 读到「并不必须提供 HTTP」之后,猜这也是为了减少有人原样粘贴示例配置。zamadatix 把更底层的依赖放在 DNS 和 DNSSEC:有没有 HTTP 服务器,并不决定这些记录会不会被指到别处。

版面描述和当天页面不完全一致,评论已经先指出来。jamdav16 写,渐进透明度看起来被拿掉了,现在是把各种语言一起显示、没有 CSS 动画。johnnyanmac 对此表示失望,但觉得动画本身就会带出意外的测量流量。Gualdrapo 问,动态内容用 JS 说得通,为什么连静态 SVG 也用脚本插入。worg 的解释与 IANA 的带宽说法一致:不跑 JS 的客户端可以少下这些字节。afavour 则说文章写错了,自己关掉 JS 仍能看到 SVG,并怀疑整篇文章是用 AI 拼的。与之对照,抓取到的 HTML 里没有内联 SVG,图标在 /s.js 里。dangoodmanUT 觉得现在的文案看起来像模型生成的。adithyassekhar 数了一下,DebugBear 正文里 example.com 出现 14 次,没有一次是链接。

slipfold 和 ChrisArchitect、sea-gold 都把讨论指回几天前的线程,以及 Kim Davies 那篇说明。cute_boi 开玩笑说,IANA 这种事实上的单一供应者,连一个简单 HTML 页都托管得有点滑稽。

专有名词解释

  • example.com / RFC 2606:IANA 保留的文档用域名。RFC 2606 规定 example.com、example.net、example.org 以及 .example 等名字用于示例,避免作者编一个可能真的有人注册的域名。example.edu 是后来一并指向说明页的名字,文章和 Kim Davies 的帖子都提到了。
  • Hyrum 定律:接口只要有足够多的使用者,所有能观察到的行为都会被某人依赖,包括你没承诺的行为。评论用它解释为什么改一行示例页会弄坏测试。
  • Project Galileo:Cloudflare 为公共利益网站提供支援的计划。Kim Davies 写,example 域名的带宽是在这个计划下得到支援的。
  • courtesy 页面:IANA 的用词。保留域名本身不要求开网站;页面只是告诉访客这个名字为什么存在。

HN 讨论:thread · 68 分 · 44 评

5. Dust: Pretraining Transformers Without Backpropagation

背景介绍
Samip Dahal、Bishwas Mandal、Serdar Gülbahar 和 Akshay Vegesna 在 2026 年 10 月发表 Dust: Pretraining Transformers Without Backpropagation,代码在 qlabs-eng/dust。论文把 Dust 写成第一种在预训练 Transformer 语言模型上能与反向传播相比的零阶方法。做法是对每一层线性层的输出、在每个 token 上独立加上高斯噪声,看这个扰动让该 token 的损失降了多少,再把「奖励乘以噪声」在一组采样上平均,得到输出端的误差估计;误差和这一层已经算好的输入做外积,就是权重梯度。注意力内部不直接用 token 损失,而用注意力输出上的估计误差。他们把每个 token 叫成一个虚拟种群成员:一次前向同时评估整段序列上的成员,而不必像在权重空间里做进化策略那样,为每个成员准备一份扰动后的权重。

论文的基线是 EGGROLL 的 Transformer 实现,也就是在权重上做低秩扰动的进化策略。作者写,从 100 万 token 往上,按他们的外推,Dust 比这种实现大约高效 10³ 到 10⁴ 倍;在同样种群规模下,16k 的 EGGROLL 仍到不了 Dust 在 64 次采样时的损失。实验是 GPT 式网络、FineWeb、4096 token 的 BPE、每批 16k token、带动量的 SGD。在 10 万和 100 万 token 上,Dust 从几百到大约一千次采样起,测试损失可以低于调过参的反向传播。到 1,000 万和 2,000 万 token,差距随种群缩小;2,000 万 token 上幂律外推的极限是 4.431(95% 区间 3.89 到 4.58),低于反向传播的 4.633,但阶梯在 16k 采样时还在下降,作者把这看成「差距还会随种群缩小」,而不是已经测到的极限。

另一项结果写在摘要里:更大的网络更省种群,而不是更费。固定 1,000 万 token,2M、7M、38M、243M 四个尺寸里,243M 在大多数种群规模上优于大约小 120 倍的模型。论文同时把边界写清楚:现在并不打算把计算效率做到可以替换反向传播;也不在本文训练那些反向传播不好训的结构,例如回路里夹外程序、或要在时间上展开的循环 Transformer。作者写,还要再有几个数量级的效率,Dust 才可能在当前算力水平上成为实用替代。

主要讨论方向与观点
评论很少,而且贴着论文自己的两句结论。eriwang915 认为令人意外的是 243M 在大多数种群上胜过小 120 倍的网络:网络变大之后,种群效率更高,而不是更低。polyomino 问,既然这比反向传播贵,能不能拿一个已经用反向传播训好的检查点,再用 Dust 微调,看学习轨迹会不会不同。这条下面没有展开的回复。

api 问:是不是计算效率更低,但更容易并行。vatsachak 回答说不一定。反向传播本身就是一批矩阵乘法,并行度已经很高;Dust 省掉的是反向那一趟。真正可以各干各的是另一类方法,例如神经预测编码,远处的权重不必同步。回复还写,即便如此,行业已经把钱押在前向加反向上,除非有人做出合适的硬件并证明能扩到数十亿参数,否则后继算法很难赢。论文自己的并行点更窄:虚拟种群是沿 token 维一次前向评估很多成员,而不是声称整个训练比反向传播更省。

专有名词解释

  • 反向传播(backprop):用链式法则把损失对每一层输出的导数传回去。Dust 仍要算权重更新,但输出端的误差来自种群,不来自这条链。
  • 零阶优化:只看函数值、不看解析梯度。这里的函数值是每个 token 的损失变化。
  • 进化策略(ES)/ EGGROLL:在参数上加扰动、用整次评估的好坏来估计更新方向。论文用 EGGROLL 代表「每个种群成员一次前向」的权重空间做法。
  • 节点扰动 / 虚拟种群:噪声加在激活上,而不是加在权重上。一个 token 算一个成员,所以一段几千 token 的序列,一次前向就评估几千个成员。
  • 种群:Dust 里是每次更新的采样次数(draws)。论文写,头部分类层和注意力内部的采样另计,占一次更新 FLOPs 的一小部分。

HN 讨论:thread · 87 分 · 13 评