0%

Hacknews Daily Summary - 2026-10-06

今日 Hacker News 热榜前五落在生成图片的署名、一份尚未放出权重的开放模型、旧金山的缓坡路线、example.com 的改版,以及不用反向传播来预训练 Transformer。排第一的是 Nieman Lab 的报道:ChatGPT 会在仿《纽约客》漫画的角落签上真人漫画家的笔名。第二是 Reflection 的 Beam,501B 总参数、23B 激活的稀疏 MoE,博文写权重计划本月以 Apache 2.0 放出。后面是在浏览器里计算旧金山步行或骑行的「最平」路线,DebugBear 梳理 example.com 二十多年的版面变化,以及 QLabs 的 Dust:用激活扰动估计梯度。以下按 Firebase topstories 当前顺序整理,分数与评论数为抓取时快照。

1. ChatGPT is adding real cartoonists’ signatures to fake New Yorker cartoons

背景介绍
Andrew Deck 在 Nieman Lab 报道,ChatGPT 生成仿《纽约客》单格漫画时,会在角落签上杂志真人作者的笔名。文章以一张流传很广的图为例:Dolly Parton 与扮成 Dr. Frank-N-Furter 的 Tim Curry 站在天堂门口。文章写,这是 8 月下旬两人去世后几天里先在网上传开的图,右下角笔名是 “BLOPER”,也就是《纽约客》漫画家 Brendan Loper 的署名,但 Loper 没有画这张图,也没有签名。图是一位 Dolly Parton 的歌迷发到 Facebook 的,她在评论里写,自己只是让 ChatGPT 画 “a New Yorker-style cartoon”。Loper 告诉作者,先是双胞胎兄弟发来短信,随后陌生人也来问这是不是他的作品。

文章写,这不是第一次。5 月就有人在 Instagram 上提醒 Loper;夏天他又在 Reddit 的 ChatGPT 论坛里看到更多例子。作者自己的测试里,ChatGPT 签过 Harry Bliss、Emily Flake、Joe Dator、Pat Byrnes、Peter Vey、Jason Adam Katzenstein,以及 George Booth、Liza Donnelly、Ellis Rosen、Saul Steinberg 等人的名字;作者统计,至少记下了 15 位以上《纽约客》漫画家的署名被未经许可、也未付费地用上。不是每张图都有签名,有的笔名是乱码,但能认出来的经常是真人。Flake 说能看见自己画风的痕迹,整体却更像好几位作者的拼合;签名本身则是她的 “e. flake”。Byrnes 从少年时代就在 “P.Byrnes” 末尾加句点,作者找到的十多张签了他名字的生成图,每一张句点都在。

OpenAI 发言人的声明写,他们相信创造力的未来根本上属于人,并感谢社区指出模型的意外行为。作者通知 OpenAI 之后,再要求生成《纽约客》风格漫画时,ChatGPT 会回一句提示可能违反「与第三方内容相似」的护栏;但到文章发表时,一些普通漫画仍会被签上真人笔名。

版权关系在文中写得很具体。2024 年 Condé Nast(杂志母公司)与 OpenAI 签了多年授权,条款未公开;《纽约客》发言人告诉作者,Condé Nast 从未允许任何大模型开发者用其漫画训练,协议里也不允许把杂志标志放进模型输出。作者看过几份漫画家模板合同:稿件是投稿、录用才付费,不是 work for hire,版权留在作者手里,合同也没有把作品许可能用于 AI 训练。OpenAI 没有回答模型是怎样吃进这些签名的。文章引用纽约时报诉 OpenAI 案上月公开的文件,以及微软备忘录里把训练数据称作 “the largest theft of labor in human history” 的说法;另一份备忘录里,时任 OpenAI 政策负责人的 Jack Clark 写,他们在 AI 与创造力上的工作会越来越做出替代文化劳动者的系统。Clark 后来参与创立 Anthropic。

Katzenstein 把这件事说成比版权更接近假冒:模型把他的名字安在他不认可的作品上。他参加过 2024 年作家协会对 Anthropic 的集体诉讼,因为自己的漫画收进过一本 HarperCollins 选集,而这批盗版书被用来训练 Claude。文章写,法官于去年认定用作者作品训练属于合理使用,但下载并保存盗版书构成大规模侵权;文中接着说,7 月联邦法院批准和解,向作者和出版商支付 15 亿美元。Dator 的对比是:信用卡被盗时,对方至少没有打扮成他。

康奈尔大学法学院的 James Grimmelmann 在文中说,签名表示真实性,但署名只占合理使用分析的很小一部分;这类输出通常不是在复制某一张具体漫画,而是在模仿一种风格,这才是版权诉讼的难点。他提到另一种可能是州法上的公开权(right of publicity),那需要证明生成图被用于商业目的,而不只是玩笑。作者写,自己没有看到这些图被买卖的证据,但已经看到编辑漫画岗位被替换:去年《巴尔的摩太阳报》解雇了在该报画了三十多年的普利策决赛入围者 Kevin Kallaugher,今年意见版开始经常刊登 AI 漫画;用 OpenAI 的水印识别工具核对,这些插图来自 OpenAI 的产品。美国社论漫画家协会主席 Marc Murphy 在公开信里谴责用 AI 替代原创。文章也写,《纽约客》本身没有改去刊登 AI 漫画,但受访者说单靠杂志稿费养不活自己,杂志署名是接到商业稿和书籍插画的名片。

主要讨论方向与观点
讨论分成「该不该告」和「这到底是什么错误」。Insimwytim 认为问题不是模型会这么做,而是事后没有被诉讼压垮。MarkusQ 把它叫成 “Plagiarism as a Service”。回复里,jrflo 说这是一句适合社交网站的嘲讽,并不是 OpenAI 的商业模式;walrus01 则把矛头转回实验室之间互相指责「蒸馏」:被蒸馏的模型本身就建立在大规模版权争议上。GolfPopper 引用了与文章相同的那句微软备忘录。

gwern 写,自己用 Nano Banana Pro 和各代 ChatGPT 画漫画时,假签名是老问题,常常要再编辑一次擦掉,多数用户懒得做。WD-42 说,公司工程经理把一张签着 “bloper” 的漫画放进冲刺演示,并不好笑,问过之后确认是 ChatGPT,对方没注意到签名。dyauspitr 认为这说得通,因为训练样本里几乎都有签名。userbinator 补充,写实生成也会带上变形但仍能认出的水印,因为训练数据里就有;并认为年轻学画的人一开始也是在抄自己见过的东西。cm2012 主张,除非用户要求,模型默认不该在作品上签名。

ThrowawayR2 认为这拆掉了「大模型会推理」和「人也犯这种错」两种说法。antonvs 回复说,这是把图像生成模型和语言模型混为一谈,没有人声称图像模型会推理。baubino 把文章里 Katzenstein 和 Dator 的话收成「冒充」,AnimalMuppet 认为这已经够得上起诉的门槛。SchemaLoad 写,艺术家应能在每次伪造签名时亲自告 OpenAI 诽谤。

专有名词解释

  • BLOPER / e. flake / P.Byrnes:文章里的笔名,分别对应 Brendan Loper、Emily Flake 和 Pat Byrnes。Byrnes 的署名以句点结束,作者看到的生成图保留了这个习惯。
  • work for hire:受雇作品。文章写《纽约客》漫画家合同不是这种安排,版权仍归作者。
  • 合理使用(fair use):美国版权法里的抗辩。Grimmelmann 在文中说,署名只是其中很小的一部分;风格模仿通常拷不到「某一幅具体作品」。
  • 公开权(right of publicity):各州保护姓名和身份不被擅自商用的法律。文章写,要走这条路,需要商业使用的证据。
  • Cartoon Bank:文章用来对照授权原作的《纽约客》漫画授权库。

HN 讨论:thread · 183 分 · 79 评

2. Beam: Reflection’s 501B open-weight model

背景介绍
Reflection 于 2026 年 10 月 5 日发布 Introducing Beam。博文称 Beam 是该公司第一个开放权重模型:稀疏 Mixture-of-Experts,总参数 501B,激活 23B,面向编程、推理和 agent 工作负载。预训练用了 23.8 万亿 token,来源包括网页和专有授权数据。博文写,高算力强化学习在 10,500 张 NVIDIA GB300 上跑了 4 周,产生超过 1 亿次 rollout,RL 阶段最大上下文 256K token;训练和评分大约用了 13 亿个 sandbox,环境大约 100 万个。预训练则写在 6,144 张 GB300 NVL72 上、不到 4 周跑完,接近结束时 goodput 为 92.3%,中途有 9 次半自动回退。

能力表述是他们自己的定位:Beam「推进西方开放权重前沿」,在编程和 agent 任务上与更大的 GLM 5.2 有竞争力,并接近 Qwen 3.8-Max;Kimi K3 在原始能力上仍然领先,Beam 自称的优势是推理时的效率。高级推理基准上,博文写分数与 GLM-5.2 相当,推理计算约少 3–4 倍。模型是纯文本的。图注还写到推理专家约占全部 1 亿多次 rollout 里的 8,000 万次,并用来对比 Inkling 的 3,000 万次和 MiMo 的 75.3 万次。这些对比数字出自该博文,本文没有另找第三方榜单核对。

权重现在还不在公开仓库里。博文写 Beam 正在做最后的红队测试和评估,可以登记早期访问;本月将以 Apache 2.0 放出权重、技术报告、模型卡,以及运行、评估和微调所需的材料,并接入一批分发伙伴和开源工具。架构段落还写了交错的局部/全局注意力、细粒度路由专家、52 层上残差流保持有界,以及预训练结束时最忙专家的负载约为均匀值的 1.04 倍。中期训练把有效上下文拉到 100 万 token。

第二张演示图的图注是一次陆地/海洋实验:让 Beam 画固定的 180×90 网格,经度 −179° 到 179°、纬度 −89° 到 89°,共 16,200 个点;图注写覆盖正确率为 95.5%,介于 Opus 5 的 92.5% 和 Fable 5 的 97.8% 之间,并称之为对新任务的泛化。抓取当天的这段 figcaption 没有写「谜题只有几天、因此不可能在训练数据里」。

主要讨论方向与观点
主线是「数字不错,但权重呢」。htrp 摘了参数量和 RL 规模之后说,现在只有早期访问登记。wronglebowski 认为没有 Hugging Face 仓库的发布没有意义。wren6991 列了一张和 DeepSeek V4.1 Flash 的对照表,并引用 Linus 的 “Talk is cheap, show me the weights.” 这张表把 Beam 的预训练 token 写成 28T,和博文里的 23.8 万亿不一致;表中「无视觉、Apache 2.0、权重本月放出、激活参数 23B」几格与博文一致。表里 DeepSeek 一列的数字是评论者写的,不是这篇博文的内容。onlyrealcuzzo 觉得它比 DeepSeek v4.1 Flash 更大、更贵,而且每项指标都更差。aeetes 认为性能图把更强的开源模型折到视线之外,读起来像 Beam 赢了,其实没有。brumbelow 说这条链接只让自己更想去看 DeepSeek 4.1 Flash。

也有人接受「先入场、再迭代」。michaelkdev 承认它不如顶尖的中国开放权重模型,但把「西方也加入」本身当成事情。dotancohen 认为每个新进入者不需要首发就破纪录。swiftcoder 指出博文原句 “Western open-weight frontier”,猜测卖点是给不能用外国模型的政府合同,而不是给个人用户。vanuatu 把它说成面向美国公司和西方政府的「美国版 DeepSeek」。eaf7e281 则肯定博文承认 Kimi K3 仍然更强,而不是把图表说满。

Ariarule 引用的图注比当前页面多出一句:谜题只有几天,所以不可能出现在训练数据里。评论认为这句不成立,并链到 LessWrong 的 How Does A Blind Model See The Earth?。该页数据里的 postedAt 为 2025-08-11。extr 记得原始讨论更早,但觉得「没有专门对这个任务做 RL」这一点仍然成立。charlieyu1 认为谜题的年龄也许不重要,因为现在的模型都会搜索。

astrostl 希望更多 90B–133B、能把一部分专家放到磁盘上的 MoE,好放进 64–128 GB 内存的 Mac。minimaxa 写自己会等权重和 GGUF。drubs 说自己预训练第一天就在现场看着任务启动;这是评论者的自述。

专有名词解释

  • MoE:Mixture-of-Experts。博文写总参数 501B、每步激活 23B,所以推理成本按激活参数而不是总参数计。
  • rollout:强化学习里模型在一个环境中走出的一整段轨迹。博文的 1 亿次是这次 RL 的规模,不是下载量。
  • GB300 / NVL72:NVIDIA 的 GPU 以及按机柜交付的形态。预训练和 RL 用的卡数在博文里是分开写的:6,144 与 10,500。
  • goodput:博文定义为最终模型里保留下来的训练步,占墙上时钟的比例;接近结束时写成 92.3%。
  • Apache 2.0:博文承诺的权重许可证。到抓取时,权重、技术报告和模型卡都还没发布。
  • GGUF:评论里等待的本地量化格式。博文没有写 GGUF。

HN 讨论:thread · 296 分 · 77 评

3. Find the flattest route between any two points in SF

背景介绍
Flatten SF 页面署名为 Drew Edwards,仓库在 almostimplemented/flattensf。页面说明:路线在浏览器里、对大约 16 万条街段求解,高程用 USGS 1 米激光雷达,路网来自 Overture / OpenStreetMap。滑块从最短走到「还值得走的最平」:最平那一端,1 英尺爬升按 200 英尺步行计;再往右,路线就不再像路线。往右滑不会让路程变短,也不会增加爬升。爬升是沿途累计升高,不是起点和终点的海拔差。步行允许台阶,骑行排除台阶。地点搜索是离线的,路口、地址和地名打进页面,不调用地理编码接口。

README 把全市分析收成一句:在全部 1,260 对有序社区组合上,最少爬升的步行路线平均只比最短路线长 14%,却少爬 39% 的升幅,典型最陡坡度从 27% 降到 17%。资源管理器示例写,从 Bayview 到金门公园,最平步行是 7.67 英里、爬升 353 英尺,最短是 7.01 英里、爬升 1,076 英尺。分析代码是 MIT;街道几何来自 OpenStreetMap(经 Overture,ODbL),USGS 3DEP 高程为公有领域。README 还写,页面为了把图压小,会把长度量化到 5 厘米、爬升到 1 厘米,所以浏览器里的总数可能和 Python 差几十厘米。

主要讨论方向与观点
有人拿它和旧工具比。andalinmicphew 推荐自己和朋友维护了约五年的 Bike Hopper:湾区骑行会同时看坡度、自行车设施和公交,旧金山用 1 米 DTM,郊外用 50 米;并认为在旧金山做坡度路由必须用 DTM,因为建筑和树会让别的高程模型失效。verst 希望把同样的 1 米 DTM 扩到西雅图或 Puget Sound。cheeaun 贴了自己 2014 年的 steepless。pokpokpok 和 wmichelin 都把它连到 “the Wiggle”,也就是市场街一带骑去金门公园时故意绕开陡坡的那条走廊。

目标函数也有人觉得还不够。jez 希望有一个同时加长距离和总爬升、但压低坡度的选项:从 SOMA 到 Nob Hill,按累计爬升,「最平」可以是从 Market 顺着 Taylor 直上,骑起来却不如绕到 Polk 再上 California,或从 Embarcadero 转 Broadway。cowthulhu 担心如果真去最小化坡度,上山会变成无休止的之字形。scaredginger 描述自己以前的启发式:不远离目的地,能不下山就不下山,必须上坡时选更缓的那条,只用局部信息。ziofill 问爬升是不是跟路线无关;页面写明爬升是累计升高,所以跟路线有关。nerdtalker 希望加上驾车,给还在开手动挡的人用,并说自行车模式的结果已经比较合理。

具体路线有人报错。askjdfksdbfhk 写,在 Mission 的 22nd 与 San Jose 一带,工具不让人沿 22nd 直走,而是拐上 San Jose 再折返;同一条评论还把配色、连续滑块和海拔图上的高度标签叫成 “Claude UI”。danserfaty 写,从外里士满 Cabrillo 街的住处到 4th Avenue,工具让人去爬 25th Avenue 再走 Geary,而不是走完全平坦的 23rd Avenue。仓库在 2026 年 10 月 5 日有一条提交,说明 Overture 里 Slow Streets(包括 Page、Shotwell、Cabrillo、12th Avenue)的通行规则按文档顺序读时,最后一条「所有方式仅限目的地交通」盖过了前面的步行允许,于是 Cabrillo 在 23 号大街以西完全不能走;修好之后,点名某种交通方式的规则后生效,252 条边、共 9.9 公里恢复步行。HN 上 almstimplmntd 的回复与此相符,并写已经部署。这条提交的作者栏是 Claude,并带有 Co-Authored-By: Claude Fable 5.1。jeffbee 则从数据分辨率说起,认为换 USGS 3DEP 的 25 厘米 DTM 会更好,并补了一句该数据在 AWS S3 上免费。

专有名词解释

  • 累计爬升:沿路线把每一段上升加起来,下坡不抵消上坡。起点和终点海拔可以差不多,中间翻一道脊,累计爬升仍然很大。
  • 帕累托路线:页面说滑块上的每一步都是「没有另一条路在距离和爬升上同时更好」的路线。最短和最平是这条折中曲线的两端。
  • DTM:数字地形模型,表示地面。Bike Hopper 作者强调要把它和含建筑、树冠的模型分开;本站页面写的是 USGS 1 米激光雷达,仓库许可证段落写高程来自 USGS 3DEP。
  • Overture / OpenStreetMap:页面使用的路网。仓库写街道几何经 Overture 取自 OSM,再分发要遵守 ODbL。
  • Slow Streets:旧金山把一些住宅街道限制为低速、以本地出行为主的计划。上面的提交写,解析器曾把这类街道对步行也关掉。
  • The Wiggle:旧金山骑行者对一条低爬升走廊的叫法,从市场街附近绕到金门公园,专门躲开陡坡。评论是在用这个名字认路,不是网站的功能名。

HN 讨论:thread · 100 分 · 30 评

4. Example.com Just Launched the Biggest Redesign in Decades

背景介绍
DebugBear 的 Conor McCarthy 在 2026 年 9 月 30 日发文(10 月 2 日更新),回顾 example.com 的版面史。example.com 是 IANA 保留给文档示例的域名,从上世纪九十年代末就可以当例子用。文章写,到 2026 年 9 月 28 日为止,页面还是一份静态英文;改版用 JavaScript 加入阿拉伯语、中文、法语、俄语和西班牙语,并每 5 秒换一种语言,每个字符包在自己的 span 里、用递增的 transition-delay 做透明度过渡,JS 还会插入一个书本 SVG。英文句子是:这个域名用于文档示例,不需要许可;它不是一项服务,不要把它当成测试或监控的依赖。

文章引用了 IANA 的说明:改动通常要么是为了降低带宽,要么是为了让页面更有用;本周把内容拆成一个更小的基本页,再加上单独的 JavaScript。多数访问是自动化的,往往不取 JS,因此总流量下降。域名的用途是文档里的示例。有人会把示例配置粘贴出去后忘记替换,从而带来附带流量;但它不是用来做可用性探测的通用端点。履行保留域名的用途并不要求主机上一定有 HTTP 服务,网站只是 courtesy。

文章按 Wayback Machine 排了时间线。它引用维基百科,称网站在 1999 年 1 月 1 日上线;能看到的最早快照是 2002 年 1 月 20 日,当时是 ICANN/IANA 保留域名列表,Apache 1.3.22。大约 67 天后出现今天还能认出的那句「你输入了 example.com」。2003 年 2 月加上 RFC 2606 的链接,服务器换成 Apache 1.3.27。此后七年几乎没动;2010 年 7 月 30 日 example.edu 也指向这个落地页。2011 年 1 月起改为跳转到 IANA 网站;2013 年 7 月 29 日取消跳转,改由 EdgeCast 直接提供 “Example Domain” 卡片页。文章接着写 EdgeCast 被 Limelight 收购、改名 Edgio,Edgio 于 2024 年末申请破产,Akamai 接收了部分客户合同;2025 年页面再次改版并压缩 HTML;随后响应头出现 Cloudflare。2026 年 6 月 9 日加上空的 <link rel="icon" href="data:,">,避免浏览器再去要 /favicon.ico。「不要用于运维」这句话是 2025 年加上的。DebugBear 用自己的可用性监控看到,example.com 偶尔会不正常响应。

同一主题还有 Kim Davies 的 Being Exemplary。文中写,2026 年 9 月某一周这项服务大约收到 500 亿次请求,合每秒 8 万次以上;软件用它测网络、跑发布前测试、大学演示、触发酒店和机上 Wi-Fi 的强制门户,作者也怀疑自动系统和会浏览网页的 AI agent 在添流量。Cloudflare 通过 Project Galileo 支援带宽之后,他们才把说明做成联合国六种语言,并把页面拆成小的首包加一份 JavaScript:只检查「页在不在」的程序拿到更小的响应,浏览器用户才看到全文。

抓取当天(HTTP Last-Modified 为 2026 年 10 月 2 日)的首页本身只有英文段落和 <script src=/s.js>。s.js 把另外五种语言插进页面,按 navigator.languages 把匹配的段落挪到最前,没有匹配则保留英文,并用脚本插入书本 SVG。这里没有 DebugBear 所写的每 5 秒轮播。

主要讨论方向与观点
不少人在对「依赖一个声明自己不是服务的域名」开玩笑,也在认真讲后果。selcuka 问这次改版弄坏了多少自动化测试,并引用 Hyrum 定律:观察得到的行为都会有人依赖。chews 回复说,如果测试只对响应做哈希,而后续请求仍然稳定,测试可以继续过。lifeisloving 写自己已经改用 example1.com 做可用性测试。zahrevsky 读到「并不必须提供 HTTP」之后,猜这也是为了减少有人原样粘贴示例配置。zamadatix 把更底层的依赖放在 DNS 和 DNSSEC:有没有 HTTP 服务器,并不决定这些记录会不会被指到别处。

版面描述和当天页面不完全一致,评论已经先指出来。jamdav16 写,渐进透明度看起来被拿掉了,现在是把各种语言一起显示、没有 CSS 动画。johnnyanmac 对此表示失望,但觉得动画本身就会带出意外的测量流量。Gualdrapo 问,动态内容用 JS 说得通,为什么连静态 SVG 也用脚本插入。worg 的解释与 IANA 的带宽说法一致:不跑 JS 的客户端可以少下这些字节。afavour 则说文章写错了,自己关掉 JS 仍能看到 SVG,并怀疑整篇文章是用 AI 拼的。与之对照,抓取到的 HTML 里没有内联 SVG,图标在 /s.js 里。dangoodmanUT 觉得现在的文案看起来像模型生成的。adithyassekhar 数了一下,DebugBear 正文里 example.com 出现 14 次,没有一次是链接。

slipfold 和 ChrisArchitect、sea-gold 都把讨论指回几天前的线程,以及 Kim Davies 那篇说明。cute_boi 开玩笑说,IANA 这种事实上的单一供应者,连一个简单 HTML 页都托管得有点滑稽。

专有名词解释

  • example.com / RFC 2606:IANA 保留的文档用域名。RFC 2606 规定 example.com、example.net、example.org 以及 .example 等名字用于示例,避免作者编一个可能真的有人注册的域名。example.edu 是后来一并指向说明页的名字,文章和 Kim Davies 的帖子都提到了。
  • Hyrum 定律:接口只要有足够多的使用者,所有能观察到的行为都会被某人依赖,包括你没承诺的行为。评论用它解释为什么改一行示例页会弄坏测试。
  • Project Galileo:Cloudflare 为公共利益网站提供支援的计划。Kim Davies 写,example 域名的带宽是在这个计划下得到支援的。
  • courtesy 页面:IANA 的用词。保留域名本身不要求开网站;页面只是告诉访客这个名字为什么存在。

HN 讨论:thread · 68 分 · 44 评

5. Dust: Pretraining Transformers Without Backpropagation

背景介绍
Samip Dahal、Bishwas Mandal、Serdar Gülbahar 和 Akshay Vegesna 在 2026 年 10 月发表 Dust: Pretraining Transformers Without Backpropagation,代码在 qlabs-eng/dust。论文把 Dust 写成第一种在预训练 Transformer 语言模型上能与反向传播相比的零阶方法。做法是对每一层线性层的输出、在每个 token 上独立加上高斯噪声,看这个扰动让该 token 的损失降了多少,再把「奖励乘以噪声」在一组采样上平均,得到输出端的误差估计;误差和这一层已经算好的输入做外积,就是权重梯度。注意力内部不直接用 token 损失,而用注意力输出上的估计误差。他们把每个 token 叫成一个虚拟种群成员:一次前向同时评估整段序列上的成员,而不必像在权重空间里做进化策略那样,为每个成员准备一份扰动后的权重。

论文的基线是 EGGROLL 的 Transformer 实现,也就是在权重上做低秩扰动的进化策略。作者写,从 100 万 token 往上,按他们的外推,Dust 比这种实现大约高效 10³ 到 10⁴ 倍;在同样种群规模下,16k 的 EGGROLL 仍到不了 Dust 在 64 次采样时的损失。实验是 GPT 式网络、FineWeb、4096 token 的 BPE、每批 16k token、带动量的 SGD。在 10 万和 100 万 token 上,Dust 从几百到大约一千次采样起,测试损失可以低于调过参的反向传播。到 1,000 万和 2,000 万 token,差距随种群缩小;2,000 万 token 上幂律外推的极限是 4.431(95% 区间 3.89 到 4.58),低于反向传播的 4.633,但阶梯在 16k 采样时还在下降,作者把这看成「差距还会随种群缩小」,而不是已经测到的极限。

另一项结果写在摘要里:更大的网络更省种群,而不是更费。固定 1,000 万 token,2M、7M、38M、243M 四个尺寸里,243M 在大多数种群规模上优于大约小 120 倍的模型。论文同时把边界写清楚:现在并不打算把计算效率做到可以替换反向传播;也不在本文训练那些反向传播不好训的结构,例如回路里夹外程序、或要在时间上展开的循环 Transformer。作者写,还要再有几个数量级的效率,Dust 才可能在当前算力水平上成为实用替代。

主要讨论方向与观点
评论很少,而且贴着论文自己的两句结论。eriwang915 认为令人意外的是 243M 在大多数种群上胜过小 120 倍的网络:网络变大之后,种群效率更高,而不是更低。polyomino 问,既然这比反向传播贵,能不能拿一个已经用反向传播训好的检查点,再用 Dust 微调,看学习轨迹会不会不同。这条下面没有展开的回复。

api 问:是不是计算效率更低,但更容易并行。vatsachak 回答说不一定。反向传播本身就是一批矩阵乘法,并行度已经很高;Dust 省掉的是反向那一趟。真正可以各干各的是另一类方法,例如神经预测编码,远处的权重不必同步。回复还写,即便如此,行业已经把钱押在前向加反向上,除非有人做出合适的硬件并证明能扩到数十亿参数,否则后继算法很难赢。论文自己的并行点更窄:虚拟种群是沿 token 维一次前向评估很多成员,而不是声称整个训练比反向传播更省。

专有名词解释

  • 反向传播(backprop):用链式法则把损失对每一层输出的导数传回去。Dust 仍要算权重更新,但输出端的误差来自种群,不来自这条链。
  • 零阶优化:只看函数值、不看解析梯度。这里的函数值是每个 token 的损失变化。
  • 进化策略(ES)/ EGGROLL:在参数上加扰动、用整次评估的好坏来估计更新方向。论文用 EGGROLL 代表「每个种群成员一次前向」的权重空间做法。
  • 节点扰动 / 虚拟种群:噪声加在激活上,而不是加在权重上。一个 token 算一个成员,所以一段几千 token 的序列,一次前向就评估几千个成员。
  • 种群:Dust 里是每次更新的采样次数(draws)。论文写,头部分类层和注意力内部的采样另计,占一次更新 FLOPs 的一小部分。

HN 讨论:thread · 87 分 · 13 评