今日 Hacker News 热榜前五落在本地大模型、上世纪文字冒险、系统自带 AI 占掉的磁盘、动画工作室档案,以及用现成 SSH 做临时外网入口。排第一的是 Strata:它把 Qwen3.8-Flash-Next 拆到消费级显卡、内存和硬盘上跑,热帖标题写的是 RTX 4090 上约 100 token/秒。后面是 Andrew Plotkin 用调试器挖出 Infocom 游戏 Infidel 里一个出厂就在的内存写坏,以及一个关掉 macOS 27 上 Apple Intelligence 并删掉模型文件的开源工具。后两条是 Tippett Studios 关停后有人把光盘镜像放上 Internet Archive,以及 Vincent Bernat 只用 OpenSSH 和 nginx 做带过期链接的自建 HTTP 隧道。以下按 Firebase topstories 当前顺序整理,分数与评论数为抓取时快照。
1. Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
背景介绍
Strata 的 README 说,它在普通 PC 上跑 Qwen3.8-Flash-Next,聊天、写代码、读图,并给本机上的应用和编程 agent 用;README 写「数据不离开这台 PC」。Hugging Face 模型卡把这款模型写成实验性预览,是日后 Qwen4 架构的一次公开权重发布:因果语言模型加视觉编码器,许可证名为 qwen-community-1.0。模型卡的参数量是 125B、其中约 6B 激活,另外还有 51B 的 n-gram embedding 和 4B 的 MTP;原生上下文 262,144 token,并写可延伸到 1,000,000。MoE 是 512 个专家,每步激活 10 个路由专家加 1 个共享专家,共 48 层。
Strata 的硬件要求是 12 GB 及以上显存(列出了多款 NVIDIA RTX 与部分 AMD Radeon)、32 GB 及以上内存、大约 80 GB 磁盘,系统为 Windows 10/11 或 Linux。README 自己的速度表测的不是 4090:RTX 5070(12 GB)配 64 GB 内存时,Q2_0 写回复约 94 token/秒、读 32K prompt 约 2,650 token/秒;同一张卡上 IQ3_S 约 53 token/秒。RX 9070 XT 上 Q2_0 约 60 token/秒。文中估计显存更大的 RTX 3090(24 GB)「应该」能到大约 100–140 token/秒,这是估计,不是表里的实测行。HN 标题里的「100T/s」和「RTX 4090」对得上提交者 snehesht 的跟帖:4090、128 GB DDR5、Ryzen 7950X3D,测到 124 token/秒。
README 把加速说成两件事。一是把工作拆开:显卡留下最常用的专家,内存放下全部,CPU 同时算其余部分,SSD 放一张大查找表。它写模型是「24,576 个小专家、每个词只用其中 10 个」。官方模型卡是每层 512 个专家、48 层;512×48=24,576,和这两个数字对得上,但 README 没有把这步乘法写出来,也没有单独提到模型卡里的那个共享专家。二是「先猜再核对」:小模型先猜接下来几个词,大模型一次核对,README 写同样的答案可以早 1.6–1.8 倍出来。安装器按内存推荐量化:32 GB 用删掉一半专家的 Coder 版,48 GB 用 IQ2_XS 或 Q2_0,64 GB 推荐 IQ2_XS、也可以上 IQ3。Coder 版 README 写,其作者测得 SWE-bench Verified 达到完整模型的 91%,代码以外(包括中日韩文本)更弱。服务开在 http://127.0.0.1:8080,并提供 OpenAI 兼容的 /v1。
主要讨论方向与观点
速度有人复现,质量有人存疑。mrinterweb 用一张 RTX 4090(24 GB)加 128 GB DDR4,写自己看到超过 110 token/秒(评论里称为 3 token MTP),上下文用到 60K/260K,并觉得目前不差于自己约 60 token/秒的 Qwen 3.8 q5 27B。jacquesm 承认速度在,但自己试下来准确度并不特别打动人,并说这类链接在各处 LLM 帖子里很多,蜜月期过后还要再看。a11r 不愿意用到 4-bit 以下,怕质量掉得厉害;对方自己的栈是租来的 RTX Pro 6000、大约每小时 1 美元,用 4-bit 做范围明确的编程任务。Tepix 直接写 Q2 量化不感兴趣。mmaunder 把 Coder 版说成丢掉一半 MoE 专家,认为「有总比没有强」,但离够用还有距离。
Jackson__ 用一个 50 张图的坐标任务做了对比:同一套 GGUF 和视觉适配权重,Strata 的中位误差 154.8 像素、平均 168.8;llama.cpp 是中位 46.5、平均 81.4,温度都是 0。评论把这个差距比作从 9B 跳到 35B,并写没有再做别的测试。也有人拿别的引擎比较:kamranjon 说 ds4 已经支持这个模型,自己每天用 q4;AntiRush 则在 RTX 6000 Pro 上用 另一份 ds4 的 Q4,写下代码场景 prefill 1,251 token/秒、decode 255.26 token/秒,以及可以同时开 4 路、速度在 400 token/秒以上。lxe 问这种专家缓存为什么还不进 llama.cpp。回复里一种说法是 GGML 要求贡献者自己看得懂代码,完全由模型生成、作者也不打算整理的内核就留在下游;另一种说法是主流引擎要同时守数值精度和很宽的硬件、模型矩阵,所以合入慢。
专有名词解释
- Qwen3.8-Flash-Next:阿里云 Qwen 团队在 Hugging Face 上的开放权重预览。模型卡写 125B 总参数、约 6B 激活,并带视觉编码器。HN 标题把它写成 “Qwen 3.8 Flash Next”。
- MoE / 专家:Mixture-of-Experts。模型卡写 512 个专家,每步走 10 个路由专家加 1 个共享专家。Strata README 的 24,576 与「512 专家 × 48 层」数值相同。
- Q2 / IQ3 等量化:把权重压到大约 2-bit 或 3-bit 的格式名,README 的速度表按这些尺寸分行。评论里的担心是:更小更快,但低于 4-bit 时质量可能明显变差。
- MTP:模型卡里的 4B multi-token prediction 模块。mrinterweb 用 “3 token MTP” 描述自己的测速;README 则把同类加速写成小模型先猜、大模型再核对。
- GGUF:Jackson__ 用来对比 Strata 和 llama.cpp 的权重文件格式。评论写两边用的是同一套 GGUF 和视觉适配权重。
HN 讨论:thread · 598 分 · 280 评
2. Infidel goes wild
背景介绍
Andrew Plotkin 于 2026 年 10 月 3 日在 Zarf Updates 发表 Infidel goes wild。他写,前一天刚公开了 Planetfall,这几周则在看 Infocom 1983 年的文字冒险 Infidel,并用相当于内存级调试器的工具玩这款游戏,碰到了他见过的 Infocom 游戏里最离谱的 bug。分析对象是 Macintosh 更新版 release 22、序列号 840522;最初发行版序列号 830916 有同一个 bug,只是地址略有不同。
Infidel 的场景在埃及沙漠。营地以东是 3×3 的沙漠,再往外就走进一个叫 ENDLESS-DESERT 的房间,所有未画进地图的沙漠都由它代表,游戏另外记下经纬度。为了让「不同地点」看起来不同,丢在沙漠里的物品会被移出房间,坐标写进 DESERT-TABLE;走回同一坐标时再搬回来。丢下物品时还有三分之一的概率立刻被沙子埋掉。
Plotkin 想在调试器的 State 页显示这张表,发现表一直是空的,物品却确实会消失再出现。反汇编 DESERT-TO-TABLE 之后,他写原因是编译器:ZIL 允许参数默认值等于全局变量 DESERT-TABLE,但这张表的地址 11129 不是编译期常量。生成的 Z-machine 代码把局部变量初始化成全局变量的编号 30(十六进制 1e),而不是地址 11129。于是写入从内存地址 30 开始,把表和读回函数一起用错,表面上看物品还能回来,内存已经被踩过。Z-machine 版本 3 里地址 0–29 才是有意义的文件头,30–63 碰巧空着;地址 64 起是缩写表。他预言丢下九件物品再走开,最后一件会改写缩写表开头。文中贴出的结果是:幻觉句里的 “the” 变成了 “You”。另一次测试让解释器崩溃。他判断 1984 年的修订没有修这个 bug,也推测几乎没有人在无尽沙漠里丢过八件以上的东西。修法在文中写得很短:不要用全局变量当默认参数,改成函数开头 <SET TBL ,DESERT-TABLE>,或者多传一个参数。同文还提到另一对例程 PROP-TO-TBL / TBL-TO-PROP 有类似问题,而游戏并不允许在无尽沙漠挖坑。
主要讨论方向与观点
评论不多,多半接在那句「作为 C 程序员,我在法律上必须把内存破坏当成最严重的罪」上。Waterluvian 回了一句 “Self-flagellation considered dangerous.” kwertyoowiyop 问有哪位八十年代游戏程序员从没把内存写坏过就出过货。gertlex 说自己在读 Digital Antiquarian 的游戏史,那些文章往往要自己配磁盘镜像和模拟器;这种能直接在浏览器里看的写法,也许会让人真的去试一款解析器冒险。jdw64 问怎样才能写出这种基于亲身经历的技术文。zem 的回复把起点放得很小:在论坛里想起职业生涯中的一个瞬间并写短回复,或者学 Julia Evans 那样把「今天学到的一件事」写成博文,不要求每篇都一样重。页面底部还嵌了 Bluesky 和 Mastodon 上的转贴,其中有人问这会不会影响速通,glyph 提到有人在做以 6502 周期计时的 Zork 工具辅助速通,并链到 intfiction.org 的帖子。
专有名词解释
- Infocom / ZIL / Z-machine:Infocom 是八十年代商业文字冒险的公司。ZIL 是它们的实现语言,编译到 Z-machine 这种虚拟机。文中的
txd来自九十年代初的 ztools,操作码名字和 ZIL 术语并不一一对应。 - ENDLESS-DESERT / DESERT-TABLE:游戏里代表一切未测绘沙漠的单个房间,以及记录「哪件物品落在哪个经纬度」的定长数组。文章写这张表有 100 个值、从地址 11129 开始。
- 缩写表:Z-machine 文本压缩用的常用词表。文章写版本 3 从地址 64 开始,共 96 个词;被踩到之后,打印出来的句子会串词。
- Visible Zorker:文章后文用来比较的名字,原句是 Infocom 没有类似它的工具。开头只把作者自己的手段写成内存级调试器,没有另起一段定义这个名字。
HN 讨论:thread · 70 分 · 10 评
3. Turn off Apple Intelligence on macOS 27 and get its disk space back
背景介绍
RemoveMacAI 的 README 写:macOS 27 不再为 Apple Intelligence 提供一个总开关,功能关掉之后模型文件仍留在磁盘上。这个工具会关掉功能、删掉模型,并阻止系统再次下载;改动可以还原。它只支持 Apple 芯片。README 的系统表写 macOS 27 受支持、在 27.0 上测试过;27.0.1 需要 0.2.3 或更新版本。macOS 26 及更早不受支持。
关掉的功能包括 Siri(含 “Hey Siri” 和菜单栏图标)、Writing Tools、Genmoji、Image Playground、ChatGPT 扩展,以及邮件、信息、Safari、备忘录和通知里的摘要,还有邮件智能回复、行内文本预测、Spatial Photos、照片的 Clean Up、Xcode 预测性代码补全。删掉的是 Apple Intelligence 基础模型,以及图像生成、Genmoji、Spatial Photos、照片 Clean Up 和 Xcode 补全各自的模型。听写是另一项设置,语音模型不删。
实现上,配置描述文件套用 Apple 的限制键,并强制那些没有限制键的设置。模型通过 Apple 的 asset 服务删除,系统完整性保护保持开启,不直接改 /System 下的文件。描述文件把已删除模型的下载指到一个关闭的本地端口,避免系统再下回来。删掉描述文件后,设置回到先前状态,功能再次需要模型时系统会重新下载。README 写这个工具本身不发起网络请求、也不收集数据。安装方式包括 Homebrew,以及一行 curl | bash:脚本下载最新发行包、核对 SHA-256,再从临时目录运行。发行包由 GitHub Actions 从标签构建,并带构建来源证明,可以用 gh attestation verify 核对。项目致谢写,它建立在 4evy 的 pared 上,后者先摸清了 asset 服务、模型集合和一部分设置键。
主要讨论方向与观点
不少评论把它看成系统「去臃肿」。ryandrake 比作装完 Windows 后一向要做的清理,并说 macOS 也到了要靠第三方脚本拿回资源和去掉不想要的软件的地步。hypfer 提到 O&O ShutUp10,问 Apple 的产品策略发生了什么。rsx88 把这件事和 iPhone 上关不掉的订阅横幅放在一起,问今年是不是该改用 Linux。1saadcodes 肯定工具开源、做了什么能看出来,同时担心为用不上的模型交出几十 GB,离开了以前把系统做瘦的做法。kristianpaul 只写自己需要拿回 12 GB。Grombobulous 已经不用 Mac,但抱怨 iOS 上不能再用一个开关关掉这类 AI,并对比微软、Firefox 提供的全局 AI 开关。
也有人站在保留本机模型一边。pdp 不理解为什么要删掉每台 Mac 都带的、体积相对小、也不上云的本地推理模型:够不上前沿,但够基本任务。Waterluvian 想起十多年前为了「即插即用」而在 OS X 里塞进数 GB 打印机驱动,好奇 Apple 怎么权衡磁盘占用和一部分用户的不满。安全问题被直接问出来:the_arun 问凭什么相信这个工具;回复是代码开源,可以自己看。pyaamb 问能不能手动做,detourdog 贴了 Apple 讨论区的一篇文档链接,本文没有再打开那篇文档核对步骤。pmarreck 问它到底做什么;一条回复用讽刺口吻描述被关掉的那些系统功能,不是在逐条解释这个仓库的代码。
专有名词解释
- Apple Intelligence:macOS 27 上的系统级生成功能总称。README 的判断是:这一版没有单一开关,关掉功能也不会自动清掉已下载模型。
- 配置描述文件:macOS 用来下发限制的配置。RemoveMacAI 用它套限制键,并让用户在系统设置里批准安装。
- asset 服务:README 用来删除和拦截模型下载的系统组件。文件真正从磁盘消失的时间由系统自己排,所以「存储空间」里可能还会暂时把它们算在 Apple Intelligence 名下。
- 系统完整性保护(SIP):macOS 阻止直接改系统目录的机制。README 写删除模型时 SIP 保持开启。
- pared:4evy 先写的工具。RemoveMacAI 在致谢里把它当成摸清模型集合和设置键的基础。
HN 讨论:thread · 334 分 · 210 评
4. In the wake of closure, a digital archive of animated materials appears online
背景介绍
Ryan Lambie 于 2026 年 10 月 2 日在 Film Stories 发表 Tippett Studios | In the wake of its closure, a digital archive of animated materials appears online。文章说,Phil Tippett 创办的伯克利动画与特效公司 Tippett Studios 在财务困难之后关停;关门日期写的是「那个月的 28 日」,而「那个月」是文章开头的八月。以 10 月 2 日的发表日期来读,指的是当年八月二十八日,句子里没有再写一遍年份。关停的同时,Tippett 本人退休,几十年的道具、纪念品和美术在两天拍卖里卖掉。文章担心工作室里的大量资料会进私人收藏、不再公开,并提醒 Tippett 的工作出现在 Star Wars、RoboCop、Starship Troopers 等片里。
随后的消息是:一位化名 TippettFan 的人在八月拍卖上买下夹着 CD-ROM 和其他光盘的文件夹,价格未披露,并把内容数字化后上传到 Internet Archive。捐赠说明写,这里是 Tippett 档案里 90 张关键、不重复光盘的 .ISO 镜像,因为其中一些资料网上没有、以后也未必再以这么高的分辨率出现。馆藏页在 archive.org/details/tippett-archive。文章说,少量片段可以直接在线看,包括 CGI 生物测试和 2008 年对 Phil Tippett 的采访;主体仍是 ISO,文件名涉及 RoboCop、Starship Troopers 的幕后、原版 Star Wars 上的幻灯片,以及《猫女》(Catwoman)的宣传剧照。文章感谢在 Bluesky 上指出这个馆藏的 Brandon Sheffield。
主要讨论方向与观点
这条下面只有两条评论。drewbeck 认为标题里应该出现 Tippett Studios 或 Phil 的名字,否则熟悉他的读者找不到这篇。stavros 说这有 textfiles 的味道,并补了一条 discmaster.textfiles.com 上搜索 “tippet” 的链接(检索词少了一个 t)。没有人在已抓到的评论里核对 ISO 数量或拍卖价格;价格未披露这一点来自 Film Stories 的正文。
专有名词解释
- Tippett Studios / Phil Tippett:伯克利的定格与特效公司及其创办人。文章用 Star Wars、RoboCop、Starship Troopers 举例说明其作品被用进过哪些电影。
- ISO:整张光盘的镜像文件。捐赠说明写馆藏主体是 90 张不重复光盘的 ISO,而不是已经拆开的单张图片。
- Internet Archive:文章所说的上传目的地。馆藏标识是
tippett-archive。 - textfiles / discmaster:评论里用来类比的旧软件与光盘目录。那条检索链接把工作室名字拼成了 tippet。
HN 讨论:thread · 13 分 · 2 评
5. Self-hosted HTTP tunnels with SSH and Nginx
背景介绍
Vincent Bernat 于 2026 年 10 月 3 日发表 Self-hosted HTTP tunnels with SSH and nginx。场景是:朋友要看只跑在 localhost:8080 上的草稿。文章先把现成办法分成三类:ngrok、Cloudflare Quick Tunnels 这种商业服务;frp、localtunnel 这种能自己搭、但要专用客户端的;以及只要普通 SSH 客户端、却依赖特定 SSH 服务端的 sish。他要的是只用已经在服务器上的 OpenSSH 和 nginx。
步骤是:ssh -R 把远程端口转到本机服务,远程端口写 0 时由服务器分配空闲端口;nginx 再把 https://p<端口>.ssh.luffy.cx 代理到本机该端口。*.ssh.luffy.cx 需要 DNS 和 Let’s Encrypt 通配符证书。文中的 ACME DNS-01 用的是 Route 53 上的 acme.luffy.cx,证书由 NixOS 自动拿。文章接着说,端口本身熵不够:内核从本地端口范围里分配,而且更偏向奇数端口,等于再少 1 bit。于是用 nginx 的 ngx_http_secure_link_module,对过期时间、端口和一个密钥做 MD5,把 base64 哈希和过期时间放进 URL 的用户名(域名不区分大小写,放不下这个哈希)。示例形态是 https://<哈希>--<过期时间>@p41535.ssh.luffy.cx/。哈希不对返回 401,过期返回 410,因为以后的会话可能重新用到同一个端口。文章自己写,MD5 偏弱,但就这个用途够用;也警告这套配置会把监听在 127.0.0.1 或 0.0.0.0 上的任意 TCP 端口暴露给持有密钥的人,从而绕过多数防火墙规则,并建议把 server_name 收紧到临时端口范围。
因为 OpenSSH 不会把分配到的端口放进环境变量,后半篇是一个装在服务器上的 http-over-ssh 辅助脚本:沿着 sshd-session 进程找出在听的端口,再印出 URL。OpenSSH 9.8 起会话进程叫 sshd-session,更早版本要找 sshd。查端口需要 sudo,因为降权后的进程被内核标成不可转储,ss 否则看不到套接字属于谁。脚本和一份 NixOS 模块放在他的 nixops-take1 仓库。
主要讨论方向与观点
toomim 更想要跑在 iroh 上的 HTTPS:不转发端口、不需要公网 IP、也不另搭代理;两台机器经 iroh 的公共中继对上信号,再直接连。评论里提议的 URL 方案名叫 irohttps://,并贴了 iroh-webproxy 和 iroh-proxy-utils。aliasxneo 说自己在做的 DNTLS 也想覆盖这件事,并认为 Tailscale、Cloudflare 这类服务把隧道做得很方便,但「自建」的边界被抹糊了;理想是完全没有中间人。guessmyname 问:既然是自建,为什么还要 *.ssh.luffy.cx 这种第三方名字。benatkin 回复:换成你自己的域名。gonzalohm 倾向于只给装了指定客户端证书的浏览器提供内容,并指出手机浏览器常常处理不好证书。esseph 欣赏「已经有的技术就拿来用」,同时指出没有代理的自建要把端点暴露出去,防御手段往往更少。snehesht 写自己在做用户态 WireGuard 的类似东西,还没贴出代码。
专有名词解释
- SSH 远程转发(
-R):让 SSH 服务器上的一个端口接到你笔记本的localhost。端口写 0 表示由服务器挑一个空闲端口。 - secure_link:nginx 用来核对链接签名的模块。本文用它检查 MD5、过期时间和端口,不把「知道端口号」当成唯一秘密。
- ngrok / Cloudflare Quick Tunnels / frp / localtunnel / sish:文章开头用来对照的现成隧道。前两个是托管服务,frp 和 localtunnel 要专用客户端,sish 则要特定的 SSH 服务端。
- iroh:评论里提出的替代路线。说法是先经公共中继交换信号,再在两台机器之间直接加密连接,从而不用自己做端口转发。
HN 讨论:thread · 46 分 · 11 评