0%

Hacknews Daily Summary - 2026-10-07

今日 Hacker News 热榜前五里,两条都指向 OpenAI 刚公开的数学预印本库:第一条是整批结果的发布说明,第五条单独讨论其中的整数乘法。中间是 Mistral Large 4 的公开预览、把 PS5 可执行文件重链接到 PC 的 AnyPS5,以及 OpenAI Decisions API 的公测。数学仓库写明稿件处于不同核验阶段,并非篇篇都有 Lean 形式化;Mistral 的新闻稿和文档页对激活参数的写法也不一致。以下按 Firebase topstories 当时的顺序整理,分数与评论数为抓取时快照。

1. Sharing AI progress in mathematics

背景介绍
OpenAI 这篇发布页直连返回 HTTP 403,下面的页面原文来自 r.jina.ai 转写,并与 openai/math 的 README、CONTENTS.md 核对。页面说,他们放出一批由一个内部前沿模型做出的数学结果,模型链接指向此前的 Navier–Stokes 页面。发布方式参考了普林斯顿高等研究院「数学与人工智能咨询组」(AGMAI)的意见和公开建议:这次先放在 GitHub,并附上修订和引用规则;他们还在看有没有符合该委员会要求的社区托管方案。许多证明会用 Lean 写成可机检的形式化,拿到之后再补进仓库。页面还说会公开 10 份推理过程摘要、按 ChatGPT Pro 用量估算的算力,以及尝试过多少问题。平均每个结果所用的算力,大约相当于三小时的 ChatGPT Pro 思考。页面写,他们打算资助围绕这些结果的研讨和项目,并在准备把产出这些结果的模型负责任地放出来。

仓库 README 写得更具体,也更谨慎。稿件和证明附件来自一个尚未发布的内部模型;现有数学评测饱和之后,他们把评测扩到开放研究问题上,有些输出建立在模型更早的结果之上。目录里目前是 722 篇手稿、372 个族。一族可以包含主结果、伴随论证、推论或另一条证明。核验阶段并不整齐:不是每篇都有 Lean,README 写「有些尚未形式化的结果可能有问题」,并说会尽快修。绝大多数结果用同一套流程:平均每个结果三小时 ChatGPT Pro 算力,整个评测大约抛了 4,000 个问题,再按族和显著性收成现在的目录。README 点名的例外有两处:黎曼 ζ 函数的无零点区域,以及对 CM 阿贝尔簇的 Hodge 猜想的证明。另外,Re(s) > 11/12 这一无零点区域的文稿经过人工编辑,以便阅读。GitHub API 显示该仓库创建于 2026-10-06 21:47 UTC。

CONTENTS.md 里抽查到的几条,都是目录自己的表述,不是本文重新证明过的定理。第 102 族写,证明了 Khot 的 Unique Games 猜想:对任意固定的 ε、δ ∈ (0, 1/2),给出从 3SAT 到有限字母表 Unique Games 的确定性多项式时间归约,完备性至少 1−ε,soundness 至多 δ。同一族还写了若干直接归约,包括在无权图上、超过 Goemans–Williamson 比例的 Max-Cut 近似是 NP-hard。这一族标了 Lean 链接。第 180 族写,证明 Barnette 猜想:每个有限、简单、三正则、二部、平面、三顶点连通的图都有 Hamiltonian 圈;也标了 Lean。第 124 族写,解决 Garey 与 Johnson 书里的三台相同机器、单位工时、带优先约束的调度问题,给出确定性多项式时间算法,并标了 Lean。第 003 族写,每个 Dirichlet L 函数(含 ζ(s))在 Re(s) > 7/8 没有零点,并称之为拟黎曼假设的解决;伴随稿另给 Re(s) > 11/12 的证明,这一族同样标了 Lean。README 说 11/12 那篇文稿经过人工润色,无零点区域的工作和 CM 阿贝尔簇上的 Hodge 猜想不属于上面那套固定流程。整数乘法是第 109 族,放在本文第 5 条。

主要讨论方向与观点
讨论集中在「如果这些稿子成立,分量有多大」,以及还没人逐篇核完。enoether 说 Unique Games 猜想是复杂性理论里的基础猜想,很多不可近似结果以它为前提,一份站得住的证明是大事。prideout 点名 Barnette 猜想:几个月前用当时的前沿模型自己试过,没做出来;这份证明乍看还读得进去。NotOscarWilde 做调度,认为三机单位工时不如 Unique Games 重要,但从 Garey 与 Johnson 1979 年的书起就是开问题。他引用论文里的 Theorem 1.1:在确定性多带图灵机上,步数是 O((L+2)^150020),L 是输入的二进制长度。目录摘要只写「多项式时间」,这个指数来自该评论对论文的摘引,本文没有从 PDF 里再对一遍。他说自己今天核不了正确性,但希望这个指数是真的。

xanderlewis 引用 Kevin Buzzard 的话:Buzzard 在 2020 年《Notices of the AMS》里问过,若有一个人同时理解全部现代纯数学,他立刻还能多看多远;六年后开始看见答案的形状。schleck8 贴了 Anthropic 数学家 Levent Alpöge 的一段评论,把证明、零和计算机这一类历史进展,与「把过去十年糊在一起看、再用今天来度量」做对比,说没有可比较的东西。这段是 HN 上的转述,本文没有打开 Alpöge 的原帖。gizmodo59 认为这是一次没有伴随戏剧的进展,并建议把仓库交给自己的 agent 去估分量;评论里还有「相当于人类 50 到 100 年数学进展」的说法,那是评论者的判断。foota 引用了仓库里「平均每个结果大约三小时 ChatGPT Pro」那句。bashtoni 问的是就业:数学家会被替换,还是会多出一批审这些证明的工作,现在还不清楚。againstapples 以「AI doomer」的身份问非 doomer:这类结果在未来一到五年里,是平台期,还是只停在数学里。zone411 对照 proofatlas.ai 的开放问题榜,称这份目录声称完整解决了前 500 个问题中的 90 个,并列出他认为排名最高的若干项,其中包括有理数上的 Hilbert 第十问题、Unique Games、Anderson 模型的扩展态和时空 Penrose 不等式。本文没有核这 90 条;仓库里确实有标题对应 Hilbert 第十问题(有理数)和 Unique Games 的手稿目录。sebmellen 建议去读 reasoning_traces/,README 的十份摘要表里包括三维相对论 Vlasov–Maxwell 系统。

专有名词解释

  • AGMAI:页面上的全称是 Institute for Advanced Study 的 Advisory Group on Mathematics and Artificial Intelligence。OpenAI 说这次的发布形式参考了他们的建议。
  • Lean:可让计算机检查证明的形式化语言。README 写许多手稿已有形式化,但不是全部;未形式化的结果可能有问题。
  • Unique Games 猜想:Khot 提出的复杂性猜想。目录第 102 族声称用从 3SAT 出发的归约证明了它。完备性是「原问题可满足时,新实例里能满足的约束比例」;soundness 是「原问题不可满足时,任何赋值至多能满足的约束比例」。同一族还由此写到一批近似问题的 NP-hard 门槛。
  • Goemans–Williamson:Max-Cut 的一种半定规划近似算法。目录说,在无权图上,任何固定地优于该比例的近似都是 NP-hard。目录没有写出这个比例的小数。
  • Barnette 猜想:每个有限、简单、三正则、二部、平面且三顶点连通的图都有一条经过每个顶点恰好一次再回到起点的圈。目录第 180 族声称证明了它。
  • 拟黎曼假设:目录第 003 族用这个名字称呼「Dirichlet L 函数在 Re(s) > 7/8 无零点」。ζ 函数是其中之一。Re(s) > 11/12 是伴随稿,README 写那篇文稿经过人工编辑。
  • ChatGPT Pro thinking:OpenAI 用来给这批结果估算算力的单位。页面和 README 都写,平均每个结果大约三小时。

HN 讨论:thread · 362 分 · 299 评

2. Mistral Large 4

背景介绍
Mistral 于 2026 年 10 月 6 日发布 Introducing Mistral Large 4。HN 提交的 URL 末尾多了一个反斜杠,文章本身的地址没有它;模型卡在 docs.mistral.ai。博文称公开预览,非正式名字 ML4,正式绰号 “le Chonk”。预览 API 可在 Mistral Studio 试用,权重写在本月底放出。

参数有两套官方写法。博文写:原生多模态,1 万亿参数,490 亿激活,是他们至今最大的模型,并且还在变好。文档页 meta(页面标注 October 6, 2026、Public Preview、Open v 26.10)写:细粒度 Mixture-of-Experts,激活 52B,总参数 1.05T,另有 1.6B 视觉编码器。同一文档页的价格数据是:输入每百万 token 0.68 美元(划掉的 originalPrice 为 1.36)、缓存输入 0.07 美元(原 0.14)、输出 2.09 美元(原 4.18),上下文 1M。本文没有另找第三方价目表。

博文写,ML4 从零训练,用了 Mistral 自己位于欧洲的数据中心里 3,800 张 NVIDIA Grace Blackwell GPU,公开预览也由这套设施提供。权重放出前,他们与网络安全方面的负责人、受审合作方和国家机构做红队,对方使用同一模型,但审核更松、网络能力更宽。博文强调欧洲端到端部署,按欧洲法律、不依赖其他数字服务商;训练数据里有相当一部分是多语的,覆盖 160 种以上语言,包括欧盟每一种官方语言。定制和强化学习环境与卖给客户的 Mistral Forge 相同。博文还写,更细的架构、更多基准和后训练方法要等权重一起公布。

博文中的基准是 Mistral 的表述,本文没有重跑。Artificial Analysis Cyber Index 上,他们写 ML4 位于全球前五,并大幅领先在中国以外开发的开放权重模型;其中一项「在开源软件里复现真实漏洞再打补丁」的测试为 82%,是该项任何模型里的最高分。Cybench(40 道来自安全竞赛的练习)为 93%,称为开放权重模型里最高分之一。博文接着说,Claude Opus 5.5 和 GPT-6 Astra 在同一测试上接近 0 分,因为它们拒绝做这件事;而防守往往要从证明漏洞真实开始。内部测试里,模型被用于分析恶意软件、给漏洞排序和写检测规则。博文同时写,在 JailbreakBench、StrongREJECT 和 AgentHarm 的网络安全提示上,ML4 的平均拒绝率高于所有开放权重模型。

编程数字:DeepSWE v1.1 为 61.7%,SWE-Atlas-QnA 为 59.4%,Terminal-Bench 4 为 28.3%,Coding Agent Index 合计 49.8%,博文称高于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。Surge AI 的盲测里,职业标注者按 1–5 给编程质量打分,ML4 Preview 在五个模型里排第二(3.74),低于 Claude Opus 5(4.22),高于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40)。AutomationBench 的 657 个业务流程(Gmail、Google Sheets、Slack、Salesforce 等)为 59.9%。AA-Briefcase 的 Elo 为 1,393。视觉定位 Dense 200 为 42%,GPT-6-Astra 为 41%。开放权重模型里,SciCode-Verified 被写成领先;博文举例说它可以一次生成完整的 Hartree–Fock 模拟。法律和金融任务经由 vals.ai,博文称两项都超过 GPT-6-Astra;HarveyAI 的 Legal Agent 上超过所有开源模型。Lakera 公开的 B3 基准上挡住 93.3% 的攻击。KORA 为 1.691,满分 2,博文称为他们在开放权重模型里测到的最高。内部标注者拿它和 GLM-5.3 比:CAD 和 STEM 更偏好 ML4,金融和编程接近或持平。

后训练一节把预训练的 3,800 张卡和当前强化学习规模分开写:当前规模是 3k GPU,单次训练一天大约产生 330 亿 token,过滤和掩码之后约 160 亿是可训练的 completion token。博文写这次预览背后的强化学习还在跑,没有饱和的迹象。文末把 ML4 称为 €30 亿 Series D 路线图上的第一个里程碑,并称这是欧洲科技公司最大的一轮股权融资。这是博文自己的说法。

主要讨论方向与观点
simonw 试了推理档位:只看到 “none” 和 “high”。两边的思考痕迹都很少,high 的输出 token 甚至更少,但 high 画出的自行车车架更好。他把自己的鹈鹕骑自行车结果链出来,并说这是他见过的 Mistral 模型里最好的一张。chriddyp(Plotly)贴了他们的数据分析基准:相对 4 月的 Mistral Medium 3.5,价格约为十分之一,正确率从 58% 到 74%;还没站上帕累托前沿,但他认为再过几个月会很好。这些百分比和倍率是该评论里的结果,不是博文的数字。jakozaur 用 Vals Index 做了更宽的比较:48.05% 对 GLM-5.3 的 53.51%,每次测试 13.78 美元对 7.25 美元,并说很多公司仍会因为它不是中国模型而选用。他把 82% 叫成 CyberGym-E2E;博文的 82% 写在 Artificial Analysis Cyber Index 的那一项漏洞复现测试上,两个名字本文没有再对齐。

abixb 问基础设施:若大约 4,000 张 Grace Blackwell 就能把 1T 模型训到接近 Kimi K3、并在部分项上追上中国实验室,美国超大规模集群里的几十万张卡是在做什么。评论里点名的集群规模是评论者的说法。eigenspace 觉得这至少说明早期并不是赢家通吃、追赶不可能;Large 3 摔过之后 Mistral 还在,他希望它「够好」,成为欧洲的默认选项。michaelkdev 把卖点放在欧盟主权:在欧盟训练、在欧盟推理。prodigycorp 认为视觉和网络安全数字够做日常模型,网络安全上也许会成为首选,并说不该无缘无故贬 Mistral。simjnd 认为它比 DeepSeek 4.1 Flash 略低、规模大约两倍;对一个「本该几个月前发布」的模型来说已经不错。manlymuppet 的语气相反:讨论像在给最后冲线的孩子加油,Mistral 的进度比美国实验室和中国实验室都慢。

专有名词解释

  • MoE:Mixture-of-Experts。文档页写 ML4 是细粒度 MoE,所以激活参数远小于总参数。博文的 490 亿激活和文档的 52B 激活没有对齐。
  • Grace Blackwell:NVIDIA 的 GPU 平台。博文写从零训练用了 3,800 张,放在 Mistral 自己的欧洲机房;后文的强化学习规模另写为约 3,000 张。
  • Cybench:博文描述为 40 道来自安全竞赛的练习。93% 是博文里的分数。
  • Dense 200:博文用来比较视觉定位的基准。42% 与 41% 都出自这篇博文,不是本文复测。
  • Hartree–Fock:量子化学里近似电子结构的一套计算。博文说 ML4 可以一次生成完整模拟。
  • le Chonk:博文给 ML4 起的绰号。权重仍写在本月底,预览期间先走 API。

HN 讨论:thread · 1580 分 · 960 评

3. AnyPS5: Port PS5 binaries to PC without emulation (87% system libraries mapped)

背景介绍
AnyPS5 的 GitHub 描述是:把 PS5 可执行文件自动移植到 Linux 和 Windows。README 写,relinker 把可执行文件转成目标系统的原生格式,并提供一批可动态链接的系统 PRX 库实现。没有仿真,也没有单独的运行时进程。语言是 C++,许可证是 GPL-2.0 only。仓库创建于 2026-08-03。README 没有署个人真名,账号是 boykopovar。

HN 标题里的 87% 和页面徽章不是同一个数字。抓取时 libraries 徽章 为 86.62%,shaders 徽章 为 97.34%。README 的脚注写明:系统库百分比是项目迄今已知、并在 core/libs/prx 里声明过的函数所占的比例,不是全部 PS5 系统函数;分母会随着新声明变大。着色器重编译器在打开 ANYPS5_ENABLE_SPIRV_TOOLS 时,会用 SPIRV-Tools 校验生成的 SPIR-V。未支持或意外状态一律抛 std::runtime_error,把 what() 打到 stderr 后进程退出。

兼容表 COMPATIBILITY.md 里目前只有一行:Dreaming Sarah(ID PPSA02929),Windows 为 “In game, playable”,Linux 为 “?”。GTX 1050 Ti / i5-7500 3.4GHz 上 60 FPS,Intel HD Graphics 620 / i5-7200 2.5GHz 上 36 FPS。用法要求一份干净的 ELF,配套模块放在可执行文件旁的 sce_module/、sce_modules/ 或 prx/。relinker source/input.elf app.elf 产出 Linux ELF;加 --windows 产出 PE。--to-intel 给 Intel 主机。输出格式默认是 Linux ELF,只把文件名改成 .exe 并不会变成 Windows。手柄走 SDL 映射;键鼠用 anyps5-input.ini。

免责声明写:项目用于互操作、研究、保存和兼容,不包含、不分发、也不要求版权软件、固件、密钥或专有库;使用者自行遵守法律和许可。技术债文档写,Windows 构建需要特定的 MinGW-w64 GCC 15.2.0,并且若干对话框库是静默桩:存档、消息、错误和登录对话框不画出真正的界面。

主要讨论方向与观点
someperson 建议本地做 git 镜像,因为项目以后可能被法律投诉下架,并举 Yuzu、Ryujinx,以及 Nintendo 在一天内清掉大批 Switch 模拟器仓库的报道。causesothere 好奇是谁在做这种东西:太受欢迎的话,像是在请政府上门;同时认为问题本身在技术上有意思,也高兴有人在保存游戏。weakened_malloc 支持打破厂商锁定,但担心这会推动 Sony、Nintendo 和微软更偏向云游戏,让这类移植更难发生。dukodk 问会不会在发售日就有 GTA 6 的 PC 移植。vuurmot 接着问:若第一天就能把游戏剥出来,谁还会付钱,软件产业权重大的国家会不会被压垮。这两问都是推测,兼容表里并没有 GTA。

emkoemko 问这是不是 WINE 那种做法。Xirdus 回复:介于 Wine 和 Rosetta 之间;二进制本身会被改写,但源和目标都是 x86,所以没有指令转译。isityettime 接着问,这听起来不就是 Wine。README 的原话是重链接到原生格式,加上系统库的重新实现,没有仿真,也没有单独的运行时进程;它没有使用 Wine 或 Rosetta 这两个名字。dsedgwick 认为,既然 PS5 已经是 x86-64,摩擦主要在专有图形 API,并问 GNM 命令缓冲是在静态重链接阶段预先编成 Vulkan,还是游戏排队绘制时仍有运行时拦截。README 确认着色器重编译器产出 SPIR-V,没有写 GNM 命令缓冲的处理方式。

专有名词解释

  • PRX:PlayStation 上的可重定位系统库模块。AnyPS5 重新实现的是项目已经声明的那一部分,徽章分母会变。
  • relinker:仓库里的转换器,把 ELF 收成 Linux ELF 或 Windows PE,再链到这些库。
  • SPIR-V:着色器的中间表示。README 写重编译器能生成它,并用 SPIRV-Tools 做校验。
  • GPL-2.0 only:GNU 通用公共许可证第 2 版,不含 “or later”。
  • Wine / Rosetta:Wine 在非 Windows 上翻译 Windows API,而不是仿真 CPU。Rosetta 是苹果在不同 CPU 架构之间翻译指令的兼容层。Xirdus 用这两个名字描述 AnyPS5;README 没有使用它们。

HN 讨论:thread · 54 分 · 15 评

4. Decisions API is in public beta

背景介绍
OpenAI 的 Decisions API 指南 写,这个接口评估文本、图像或两者,返回带类型的答案,速度大约是 Responses API 的 10 倍。用途是判断条件是否成立、从固定选项里选一个,或按量表打分,用来分类、路由和排优先级。接口处于公测,文档预期未来几周进入 GA。目前唯一可用的模型是 gpt-6-luna,端点是 POST /v1/decisions。

三种问题类型:predicate 检查一个条件,返回 0 到 1 的概率,表示模型估计该条件为真的程度;choice 从调用者给出的选项里选一个,并返回各选项概率和一个 confidence;score 按从低到高的等级打分,返回的分数是等级下标的概率加权平均,因此可以落在两个等级之间。文档里的例子:0.1、0.7、0.2 三个概率得到 1.1。需要自由生成、符合自有 JSON schema 的对象时,文档建议用 Responses API 的 Structured Outputs;需要模型发起工具调用时用函数调用。相互独立的问题可以放进同一次请求;若后一个问题依赖前一个答案,则要分成两次。

图像必须是内联的 base64 data URL。托管的 HTTP/HTTPS 图片 URL 和 file_id 不受支持。定价写在 gpt-6-luna 上:输入每百万 token 0.10 美元,只对输入 token 收费,没有缓存读、缓存写或输出 token 的费用。区域处理加价和长上下文乘数仍然适用;同一模型走其他接口时,按那些接口自己的价格。文档写,符合条件的客户可以使用 Zero Data Retention 和 HIPAA;数据驻留和区域处理支持美国,以及欧洲(EEA 与瑞士)。

主要讨论方向与观点
simonw 贴了一次真实调用:输入 “I am angry about the new product feature”,两个 predicate 分别问是不是投诉、是不是夸奖,返回概率 0.91 和 0.06,output_tokens 为 0,输入 310 token。他把这收成一个 llm 插件 llm-openai-decisions,并说 OpenAI 单独开一个端点时,常常会变成其他供应商跟着做的事实标准。TSiege 把这次发布读成对 Jev 的回应,并认为这能说明 AI 生意是大宗商品:Jev 证明了又快又便宜的是/否/置信度就够用,开源版本涌进 Hugging Face,大实验室若想留住客户,就得把原本靠输出 token 赚钱的一块让出去。sidcool 说 Jev 震动了行业,事后看很明显。jasonjmcghee 回想起早期补全 API 和指令 API 分家,问这种接口以后会不会被折进模型的后训练,让校准过的输出变成模型本身的能力。swader999 问,为什么不直接做进所有模型,而要单独一条路由。

Topfi 用不到 600 次调用,经 OpenRouter 把自己的决策评测(界面组件选择、聊天图表、标签、个人知识管理)拿去对 Jev 和 Mercury Decide。他的初步结果:比 Jev 慢,延迟和 Mercury Decide 差不多,但并不随输入变长而线性增长(p50 346ms,p95 860ms);在他那些含糊的界面任务上置信度更低,0.6 及以下常常达不到他的用途;失败调用 4 次,两家对照都是 0;平均比 Jev 贵约 3.1 倍。他尚未测试图像输入,并说这套评测绑在自己那个带无限画布的 Firefox 分支上,不能当成通用结论。MiroslavPokorny 针对文档里「罐头有没有凹痕」式的商品损坏示例,问知道这一点有什么价值。mrkn1 另指了一条在 CPU 上跑决策模型的项目 gutsy,本文没有展开那条线程。

专有名词解释

  • predicate / choice / score:Decisions API 的三种答案。第一种是条件为真的概率;第二种是无序类别;第三种是有序等级的期望下标。
  • confidence:choice 和 score 在概率分布之外另给的字段。文档建议用自己的标注样本来定路由阈值。
  • gpt-6-luna:文档写明,公测期间这个端点只有该模型。这里的 0.10 美元/百万输入 token 只适用于 /v1/decisions。
  • Zero Data Retention:文档中的零数据保留选项,限于符合条件的客户。
  • Jev:评论里用来对照的决策模型。TSiege 把它描述成便宜的是/否/置信度接口,并说开源版本已经很多。本文没有另抓 Jev 的产品页。
  • Responses API:OpenAI 用来生成文本和工具调用的接口。Decisions 文档用它做速度和用途上的参照。

HN 讨论:thread · 121 分 · 51 评

5. Integer multiplication below n log n

背景介绍
这一条是第 1 条同一个仓库里的单篇预印本,日期写着 2026 年 9 月 23 日,作者栏是 OpenAI。目录里的 README 只有标题、日期和 BibTeX,正文在 paper.pdf。CONTENTS.md 第 109 族的摘要是:在一台固定的、有限字母表、有限条一维纸带的图灵机上,对每一个输入长度,把两个 n 比特整数精确相乘,确定性最坏情况时间为 O(n (log n)^{1−κ}),其中 κ = 2^{−182}。目录说,这在普通多带比特模型里否定了 Schönhage–Strassen 关于 n log n 最优的猜想。手稿简介里的对数写成 lg,族摘要写成 log;两者都在同一个大 O 和同一个指数下面。

和第 1 条里几篇不同,这一族的标题下没有 Lean 链接,仓库里也没有 lean/docs/109。第 102、124、180 和 003 族则标了 Lean。本文没有运行那些形式化,也没有把这篇 PDF 逐页核完。第 1 条的 README 仍然覆盖它:未形式化的结果可能有问题;平均结果大约用了三小时 ChatGPT Pro 量级的算力。那是整批目录的平均值,不是这篇单独标出的耗时。

主要讨论方向与观点
线程几乎全在谈这个指数有多小,以及没有机器检验时该不该信。shmoil 说自己对着 n lg n 的 (1 − 2^{−182}) 次方笑出声。12390asdjkas 写,这适合「数组至少有 2^118000 个元素」的场合,除非加速是真正一般的,否则不会在意各种乘法加速的提案。2^118000 是这则评论里的说法,不是目录里的门槛。MinimalAction 问,既然看起来没有低出阈值多少,为什么还值得注意。isaac-harvey 回复:只要任何一点低于 n log n,就说明上面可能还有空间;理论上很小的突破,常常会引来后来真正把差距拉开的工作。Kotlopou 把兴趣放在应用之外:用上万亿美元的技术,才知道两个数可以乘得稍快一点;数学比大模型大,声称数学正在被「解决」、开放问题快要用完的人,还没有朝这口深渊里看够。infocollector 说,若有人真能读懂,这会很惊人。

wk_end 直接问有没有配套的机器检验证明。他写自己工作里已经是 vibe-code,所以既知道前沿模型有多强,也知道它们会很有把握地讲出错事。没有 Lean 开发或充分的人工核验,他就保持怀疑,甚至有点希望结果是错的:一部分是因为他对 AI 并无好感,一部分是因为 n log n 比现在这个界漂亮得多。目录现状和他的要求对得上的地方是:整数乘法这一家没有挂上 Lean 链接。

专有名词解释

  • n log n:n 比特整数相乘时,人们长期对照的复杂度标尺。目录把 Schönhage–Strassen 猜想表述为:在普通多带图灵机上,这个量级已经最优。算法文献里,2019 年 Harvey 与 van der Hoeven 给出过 O(n log n) 的算法;本预印本声称再低一个 (log n) 的极小幂。
  • κ = 2^{−182}:目录里的指数。相对 n log n,比值是 1 / (log n) 的 2^{−182} 次方,所以对任何写得下来的 n,改进都极小。评论区笑的是这一点。
  • 多带图灵机:这篇复杂度陈述所用的计算模型。目录写明是一台固定机器、有限字母表、有限条一维纸带,而且每个输入长度都精确,不是近似或平均情况。
  • Schönhage–Strassen:1971 年的快速整数乘法,以及目录所否定的那条最优性猜想。猜想的原始论文不等于这份预印本。

HN 讨论:thread · 40 分 · 27 评