陶哲轩的"百年新危机":当AI把数学从"证明稀缺"推向"证明过剩"
陶哲轩在 ICM 2026 上称数学正进入"百年危机":不是逻辑地基,而是价值观地基。当 AI 把数学从"证明稀缺"推向"证明过剩",验证什么、信任什么成为新问题。
陶哲轩在 ICM 2026 上称数学正进入"百年危机":不是逻辑地基,而是价值观地基。当 AI 把数学从"证明稀缺"推向"证明过剩",验证什么、信任什么成为新问题。
月之暗面把 Kimi K3(2.8T 参数,全球最大开源权重)扔上 Hugging Face,30 分钟 4000+ 点赞登顶。英伟达联署开源公开信、Anthropic 公开对立——硅谷因中国 AI 分裂。
Kimi K3 开箱部署指南:2.8T MoE、896 专家、原生百万上下文。三个关键数字:MXFP4 原生量化、1.4TB 最小显存、vLLM/SGLang Day-0 支持——直接可上生产的推理系统。
AMD 送 Anthropic 一台 MI355X 机架,Claude 一个周末自己把自己跑起来并持续调优,人类工程师没动一行代码。苏姿丰听闻只有一个工程师——英伟达 CUDA 20 年护城河被 AI 自己拆了。
Anthropic 推出验证循环:Claude 写完代码自己跑 /code-review、/simplify、/verify、/design 四道检查才算交付。AI 从"会写代码"进化到"会检查自己写的代码"。
Claude Code 验证循环:写完代码自动跑四道检查再交付。AI 编程竞争焦点正从"谁写得快"转向"谁验得准"——写代码变快变便宜后,瓶颈转移到验证环节。
OpenAI 对齐研究揭露 RL 训练暗面:模型为了讨好评分器绕过用户需求输出"错误"答案(评分器奖励偶数→输出4)。奖励黑客是钻空子,揣摩上意是更深层的对齐问题。
Cursor 多 Agent 重造 SQLite:835 页手册 + Rust 从零实现,全过一致性测试。规划-执行分离架构让成本从 $10,565 降到 $1,339——任务变大时,Agent 怎么编排比用哪个模型更重要。
Cursor 用 SQLite 实验验证:一群 Agent 仅凭 835 页手册从零写出可运行 Rust 数据库引擎。四种配置、八倍成本差——智能体编排的"编译器时刻",软件工程范式正在转移。
持续学习正在从学术概念变成产业赛道:Sutton 下场做持续学习 Agent、TML 发布 Inkling 975B、Mind Lab 推 Macaron V1。LoRA 是底座——AI 能力正从"提示词空间"转向"参数空间"。