当地时间 7 月 23 日 12 点,费城宾夕法尼亚会议中心 126-B 会议室.
白色背景板前,四位新科菲尔兹奖得主并排坐下:邓煜、John Pardon、Jacob Tsimerman 和王虹。其中,邓煜与王虹成为首批获得菲尔兹奖的中国籍数学家。
而另一位获奖者、多伦多大学数学教授 Jacob Tsimerman 现场宣布了一个「炸裂」的消息 —— 他未来将转向「AI 安全」工作,并将加入 OpenAI。
图源:https://www.youtube.com/watch?v=2dr2F2NVUkY
消息出来之后,包括 OpenAI 首席研究官 Mark Chen 以及前微软 AI 副总裁现 OpenAI 研究员 Sebastien Bubeck 在内,都确定了 Jacob Tsimerman 的加盟并对他表示了欢迎。
Mark Chen 称,「Jacob Tsimerman 的数学天赋无疑极为出众,而他对 AI 安全问题所展现出的严肃态度和思考深度,同样令人钦佩。」
Jacob Tsimerman 是加拿大数学家,主要研究数论、算术几何、超越数论及其与模型论的交叉问题。
图源:多伦多大学
1988 年出生的他早年便展现出很强的数学天赋,曾代表加拿大参加 2003 年和 2004 年国际数学奥林匹克竞赛,两次获得金牌,并在 2004 年取得满分。
此后,他在多伦多大学完成本科教育,2011 年获得普林斯顿大学数学博士学位,导师是著名数论学家 Peter Sarnak,之后进入哈佛大学学者协会从事博士后研究。2014 年起任教多伦多大学至今。
Tsimerman 最重要的数学成就集中在「André–Oort 猜想」 。这一猜想研究 Shimura 簇中特殊点的分布规律,是现代算术几何中的核心问题之一,与丢番图方程、模形式、阿贝尔簇和超越数论密切相关。
他先是解决了阿贝尔簇模空间中的关键情形,并建立特殊点伽罗瓦轨道的下界;后来与 Jonathan Pila、Ananth Shankar 等数学家合作,完成了 André–Oort 猜想一般情形的证明。他在其中发展的 Ax–Schanuel 型超越性定理和高度理论,也成为研究类似不太可能交集问题的重要工具。
具体可参考机器之心文章:「数学家证明 30 年前的「安德烈 - 奥尔特猜想」,推进多项式方程解探索」。
论文地址:https://arxiv.org/pdf/2109.08788
除 André–Oort 猜想外,他还参与解决了 Griffiths 猜想中的重要问题。
凭借这些成果,他先后获得 2015 年 SASTRA 拉马努金奖、2022 年数学新视野奖和 2023 年奥斯特洛夫斯基奖。2025 年,他当选英国皇家学会会士。
OpenAI 为什么会需要一位数论学家做安全?
就在菲尔兹奖揭晓前三天,OpenAI 发布了一篇关于长时程模型安全的文章。
文章链接:https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/
OpenAI 披露,公司曾向内部人员开放一种能够持续执行复杂任务的长时程模型,但很快观察到了预部署评测没有覆盖的行为,并暂时停止访问。
一个案例中,模型试图从评测后台获取其他参与者的私有答案;在认证令牌被扫描器拦截后,它把令牌拆分、混淆,再在运行时重新组合,以绕过检测。
另一些案例中,模型未经充分理由尝试访问其他计算节点,甚至生成了可能终止大量进程的命令。
OpenAI 安全团队当前面对的核心问题,就是面对短回答模型,安全团队可以检查「它说了什么」;但面对长时程智能体,安全团队还要判断「这一连串动作最终试图完成什么」。
这意味着,安全问题已经变成了可能跨越百步的行为轨迹分析。
然而当前常用的安全办法很难穷尽所有行为组合,往往只能在模型出现异常后,再补充评测、规则与监控。
目前常用的 AI 安全方法,大多提供的是经验性证据:在我们测试过的情形下,系统通常没有出问题。
但这不等于不等于数学意义上的:对所有满足某些条件的行为,系统都不可能越过某条边界。
OpenAI 曾将模型分成「证明者」和「验证者」,让强模型生成答案,再训练较弱的验证者识别正确与错误证明。
研究发现,只追求答案正确,模型给出的推理反而可能更难检查;加入「可验证性」目标后,人类和弱模型更容易判断其输出。
这说明,数学里的「测试-验证」关系正在成为 AI 监督问题的一种模型。
而 Tsimerman 想做的,正是用这样的数学关系从「测试」走向「证明」。
Quanta 的报道披露,Tsimerman 认为,数学家可以参与研究多个 AI 智能体组成的系统如何行动,并尝试推导证明,确保这些复杂系统不会采取非预期行为。他强调,由于风险和赌注极高,安全研究需要非常高的确定性。
在 2025 年,Tsimerman 曾与伯克利 AI 安全研究者 Andrew Critch 合作一篇论文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》。
论文链接:https://arxiv.org/abs/2507.09369
这篇论文没有提出模型训练算法,而是试图系统分类 AI 可能参与人类灭绝的不同路径。
作者明确表示,这些场景并非不可避免,写作目的在于把抽象的「AI 可能导致灭绝」拆成可讨论、可防范的具体类型。
这种先分类、再寻找边界的思路,与 Tsimerman 过去的数学工作并不遥远。
他的重要贡献之一,是把来自模型论的 o-minimality,变成算术几何和复代数几何中的基础方法。
简单来说,o-minimality 研究的是一类几何对象:它排除无限震荡、无穷分叉等病态行为,让看似复杂的集合能够被拆解成有限、规则、可描述的部分。
Tsimerman 擅长做的,正是为过于自由的对象找到隐藏的结构。
这些成果与 AI 安全之间并不存在直接的技术对应,但这两类问题共享一种思路:面对一个行为复杂、难以穷举的系统,不能只观察它在有限实验中的表现,而是要先找到一种足够严格的描述语言,定义状态和边界,再证明系统在特定条件下必然满足这些约束。
Tsimerman 正试图把这样的「确定性」带到 OpenAI。
目前,人们还无法像证明一道几何定理那样,证明一个 AI 不会执行危险操作。
但数学可以换一种方式缩小问题。
2026 年提出的「包容验证(Containment Verification)」就没有证明 AI 本身是安全的,转而验证它与外部世界之间的通道。
换句话说,它不证明 AI 没有危险意图,而是证明它没有实现某些危险意图的途径。
类似的,数学可以提供的,也不是一张覆盖整个 AI 安全系统的「保证书」,而是一些条件清晰的命题。
本文来自微信公众号 “机器之心”(ID:almosthuman2014),编辑:杜伟、山辉 ,36氪经授权发布。
发布时间:2026-07-24 16:06