金融AI智能体设计与应用 · 第 4 次课 · 晚上 01 — 23
序 · 开场 中山大学岭南学院 · 张一帆
+ +
01序 · 开场
金融硕士选修课 · 第 4 次课 · 晚上 · 2026-10-10 · 东2-304

AI 与
工作效率

晚上 · 先聊 AI 与工作效率,再听个人作业一的论文复现汇报
张一帆
中山大学岭南学院 · 金融 AI 智能体设计与应用
AI岭南学院
I10 月 6 日 · OpenAI 公开数学手稿

一个仓库,七百二十二篇数学手稿

722篇
手稿,OpenAI 内部模型做出来的
372个族
一个族里有主结果、配套论证、推论
563篇
日期落在 9 月 23 日到 27 日这五天
openai/math 仓库 README 的截图,Navigating the collection 一节写着 The current catalogue contains 722 manuscripts organized into 372 families
没经过同行评审,也没投 arXiv,直接放在 OpenAI 自己的 GitHub 仓库。每个结果平均用掉约 3 小时 ChatGPT Pro 的思考算力。照 arXiv 每人每月 2 篇的限额,一个人得传 30 年。
github.com/openai/math · 数字生命卡兹克
I前情 · 2026 年 5 月到 10 月

七百多篇之前,已经吵了两个月

8 月 1 日
十项数学进展

附 Lean 证明,token 花费约 2,000 美元。两项被批没正确引用前人工作。

9 月 8 日
千禧年难题

OpenAI 称约一万个智能体跑 88 小时,解出带外力的 Navier–Stokes 问题。

9 月 11 日
菲尔兹奖得主联署

25 位首批签名,宣言题为《AI 在数学中的严重错位》。

10 月 1 日
arXiv 收紧限流

每位投稿人每月最多投 2 篇。

10 月 6 日
公开 openai/math

722 篇手稿一次放出来。

OpenAI 公布的数学结果五个月,翻了两个数量级
5 月
1 项
8 月
10 项
9 月 · OpenAI 自称
100 多项
10 月
372 组
数学家怎么看,分支持和质疑两边听。
OpenAI 官网 ·《科学美国人》· mathandai.org · arXiv 博客
I支持的声音

支持的一方,答案公开是好事

Daniel Litt多伦多大学数学家
I see no reason why we should ask the company to keep them secret from us. To me, it's going to be a good thing for mathematics.
我看不出有什么理由让这家公司瞒着答案。在我看来,这对数学是好事。
《科学美国人》采访
Timothy Gowers菲尔兹奖得主,OpenAI 数学顾问组成员
a flood of 'big' AI results would be likely to increase the amount ... that was not properly digested, it would also be likely to increase the amount that was properly digested, which seems like a pretty good bargain.
大批 AI 成果涌进来,没消化好的会变多,消化好的也会变多,算笔划算的买卖。
个人博客
Jeremy Avigad卡内基梅隆大学,做 Lean 形式化
engaging with new technologies and learning how to use them ... will keep the discipline strong.
接触新技术,学会怎么用它们,会让这门学科保持强健。
陶哲轩博客客座文章
I质疑的声音

质疑的一方,担心没人真看懂

陶哲轩UCLA,菲尔兹奖得主
open problems in pure mathematics ... are being mined as a non-renewable resource
纯数学里的开放问题,正被当成不可再生资源开采。
Mathstodon
菲尔兹奖得主联署宣言25 位首批签名
solving problems is only a tool and proxy for achieving the primary goal of conceptual understanding and insight.
解题只是达成首要目标的工具和代理指标,首要目标是概念上的理解和洞见。
联署宣言原文
Andrew SutherlandMIT 数学家
Until and unless they release the model and people can replicate their results, I think you should treat any claims about one-shotting problems with a single agent as unverified.
在他们公开模型、别人能复现结果之前,说单个智能体一次就解出来的那些说法,都该当作没核实过。
《科学美国人》采访
Thomas Bloomerdosproblems.com 创办人
If you have a proof (AI-created or otherwise) then you should take time to carefully write up the proof yourself
你有一个证明,不管是不是 AI 做的,都该花时间自己把它认真写出来。
陶哲轩博客转载
I10 月 6 日 · 陶哲轩转发的一则恶搞

只有结局的电影

手绘示意图。小放映厅的银幕上只放着一部电影的最后一个镜头,角落写着剧终;银幕前一排观众表情茫然;左侧地上一长卷胶片,前面的格子几乎全是空白,只有最后几格有画面;右侧墙边堆着几百个片盒
陶哲轩在 Mathstodon 的帖子截图,转发一则恶搞标题 OpenAI Releases the Final Ten Minutes of 500 Previously Unreleased Films, Ushering in a New Era of Movie Watching
标题译文OpenAI 发布 500 部未上映电影的最后十分钟,开启观影新时代
the model might give them a beautiful explanation, but we all know that's not enough; no one can understand mathematics for us.
模型也许能给出漂亮的解释,可我们都知道这不够。没人能替我们理解数学。
Daniel Litt
陶哲轩 Mathstodon · Daniel Litt 博客
I学习 · 两项随机实验

用 AI 做完了,学会的反而少

Bastani 等 · PNAS · 2025

土耳其一所高中,近 1,000 名学生练数学

+48%
练习课成绩,放开用 GPT-4
−17%
之后闭卷考试,比没用的同学

加了护栏的一组,考试没变差也没变好,学生却以为考得好得多。

Shen 与 Tamkin · Anthropic · 2026

52 名工程师,学一个没用过的 Python 库

50%
用 AI 的一组,测验平均分
67%
自己手写的一组

用 AI 的只快了约两分钟,差别不显著。差得最多的是调试题。

It's now possible to produce a PhD thesis one hasn't even read
Daniel Litt 说,现在一个人能交出一篇自己都没读过的博士论文。
I工作 · 一段视频,一场圆桌

省下的时间,去哪了

播放 00:56–01:53

AI 提升效率,但衡量成功的标准却没有改变

詹青云,律师

从前……要求初入职的律师每年要工作两千个计费工时,现在用了 AI 以后,我们的律师每年只需要工作五百个小时吗?

行业内会觉得这个律所濒临倒闭。

人衡量成功、衡量成果、衡量效率的方式没有改变。

腾讯研究院圆桌 · 2026-09-14 · 厦门

杨洪进 · 蝉妈妈联合创始人

个人的效率变高了,但组织的效率可能并没有变高。

AI 对个人提效,不少岗位能有 10 倍以上……AI 对组织提效,做到 2-3 倍就已经很厉害了。

AI 是否真的让利润变高了?视频做得更多,流量有没有更多?

省下的时间,组织拿去换更多产出。衡量成功的指标没变,人就不会更轻松。
I谁来核

产得越快,核的人越要紧

arXiv 每年 9 月新投稿
9,869
20,569
40,363
201620242026
2026 年 9 月还带来近 9,000 张支持工单。
10 月起每人每月最多投 2 篇。

裁判有多贵

数学Lean 核一遍几秒钟
化学实验室合成、测试几周到几个月
新药临床试验常要十年

裁判越便宜的学科,越先被 AI 提速。

Lean 核得了证明,核不了题目

Lean 是检查数学证明的软件,能一步步核推导有没有错,题目问得对不对它判断不了。OpenAI 的 Navier–Stokes 结果给方程加了一个专门设计的外力,按千禧年大奖的官方题面算是解出来了。数学家说,大家真正关心的那道题还没解决。

机器把核对做得又快又便宜,问的是不是那道题,还得人来判断。
生成越来越便宜。最慢的是现实里的实验,和人的核对、理解。
arXiv 博客 · 数字生命卡兹克 ·《科学美国人》
I经济学 · 苏黎世大学 Project APE

经济学也来了

Claude Code 驱动的智能体自己挑政策、拉公开数据、跑回归、写成论文,中间没人插手。

1,000篇
2026 年 1 月到 4 月
约 2/3
用 DiD,其次是 RDD
和 AER、AEJ: Policy 的 43 篇论文一对一比Gemini 读全文判胜负
AI 胜 4.5%321 场平局 967 场人胜 5,814 场

最弱的是识别假设

标准流程都走完,event study 图画了,平行趋势检验的 p 值也报了。这次政策变化凭什么算可信的自然实验,论证往往很表面。

AI and Economics 公众号

项目回头查错

让 AI 核查员把 1,000 篇查了一遍。抽 100 篇请人复核,报出的问题 97% 属实。按核查员的报告,每一篇都有错误或缺陷。

同一年,一位教授

芝加哥大学布斯商学院的统计学家 Polson,九个月挂出两百多篇论文。SSRN 撤下他 257 篇,冻结了上传账号。

经济学的裁判是数据和别人的复现。今晚的复现汇报,练的就是当这个裁判。
ape.socialcatalystlab.org ·《华盛顿邮报》
I回到今晚的复现汇报

回到今晚,复现就是核验

数学家和经济学家核 AI你核一篇论文
题目是不是原来那道Navier–Stokes 多出来的那个外力
→
复现的是不是论文那张表样本、变量口径和原文对得上吗
别人能不能重跑一遍Sutherland 要 OpenAI 先公开模型
APE 的裁判只读 PDF,不跑代码
→
换一台电脑跑得出来吗数据从哪来,代码和材料齐不齐
为什么可信,讲没讲清评论者说 APE 论文最弱的是识别论证
Bloom 要证明的人自己写出来
→
你自己讲得清吗哪一格对不上、为什么,哪几步是 AI 定的,哪几步是你定的
AI 产得越快,能把结论从数据走一遍、说清哪里对不上的人越要紧。
II个人作业一 · 论文复现汇报

上台讲你怎么复现的

01
挑了哪篇

哪本期刊、哪一年,为什么挑它

02
数据从哪来

怎么拿到的,和论文用的是不是同一份

03
复现了哪几样

哪几张表、哪几列,和原文放在一起对

04
对不上的是哪一格

差多少,你查到的原因是什么

05
哪几步是谁定的

哪几步是 AI 定的,哪几步是你定的

06
跑不通的照实说

卡在哪一步,试过什么办法

每人 10 分钟,含提问。论文本身少讲,讲你怎么核的。
II课后

回去交材料,装 Playwright

  1. 01

    交小组进度汇报材料

    10 月 13 日 23:59 前交到作业平台,限 3 页。

  2. 02

    装好 Playwright MCP

    注册时带上 -s user。命令在下次课的学员实操页。