微积分,原来如此
目录

第一性原理 · 苏格拉底提问 · 黄金圈 · 类比

微积分,
原来如此

三个动作:放大、切碎、再加起来

从速度表上的一个数字讲起,用第一性原理看懂变化的数学。
一瞬间走了 0 米、用了 0 秒,速度表凭什么显示 72?

读完你将能
  1. 用一句话说清微积分在解决什么问题,以及它为什么被“发明了两次”;
  2. 讲清牛顿与莱布尼茨之争的来龙去脉、真相与结局;
  3. 亲手推出导数、积分与微积分基本定理,掌握大一微积分的核心工具;
  4. 看懂天气预报、复利、药物剂量、火箭方程背后的同一套思想;
  5. 用“放大—切碎—累加”的眼光重新审视日常判断。

预计阅读时长约 2.5 小时 · 从问题链开始 ↓

微积分显微镜拖动三个滑块
0123456123xy放大 ×8x₀
切线斜率(导数)−0.69
细条总面积(积分)7.099
此刻高度 f(x₀)1.54

放大越多,镜中曲线越像那条红色切线;细条越多,总面积越接近真值。再留意:面积此刻增长的速度,正好等于曲线此刻的高度——这是全书的高潮,第 8 章揭晓。

0Prologue · A speedometer and two young minds

速度表上的 72,与两个年轻人

“一瞬间有多快”这个问题,为什么值得发明一门新数学?

0.1速度表上的 72

你坐在车里,看一眼仪表盘,速度表的指针稳稳地指着 72 公里/小时。你每天都看它,从没怀疑过。

现在,我们只追问一个词:它显示的是此刻的速度。

速度是怎么算的?

路程除以时间。一小时走 72 公里,就是时速 72 公里。

那“此刻”这一瞬间,车走了多远?

一瞬间……没有时间流逝,也就没走任何距离。0 米。

用了多少时间?

0 秒。

那么速度 = 0 米 ÷ 0 秒 = ?

0 ÷ 0。这不是一个数,小学老师说过,除数不能是 0。

可指针明明指着 72,你也确实在以这个速度前进。一瞬间的速度,到底存不存在?它又该怎么算?

这不是抬杠。两千四百年前,古希腊的芝诺就提出过同样的难题:一支飞行的箭,在每一个瞬间都占据一个确定的位置,在那一瞬间它是静止的;既然每一瞬间都静止,箭怎么会飞起来?

这个问题困住了人类将近两千年。解开它的,是两个年轻人。

0.2两个年轻人,同一个答案

1665 年,剑桥大学因疫情停课,二十出头的艾萨克·牛顿回到林肯郡伍尔索普的农庄。没有老师,没有同学,他在一年多里独自想清楚了三件事:光的颜色从何而来、天体为何这样运动,以及一种计算“变化”的新方法。他从运动出发,把一切量都想象成随时间流动的东西,称这种方法为“流数术”。

1672 年,二十六岁的戈特弗里德·莱布尼茨以外交官身份来到巴黎。他学的是法律和哲学,数学几乎是门外汉。荷兰物理学家惠更斯成了他的数学导师。仅仅三年后,1675 年 10 月 29 日,他在手稿里写下了一个拉长的 S——∫(中文读“积分号”,英文读 integral /ˈɪntɪɡrəl/),意思是“总和”;几周后又写下了表示“差”的 d(就读字母 d,英文 /diː/)。他从数列的求和与求差出发,走到了和牛顿同一个地方。

牛顿1665–1666英格兰乡间 · 二十出头从“运动”出发量随时间流动记号ẋ莱布尼茨1672–1675巴黎 · 数学新手起步从“数列”出发求和与求差记号dy/dx ∫同一个答案求导 ⇄ 积分 互为逆运算

图 0-1一个在英格兰乡间,从运动出发;一个在巴黎,从数列出发。两人互不相识,走了两条完全不同的路,却抵达了同一个答案:变化率与总量是一对互逆的运算。

先下个注:今天全世界的微积分课本,用的是谁的符号?是先想到的牛顿,还是三年前才开始学数学的莱布尼茨?

是莱布尼茨的。今天任何一本教科书里的 dy/dx(读作“d y 比 d x”,英文 dee-y dee-x /diː waɪ diː ɛks/)和积分号 ∫,都出自他的手稿。牛顿的记号(在字母头上加一点表示变化率)只在物理学里表示“对时间求导”时还留着一席之地。

原因不在于谁更聪明,而在于莱布尼茨把大量心思花在“让符号替人思考”上:他的记号写起来顺手,推导时甚至能像分数一样约分。一个好的符号,能让后来的千千万万人更轻松地思考。第 2 章会讲这段历史的全貌,包括两人后来那场著名的“谁先发明”之争。

一个从农庄的独处里走出来,一个从数学门外汉起步;一个重视运动的直觉,一个重视符号的力量。他们都回答了芝诺的难题,让“一瞬间的速度”变得既有意义、又能计算。这就是微积分的一半。

另一半,藏在你车上另一块仪表——里程表里。第 1 章会把这两半摆在一起。

微积分是
  • 一种处理“不断变化的量”的思考方法
  • 回答两个问题:此刻变得多快?一共变了多少?
  • 天气预报、药物剂量、火箭轨道的共同语言
微积分不是
  • 一堆需要死记的公式和符号
  • 只有数学家才用得上的屠龙之术
  • 必须先懂很多高深数学才能入门的东西(你只需要会四则运算、见过坐标系)

莱布尼茨的故事还说明了一件事:从零开始学微积分,并不需要天赋异禀。他用三年从门外汉走到了前沿;你只需要按顺序搭好几块积木,就能看懂他当年写下的那两个符号。

0.3这本书怎么走

很多人害怕微积分,并不是因为它难,而是因为课本从定义开始,从不先说“为什么”。本书反过来:先讲为什么,再讲怎么做,最后讲它是什么、能做什么。这是黄金圈的顺序。

Why序章 · 第 1 章 · 第 2 章为什么需要它,它从哪里来3函数与变化率4极限5导数6导数的用途7积分8基本定理9积分工具与应用10微分方程与 e11级数12多元微积分How一级一块积木红:变化率绿:累积紫:更远处What第 13 章 · 尾章真实世界与微积分思维

图 0-2本书地图。底部是 Why:它解决什么问题、从哪里来;中间是 How:从函数到多元微积分,每章只放一块积木,上一块托住下一块;顶部是 What:它在真实世界做了什么,以及它怎样改变你的思考方式。

整本书只围绕三个动作、三句话展开。现在你不必懂,读完时你会发现自己能把它们推导出来:

放大看,曲线就变直。
切成碎片,再加起来。
变化率与总量,是同一件事的两面。

阅读时,你会反复遇到几种小标记:

  • 问 / 答:苏格拉底式的对话。试着先自己回答“问”,再看“答”。
  • 停一下:一个值得思考片刻的问题,答案折叠着。先想,再展开。
  • 类比:用生活里的东西给新概念一个轮廓;紧跟着的“是 / 不是”会告诉你类比在哪里失效。
  • 符号卡:每个希腊字母或数学符号第一次出现时,都会有一张紫色边框的小卡片,告诉你它怎么读(附音标)、从哪里来、为什么选它。尾章还附有全书符号读音表。本书的读音按国内课堂通行的英文读法给出,并附中文近似读音。
  • 出处:书中的史实、数据和符号来历,都已联网逐条核查,结论与出处列在书末附录《事实核查与出处》里。
  • 伏笔:第 1 章会在你的日常生活里埋下六个问题——天气预报、地下勘测、存款利息、吃药、仓库进货、火箭发射。它们会在学到对应工具的章节里被部分回收,在第 13 章全部揭晓。
本章带走

“一瞬间有多快”看似是 0 ÷ 0,却真实存在;为了算出它,人类发明了微积分。

  • 速度表上的 72 隐含一个悖论:一瞬间走 0 米、用 0 秒,0 ÷ 0 没有意义。
  • 牛顿从运动出发,莱布尼茨从数列出发,两人各自找到了答案。
  • 今天全世界使用莱布尼茨的符号:好的符号让更多人能够思考。

于是,下一个问题他们发明的这门学问,到底解决了什么问题?

1Chapter 1 · Two old questions

两个古老的问题

微积分到底在解决什么问题?

上一章留下的问题:他们发明的这门学问,到底解决了什么问题?

课本通常这样开头:“设函数 f(x) 在点 x₀ 的某邻域内有定义……”读到这里,大多数人已经合上了书。

本章换一种开法:先不碰任何公式,而是跟你过一天普通的日子。你会发现,微积分要解决的问题,你每天都在遇到,只是从来没有人告诉你它们叫这个名字。

1.1你的一天里藏着微积分

下面六个场景,每一个都藏着一个你也许从没认真想过的问题。现在只提问,不作答。请把它们记在心里——它们是本书埋下的六个伏笔,会在后面的章节里一个一个被揭开。

07:30 出门前看天气

手机上写着:“下午 3 点降水概率 70%,气温 26°C。”

明天的天空还没有发生,计算机凭什么把它算出来?

第 10 章回收一半 · 第 13 章揭晓

08:10 地铁穿过城市地下

隧道要避开流沙和溶洞,高楼的桩基要打到坚硬的岩层上,石油公司要在几千米深处找到油层。可是没有人能钻进地下看一眼。

看不见地下,怎样知道几公里深处是什么?

第 9、10 章回收一半 · 第 13 章揭晓

12:00 午休时看一眼银行 App

理财产品写着“年化 3%,按日计息”。你想:按月计息比按年多一点,按日又比按月多一点。

如果把计息拆得无限细——每小时、每秒、每一瞬间——钱会不会变得无限多?

第 10 章回收 · 第 13 章揭晓

13:00 饭后吃药

药盒上写着“一日三次,每次一片”。

为什么是分三次,而不是早上一次吃三片?天天吃,药会不会在身体里越积越多?

第 10、11 章回收一半 · 第 13 章揭晓

18:30 外卖与快递

你点的东西半小时就到了,因为附近的仓库早就备好了货。仓库经理每周都在纠结:一次进货太多,压钱、占地方;进得太少,就要频繁补货,每次补货都有运费和人工。

一次进多少货最划算?这个“最划算”的点在哪里?

第 6 章回收 · 第 13 章揭晓

21:00 新闻里的火箭发射

火箭升空,一边加速,一边把燃料烧掉喷出去,自己越来越轻。

一枚火箭装多少燃料,最后才能跑到足够快、进入太空?

第 9 章回收一半 · 第 13 章揭晓

六个场景横跨气象、地质、金融、医药、物流和航天,看起来毫不相干。本章结束时你会看到:它们问的其实只有两类问题。而这两类问题,就藏在你汽车的仪表盘上。

1.2仪表盘上的两个问题

汽车仪表盘上有两块最重要的表。

02040608010012072 km/h速度表:此刻多快?变化率 → 导数012847公里里程表:一共多远?累积 → 积分

图 1-1速度表回答“此刻多快”,里程表回答“一共多远”。前者是变化率问题,后者是累积问题。微积分的两半,分别对应这两块表。

第一块,速度表,回答的是“此刻有多快”。它关心的是一个量变化的快慢,我们叫它变化率。

第二块,里程表,回答的是“到现在一共走了多远”。它关心的是一个量一点一点攒起来的总和,我们叫它累积。

这两个问题听起来很简单。它们难在哪里?

如果你以每小时 60 公里的速度,一直匀速开 2 小时,走了多远?

60 × 2 = 120 公里。小学算术。

反过来,2 小时走了 120 公里,速度是多少?

120 ÷ 2 = 60。也是小学算术。

现在真实一点:你在城里开车,红灯停、绿灯走、上高架加速、下匝道减速,速度每一秒都在变。开了 2 小时,你能用乘法算出走了多远吗?

不能。“速度 × 时间”里的速度,该取哪个值?每一刻都不一样。

那速度表怎么知道“此刻”是多快?用路程除以时间吗?

这就回到序章的速度表了:一瞬间走 0 米、用 0 秒,0 ÷ 0 没有意义。

1.3第一性原理:麻烦只来自“不均匀”

我们用第一性原理,把问题拆到最朴素的地方:麻烦到底来自哪里?

不是来自数字太大,也不是来自公式太复杂。麻烦只来自一件事:变化不均匀。

  • 速度不变时,“路程 = 速度 × 时间”,一步到位。
  • 水龙头流量不变时,“水量 = 流量 × 时间”,一步到位。
  • 利率不变、只算一次时,“利息 = 本金 × 利率”,一步到位。

只要世界是均匀的,乘法和除法就够了。可是真实世界几乎从不均匀:车速在变,气温在变,血液里的药物浓度在变,火箭的质量在变。

于是,微积分的全部策略可以浓缩成一句话:既然整体不均匀,那就把它切到足够小,小到每一小块里几乎是均匀的;在每一小块里用小学算术,再把结果拼起来。

“切小”有两种用法,正好对应两块表。

1.4第一个动作:放大

先看速度表的问题:此刻有多快。

把汽车的“位置随时间变化”画成一条曲线。车速在变,所以这条线是弯的。弯线没有统一的“坡度”,所以说不出一个统一的速度。

但如果我们拿一台显微镜,对准曲线上的某一点,不断放大,会发生什么?

原图放大 ×4放大 ×32黑:曲线 红虚线:切线 越放大,两者越分不开

图 1-2同一条曲线,原图里弯得厉害;放大 4 倍还看得出弯;放大 32 倍,它和那条红色虚线(切线)已经分不开了。光滑的曲线,放大到足够细,局部就是一条直线。

放得越大,曲线越直。放到足够大时,它在那一小段上就是一条直线。而直线的坡度,一除就有。

这就是导数的思想:一瞬间的变化率,就是把曲线放大到变成直线之后,那条直线的坡度。本书把这条放大后的直线叫作切线。

类比

地球是圆的,但你家门口那条路看起来是平的。原因不是地球不圆,而是你站得太近——你看到的只是巨大球面上极小的一块,而足够小的一块弯曲表面,几乎就是平面。几千年来,人们在“平地”上盖房子、修路、测量土地,靠的就是这一点。

这个类比说明了
  • 弯曲的东西,局部可以当成平直的来处理
  • 看得越局部,“当成直的”误差越小
这个类比没说明
  • 放大到底要放多大才算“足够”——这要等第 4 章的“极限”来回答
  • 有尖角的曲线(比如 V 字形的尖)无论放多大都不会变直,那里没有切线
放大看,曲线就变直。

1.5第二个动作:切碎,再加起来

再看里程表的问题:一共走了多远。

速度一直在变,没法用一个乘法算完。但我们可以把 2 小时切成很多小段,比如每段 1 秒。在 1 秒之内,车速几乎不变,于是这 1 秒走的路 ≈ 这 1 秒的速度 × 1 秒。把 7200 个小段的结果加起来,就是总路程。

画在图上,这件事有一个清楚的样子:把速度画成曲线,总路程就是曲线下面那块面积。切碎,就是把这块面积切成细长条。

05x切成 6 条05x切成 30 条每条都当作“高度不变”的长方形;切得越细,这个近似就越准

图 1-3曲线下的面积切成 6 条时,长方形的顶和曲线差得明显;切成 30 条,锯齿几乎贴住了曲线。每一条都被当作“高度不变”的长方形,这正是把不均匀切成局部均匀。

切得越细,每一条越接近“高度不变”,拼起来的总和就越接近真实答案。这就是积分的思想:一个不均匀变化的总量,就是把它切成无数小块,每块用乘法,再全部加起来。

类比

电表就是这样算电费的。你家的用电功率一直在变:开空调时高,半夜时低。电表并不需要知道“平均功率”,它只是在每个很短的时间里记下“此刻功率 × 这一小段时间”,然后一直往上加。月底你看到的“度数”,就是一整个月切碎再加起来的结果。

切成碎片,再加起来。
“放大”和“切碎”,本质上是不是同一招?它们的区别在哪里?

底层是同一招:把不均匀的东西切到足够小,让每一小块近似均匀。区别在于切完之后做什么。

“放大”只盯着一小块,问它的坡度是多少,得到的是某一刻的变化率。

“切碎再加起来”要用上所有小块,把它们的贡献全部加总,得到的是一段时间里的累积。

1.6两块表之间的秘密

到这里,微积分似乎是两门独立的手艺:一门叫“微分”,负责放大看变化率;一门叫“积分”,负责切碎求总和。古希腊人和中国古代数学家其实早就会一些“切碎求面积”的技巧,而“求切线”的技巧在 17 世纪上半叶也已零星出现。

那么,牛顿和莱布尼茨到底发明了什么,值得争得你死我活?

看着仪表盘想一想:速度表的读数和里程表的读数之间,有没有关系?

有,而且非常紧密:里程表的数字跳得多快,就是速度表指的数。速度表指 72,意味着里程表正以每小时 72 公里的速度往上跳。

反过来,如果你从头到尾记录下速度表的每一刻读数,就能推出里程表最后会停在哪里。

换句话说,变化率和累积不是两件事,而是同一件事的两面。牛顿和莱布尼茨各自看清了这一点,并把它变成一套人人可用的算法。这就是第 8 章的主角——微积分基本定理。

变化率与总量,是同一件事的两面。

1.7回看六个伏笔

有了这两块表,我们回头给早上的六个问题归个类。

表 1-1 六个伏笔各属于哪一类问题
伏笔场景核心问题类型回收章节
A天气预报已知空气每一刻怎样变化,推出明天的天空变化率 → 累积第 10、13 章
B地下勘测从地面上测到的信号,反推地下的结构与年代两者兼有第 9、10、13 章
C存款利息利息拆得无限细,钱会累积到多少累积第 10、13 章
D一日三次吃药药物每一刻被代谢多少,体内一共剩多少两者兼有第 10、11、13 章
E仓库进货成本随进货量怎样变化,最低点在哪变化率第 6、13 章
F火箭发射一路减重、一路加速,最后速度累积到多少累积第 9、13 章

你会注意到,最有用的问题往往两类兼有:我们知道的是“每一刻怎样变”,想知道的是“最后会怎样”。天气预报就是典型:物理定律告诉我们空气在每一刻怎样流动、怎样升温,我们要的却是明天下午的天空。要从前者走到后者,必须同时用上放大和累加。这正是微积分被发明出来的原因。

所以,微积分是
  • 研究“变化”的数学:变得多快(微分),攒了多少(积分)
  • 一套把不均匀切成局部均匀、再用算术处理的方法
微积分不是
  • 另一种更难的算术:它的每一小步都只是乘除加减
  • 只处理曲线和面积的几何学:曲线和面积只是“变化”的画像
本章带走

微积分只回答两个问题:此刻变得多快?一共变了多少?

  • 变化均匀时,小学算术就够;麻烦只来自不均匀。
  • 放大:光滑曲线放大到足够细就是直线,它的坡度就是瞬时变化率(导数)。
  • 切碎再加起来:把总量切成近似均匀的小块,逐块相乘再求和(积分)。
  • 两者是同一件事的两面:里程表跳动的速度,就是速度表的读数。
  • 六个日常伏笔,都是这两类问题或它们的组合。

于是,下一个问题这两个问题困扰了人类两千年。是谁、又是怎样一步步逼近答案的?

2Chapter 2 · The calculus wars

微积分恩仇录

微积分从何而来?牛顿与莱布尼茨之争的真相与结局是什么?

上一章留下的问题:这两个问题困扰了人类两千年。是谁、又是怎样一步步逼近答案的?

说“牛顿和莱布尼茨发明了微积分”,就像说“某某人发明了汽车”——没错,但漏掉了两千年的接力。本章先讲接力,再讲那场争吵:它为什么爆发、怎样收场、真相是什么,以及它留给后人的代价。

2.1第一棒:芝诺的难题,阿基米德的切片

公元前 5 世纪,古希腊哲学家芝诺提出了几个让人头疼的悖论。最有名的一个是“阿基里斯追乌龟”:飞毛腿阿基里斯让乌龟先跑 100 米。他跑完这 100 米时,乌龟又往前爬了一点;他追上这一点时,乌龟又往前爬了一点……如此无穷无尽,他似乎永远追不上。

谁都知道阿基里斯能追上,可说不清错在哪里。芝诺真正的问题是:无穷多段路程加起来,能不能是一个有限的数?这个问题要等到第 4 章才能被干净利落地回答。

比芝诺晚两百年的阿基米德没有纠缠哲学,而是动手去算。他想求抛物线围成的一块弓形面积,办法是往里面塞三角形:先塞一个大的,再在两边的缝隙里各塞一个小的,再往更小的缝隙里塞更小的……每一轮三角形的总面积是上一轮的 1/4。他证明了:这块弓形的面积,恰好是第一个三角形的 4/3。

他用同样的思路,拿正 96 边形去夹住圆,算出圆周率在 223/71 与 22/7 之间,也就是 3.1408 到 3.1429 之间。这种“用越来越细的已知图形去逼近未知图形”的方法,后人叫它穷竭法。它已经是切碎再加起来的雏形了。

πpi · 希腊字母第 16 个

怎么读:英文读 pi /paɪ/,中文近似“派”。(它在希腊语里读作 /pi/,类似“皮”;国内课堂一般用英文读法。)

从哪来:一般认为取自希腊语 περιφέρεια(periphery,“周长、圆周”)的首字母,也有说法认为取自 περίμετρος(周长);琼斯本人没有说明。1706 年英国数学家威廉·琼斯第一次单用 π 表示圆周率,但当时没人跟进;欧拉 1736 年在《力学》中用它,1748 年的《无穷分析引论》让它普及开来,才成为全世界的标准。

为什么选它:它是“圆周”这个词的第一个字母,而这个比值正是圆周与直径之比。阿基米德和刘徽的年代还没有这个符号,他们用文字描述这个数。

2.2东方的一棒:刘徽割圆,祖暅求积

公元 263 年,魏晋数学家刘徽为《九章算术》作注。为了求圆的面积和周长,他从圆内接正六边形开始,把边数一次次翻倍:12、24、48、96……他写下了一段后来常被引用的话:

割之弥细,所失弥少;割之又割,以至于不可割,则与圆周合体而无所失矣。——刘徽《九章算术注》

翻译成白话:切得越细,损失越少;一直切到不能再切,多边形就和圆合为一体,一点也不差了。这句话几乎就是“极限”思想的文学版。

正 6 边形周长 ÷ 直径 ≈ 3.0000正 12 边形周长 ÷ 直径 ≈ 3.1058正 24 边形周长 ÷ 直径 ≈ 3.1326

图 2-1刘徽割圆术。边数每翻一倍,多边形与圆之间的绿色缝隙就大幅缩小,“周长 ÷ 直径”一步步逼近 π。两百年后,祖冲之把 π 算到了 3.1415926 与 3.1415927 之间。

又过了约两百年,祖冲之的儿子祖暅提出“幂势既同,则积不容异”:两个立体如果在每一个高度上的截面面积都相等,它们的体积就相等。这正是把立体切成无数薄片来比较体积。欧洲人直到 17 世纪才由意大利人卡瓦列里重新提出同样的原理。

2.317 世纪的前夜:万事俱备

既然古人早有切片思想,为什么微积分直到 17 世纪才诞生?

阿基米德和刘徽的方法,每换一个图形,要从头想一遍吗?

是的。抛物线有抛物线的巧妙塞法,圆有圆的割法,每道题都是一件手工艺品。

那缺的是什么?

缺一种通用的语言,能把所有曲线都写成同一种形式,再用同一套步骤去处理。

这种语言在 17 世纪出现了吗?

出现了。1637 年笛卡尔发表坐标几何,费马也独立做了同样的事:曲线可以写成方程,比如 y = x²。几何问题从此可以变成代数问题。

工具有了,需求也来了。远洋航行要算船的位置,炮兵要算炮弹的轨迹,天文学家要解释开普勒刚发现的行星椭圆轨道——这些都是关于“不断变化的运动”的问题。于是 17 世纪上半叶,一大批人各自摸到了微积分的边角:

  • 开普勒在 1615 年研究酒桶的容积,把桶切成薄片来算;
  • 卡瓦列里在 1635 年提出“不可分量”方法;
  • 费马在 1630 年代找到了求曲线最高点、最低点的办法;
  • 剑桥首任卢卡斯数学教授巴罗(牛顿的前辈和提携者,1669 年把教席让给了牛顿),已经用几何的形式触到了“求切线”与“求面积”之间的互逆关系。

拼图的碎片散落了一地。缺的是一个人,把它们拼成一套任何人照着做都能算出答案的通用算法。结果,出现了两个人。

2.4牛顿:乡间一年里的“流数”

序章只讲了两个年轻人的开头。现在把他们的故事讲完整。

1665 年,伦敦暴发大瘟疫,剑桥大学关闭。二十出头的牛顿回到林肯郡伍尔索普的农庄。在接下来一年多里,他独自发展出了三样改变世界的东西:光的颜色理论、万有引力的雏形,以及他称为“流数术”的新数学。1666 年 10 月,他写下了一份关于流数术的手稿。

牛顿是从运动出发的。他把一切变量都想象成随时间“流动”的量,叫作“流量”;流量变化的速度,叫作“流数”。求流数,就是我们说的求导数;从流数反推流量,就是求积分。

可他几乎不发表。1669 年他写了《分析学》,只在朋友之间传阅;1671 年写成的《流数法》,直到他去世后的 1736 年才出版。1687 年那部震动世界的《自然哲学的数学原理》,推导里处处用到微积分的思想,写出来的却几乎全是古典几何的样子。

为什么藏着?一个常被提到的原因是,他早年发表光学论文后遭到胡克等人的批评,从此对公开争论极度厌恶。数学家阿诺尔德有一句挖苦:在“不发表”和“为优先权不停争斗”之间,牛顿两样都选了。

2.5莱布尼茨:巴黎的符号大师

1672 年,二十六岁的莱布尼茨作为外交官来到巴黎。他此前主要学的是法律和哲学,数学相当薄弱。荷兰物理学家惠更斯成了他的老师。短短四年,他从数学门外汉变成了欧洲一流的数学家。1675 年 10 月 29 日,他在手稿里第一次写下了一个拉长的 S——∫,取自拉丁文 summa(总和);几周后,他又开始用 d 表示“差”(differentia)。

莱布尼茨是从求和与求差出发的。他在研究数列时注意到:一列数“逐项相减”与“逐项累加”是一对互逆的操作。把这个直觉推到无穷小,就有了 d 与 ∫ 这一对互逆的符号。

他对符号有近乎执念的追求。他一生都梦想发明一种“通用语言”,让推理像算术一样可以机械地进行。dy/dx 这个记号就体现了这种追求:它读起来像一个分数,而在很多计算里,它也真的可以像分数一样约分和移项。第 5 章讲链式法则时,你会亲眼看到这种记号有多聪明。

1684 年,他在莱比锡的《教师学报》上发表了第一篇微分论文,题目很长,意思是“一种求极大、极小和切线的新方法”;1686 年又发表了积分的论文。瑞士的伯努利兄弟读后迅速掌握并发扬了这套方法。1696 年,法国的洛必达出版了世界上第一本微积分教科书,用的是莱布尼茨的体系。在欧洲大陆,微积分从此传开了。

2.61676 年的两封信

两人其实有过直接的接触。莱布尼茨 1673 年和 1676 年两次访问伦敦,1676 年还在牛顿的朋友柯林斯那里看到过牛顿的部分手稿。同一年,通过皇家学会秘书奥尔登堡转交,牛顿给莱布尼茨写了两封长信,介绍自己关于无穷级数的成果。

在第二封信里,牛顿把流数术的核心藏进了一串字母密码:

6accdae13eff7i3l9n4o4qrr4s8t12ux意思是:有 6 个 a、2 个 c、1 个 d……把原句的字母按字母表顺序数出来。原句是拉丁文:“给定一个含有任意多个流量的方程,求出流数;以及反过来。”

这是当时常见的“时间戳”做法:先把发现藏起来,将来若有争议,再公布原文证明自己早就知道。可以想见,莱布尼茨不可能从这串字母里读出什么。1677 年他回信时,已经坦然地用自己的 d 记号展示了求切线的方法。

2.7战争:1699–1716

牛顿一方莱布尼茨一方1665牛顿在瘟疫年发展流数术1669《分析学》手稿私下流传1675莱布尼茨手稿首次写下 ∫ 和 d1676两人经奥尔登堡通信牛顿用字母密码藏起方法1684莱布尼茨发表第一篇微分论文1687《自然哲学的数学原理》出版1696洛必达出版第一本微积分教科书1699法蒂奥公开指控莱布尼茨剽窃1704牛顿正式发表流数法1708凯尔在《哲学汇刊》再次指控1711莱布尼茨向皇家学会申诉1713学会报告《通信集》:牛顿优先1716莱布尼茨去世,葬礼冷清1727牛顿去世,举行国葬红底:公开争吵期 1699–1716

图 2-2微积分之争时间线。左侧是牛顿一方,右侧是莱布尼茨一方。粉色区间是公开争吵期:从 1699 年的剽窃指控,到 1716 年莱布尼茨去世。

头二十年相安无事。1696 年,洛必达在教科书序言里还承认,牛顿的《原理》“几乎全是这种演算”。

火药桶是 1699 年点着的。瑞士数学家法蒂奥(牛顿的密友)公开暗示:莱布尼茨是“第二发明人”,可能借用了牛顿的东西。1705 年初,莱比锡《教师学报》上一篇匿名书评评论牛顿 1704 年随《光学》发表的求积论文,字里行间暗示牛顿的流数不过是莱布尼茨微分的另一种写法。后来查明,书评出自莱布尼茨之手,他本人在 1716 年的一封信里也承认了。

这下轮到英国人愤怒了。1708 年,牛顿的门生凯尔在皇家学会的《哲学汇刊》上直指莱布尼茨剽窃。莱布尼茨向皇家学会申诉,要求主持公道。

学会成立了一个委员会。问题在于,学会会长正是牛顿本人。委员会从未听取莱布尼茨的陈述,1712 年便完成了报告,1713 年初以《通信集》为名出版,裁定牛顿是第一发明人。今天的研究者已经查明,这份报告的主体是牛顿亲自起草的。1715 年,皇家学会的刊物上又出现一篇为这份报告叫好的匿名长文,作者还是牛顿。

莱布尼茨一方也并不干净:1713 年,他匿名散发了一份攻击牛顿的单页传单,其中引用了一封指责牛顿的来信;写信的约翰·伯努利事后郑重否认写过这封信。直到 1716 年去世,他也没有接受那份裁决。

如果你是一名 18 世纪的英国数学家,你会用谁的记号?如果你是法国人呢?这种选择会带来什么后果?

英国人出于忠诚,坚持用牛顿的“点”记号;欧洲大陆的伯努利家族、欧拉、拉格朗日等人则用莱布尼茨的 d 与 ∫。

后果是:18 世纪微积分最辉煌的进展——微分方程、变分法、分析力学——几乎全部发生在欧洲大陆。英国数学在这门自己本国人参与开创的学科上明显落后,直到 1820 年前后才赶上来。当然,落后不能全怪记号:优先权之争造成的隔阂、英国对几何传统的坚持,都是原因。

2.8结局

结局有三层。

第一层,个人的结局。两人的晚年境遇截然不同。牛顿晚年声望如日中天,1727 年去世后,由大法官、两位公爵和三位伯爵抬棺,隆重安葬在威斯敏斯特教堂中殿。莱布尼茨晚年失去了宫廷的青睐,1716 年在汉诺威去世时身后冷清,只有巴黎科学院为他致了悼词。

第二层,国家的结局。英国赢了优先权,却在记号和方法上把自己孤立起来。1812 年,剑桥的几个学生——包括后来设计出机械计算机的巴贝奇、天文学家赫歇尔和数学家皮科克——成立了“分析学会”,要把欧陆的数学引回英国。巴贝奇留下一句双关语:他们要推行“纯粹的 D 主义”,反对大学里的“点时代”(dot-age,谐音 dotage,“老糊涂”)。1817 年,剑桥考试终于开始使用莱布尼茨的 d 记号。

第三层,历史的结局。1849 年,德国学者格哈特在整理莱布尼茨的手稿时,发现了他亲手摘抄的牛顿《分析学》片段,但摘抄的时间无法确定。此后一百多年,科学史家反复比对两人的手稿与通信,得出了今天的共识。

2.9真相:同一座山的两条路

表 2-1 牛顿与莱布尼茨:同一座山,两条路
牛顿莱布尼茨
主要成果时间1665–1666 年(手稿)1675 年(手稿)
首次公开发表1693 年部分、1704 年较完整1684 年(微分)、1686 年(积分)
出发点运动:量随时间流动数列:求和与求差
核心概念流量、流数微分 d、积分 ∫
导数记号ẋ(字母上加点)dy/dx
今日遗产物理学中对时间求导仍用点记号全世界教科书的标准记号

现代科学史的主流结论可以归纳为三句话:

  1. 牛顿先发现:他在 1665–1666 年就掌握了方法,比莱布尼茨早约十年。
  2. 莱布尼茨先发表:1684 年公开发表,比牛顿早约二十年,而且他的符号体系让这门学问得以迅速传播。
  3. 两人独立发明:他们的出发点、概念和记号截然不同,莱布尼茨的手稿显示了一条独立的思想路径。也有研究者指出,莱布尼茨事后修改过部分笔记的日期,这一点至今仍有争议。
类比

两支登山队从南坡和北坡分别登顶同一座山。南坡的队伍先到,却没有插旗,只在日记里写下“我到过”;北坡的队伍晚到,却插了旗、画了详细的路线图,后来的登山者都沿着北坡的路线上山。多年后,两队为“谁先登顶”吵得不可开交——而山,一直都在那里。

“独立发明”的意思是
  • 两人各自找到了通用算法,并且都看清了求导与求积互为逆运算
  • 谁也不是简单地抄了对方
“独立发明”不意味着
  • 两人对彼此的工作一无所知(他们通过信件有过交流)
  • 微积分是凭空出现的(它站在阿基米德、刘徽、费马、巴罗的肩膀上)

2.10还没打牢的地基

故事还没完。牛顿和莱布尼茨的方法好用得出奇,但有一个致命的逻辑漏洞:他们都依赖“无穷小量”——一个比任何正数都小、却又不等于零的量。计算时先把它当成非零来做除法,算完再把它当成零扔掉。

1734 年,英国哲学家、主教贝克莱写了一本《分析学家》,辛辣地讥讽说:这些无穷小量,既不是有限的量,也不是零,那它们难道是“逝去的量的鬼魂”吗?

数学家们无言以对,但微积分实在太好用,大家便一边用一边等。这一等就是一百多年。直到 1821 年法国的柯西在《分析教程》里用“极限”重新定义一切,再到 1860 年代德国的魏尔斯特拉斯用严格的 ε-δ 语言把它说清,鬼魂才被彻底驱散。

这里的 ε 和 δ 是两个希腊字母,分别读作 epsilon /ˈɛpsɪlɒn/(中文近似“艾普西隆”)和 delta /ˈdɛltə/(中文近似“德尔塔”)。它们是什么意思、为什么偏偏选这两个字母,第 4 章会用一场“挑战游戏”细讲。

这段历史告诉我们一件重要的事:用好一件工具,和说清它为什么成立,是两回事。人类先会用、后说清,花了一百五十年。你不必重走这段弯路——接下来的几章,我们会按“说清”之后的顺序,一块一块搭积木。

表 2-2 两千年接力:微积分的来历
年代人物贡献
约前 450芝诺无穷多段能否加成有限?(悖论)
约前 250阿基米德穷竭法:抛物线弓形面积、π 的范围
263刘徽割圆术:“割之又割,以至于不可割”
约 500祖暅“幂势既同,则积不容异”:切片求体积
1615–1637开普勒、卡瓦列里、费马、笛卡尔切片求体积、不可分量、求极值、坐标几何
1665–1686牛顿、莱布尼茨通用算法与基本定理;符号体系
1696洛必达第一本微积分教科书
1734贝克莱批评无穷小是“逝去的量的鬼魂”
1821–1860s柯西、魏尔斯特拉斯用极限与 ε-δ 打牢地基
本章带走

微积分是两千年接力的终点:古人会切片,17 世纪的坐标语言让它变成通用算法,牛顿与莱布尼茨各自完成了最后一步。

  • 牛顿先发现(1665–1666),莱布尼茨先发表(1684);现代共识是两人独立发明。
  • 皇家学会的裁决由牛顿本人主导;莱布尼茨至死未能翻案。
  • 代价:英国坚持牛顿的记号与传统,在 18 世纪明显落后欧陆,约 1820 年才赶上;今天全世界用的是莱布尼茨的 d 与 ∫。
  • 早期微积分的“无穷小”逻辑有漏洞,直到 19 世纪才用极限补上。

于是,下一个问题故事讲完了。要亲手使用这件工具,第一块积木是什么?

3Chapter 3 · Functions and rates

第一块积木:函数与变化率

要谈论“变化”,我们先需要什么语言?

上一章留下的问题:故事讲完了。要亲手使用这件工具,第一块积木是什么?

第 2 章说过,古人早就会切片,微积分却要等到 17 世纪,因为那时才有了一种能把所有曲线写成同一种形式的语言。这种语言的核心,叫函数。本章只做两件事:说清函数是什么,说清怎样衡量它变得多快。

3.1变化总是“随着什么”在变

说“气温在变”,是随着什么在变?

随着时间。早上凉,中午热,夜里又凉下来。

出租车的车费呢?

随着里程。开得越远,表上的数越大。

血液里的药物浓度呢?

随着吃药后过去的时间。先升高,后慢慢降下去。

这三件事有什么共同点?

都有一个量跟着另一个量变:你给出一个时间或里程,就能对应出一个气温、车费或浓度。

这种“给一个,对应一个”的关系,就是函数。被你自由给出的那个量叫自变量,通常写作 x(或时间 t);跟着变的那个量叫因变量,通常写作 y。写成 y = f(x),读作“y 是 x 的函数”。

输入 x3函数 f规则:平方f(x) = x²输出 y9同一个输入,永远得到同一个输出

图 3-1函数是一台机器:放进一个输入,按固定规则加工,吐出一个输出。关键在于“固定”——同一个输入,永远得到同一个输出。

类比

函数像一台自动售货机:按下 A3,永远掉出同一瓶饮料。它不会今天给你可乐、明天给你橙汁。反过来倒是可以:A3 和 B5 都可能是可乐——不同的输入可以对应同一个输出。

函数是
  • 一条规则:每个输入对应唯一一个输出
  • 可以用公式、表格、图像,甚至一段文字描述
函数不一定是
  • 一个漂亮的公式(气象站的气温记录也是函数,但没有公式)
  • 一一对应(两个输入可以得到同一个输出)

3.2把规则画出来:图像

函数最有力的表示法,是把它画出来:横轴放输入,纵轴放输出,每一对 (x, y) 画一个点,所有点连起来就是一条曲线。这正是笛卡尔的发明。

学会读图,你就从图像上一眼读出两样东西:

  1. 高度:某个输入对应的输出是多少。比如下午 2 点气温多少度。
  2. 陡峭程度:输出变得有多快。比如气温上午升得快,下午升得慢。

第一样东西,普通的查表就够了;第二样东西,才是微积分真正关心的。我们需要一把“量陡峭程度”的尺子。

3.3直线的陡峭程度:斜率

先从最简单的情况出发:直线。

假设出租车起步价 13 元,之后每公里 2.5 元。车费 y 与里程 x 的关系是 y = 13 + 2.5x。画出来是一条直线。多走 1 公里,车费多 2.5 元;多走 4 公里,多 10 元。无论从哪里开始数,“多出来的车费 ÷ 多走的里程”都是 2.5。

这个比值就是斜率:

斜率 = 输出的变化 ÷ 输入的变化 = Δy / ΔxΔx 读作“delta x”,意思是“x 变了多少”

Δdelta(大写)· 希腊字母第 4 个

怎么读:英文读 delta /ˈdɛltə/,中文近似“德尔塔”。Δx 读作“delta x”。

从哪来:它是希腊字母表的第四个字母,相当于拉丁字母的 D。形状像一个三角形——尼罗河口的三角洲英文叫 delta,就是因为长得像这个字母。

为什么选它:“差、变化”在拉丁文里是 differentia,英文是 difference,都以 d 开头;数学家便借用了希腊语里的“D”来表示“差值”。大写 Δ 表示一段看得见的、有限的变化,比如“4 分钟”“6.5 公里”。第 4 章还会遇到它的小写 δ。

请特别留意单位。车费斜率的单位是“元 / 公里”,速度的单位是“公里 / 小时”,气温升高的快慢是“度 / 小时”。任何变化率的单位都是“输出单位 每 输入单位”。这个“每”字,就是变化率的指纹。以后你在任何地方看到“每”,都可以想到:这里藏着一个变化率。

斜率就是变化率,它的单位里总有一个“每”。

3.4曲线的陡峭程度:平均变化率

直线处处一样陡,所以一个斜率就够了。曲线不行:它有的地方陡,有的地方平。

我们能做的第一步,是在曲线上取两个点,连一条直线——这条线叫割线——用割线的斜率,代表这一段的平均变化率。

024681004812时间 t(分钟)位置 s(公里)Δt = 4 分钟Δs ≈ 6.5 公里割线斜率 = Δs/Δt ≈ 1.63= 这 4 分钟的平均速度(公里/分钟)

图 3-2一辆车先加速后减速,位置随时间画成一条 S 形曲线。取第 2 分钟和第 6 分钟两个点连成割线,它的斜率 Δs/Δt 就是这 4 分钟里的平均速度。

平均速度很有用,但它会“抹平”细节。这 4 分钟里,车可能一会儿快一会儿慢,平均值告诉不了你第 3 分钟那一刻有多快。要知道“那一刻”,只能把两个点靠得更近:把 4 分钟缩成 1 分钟,再缩成 1 秒……

3.5常见的函数家族

世界上的变化千姿百态,但大多数都能由几个基本家族拼出来。认识它们,就像认识乐器:每一种都有自己的“音色”——也就是自己的变化方式。

表 3-1 五个基本函数家族与它们的“变化性格”
家族例子生活里的样子变化性格
线性y = 13 + 2.5x出租车计费、匀速行驶变化率处处相同
幂函数y = 4.9t²自由落体下落的距离(米)越往后变得越快
指数y = 2t细菌分裂、复利、病毒传播初期变化率与自身大小成正比
对数y = log x地震震级、声音分贝、音阶越往后变得越慢
三角y = sin t潮汐、交流电、一年四季的气温周而复始,时快时慢

表里的 log x(对数)问的是:10 要自乘几次才得到 x?比如 log 1000 = 3。震级每高 1 级,地震释放的能量约增大 32 倍,所以用对数来“压缩”这种跨越好几个数量级的量。

表里最后一列“变化性格”,就是后面几章要精确计算的东西。第 5 章会给出每个家族的变化率公式;第 10 章会看到,指数家族“变化率与自身成正比”这个性格,几乎统治了金融、医药和人口的全部故事。

3.6撞上那堵墙:0 ÷ 0

现在,让我们正面撞一次序章里那堵墙。

一块石头从高处自由下落,t 秒后下落了 4.9t² 米。问:第 2 秒那一刻,它有多快?

按平均速度的思路,从第 2 秒到第 2 + Δt 秒:

平均速度 = [4.9(2 + Δt)² − 4.9 × 2²] ÷ Δt

取 Δt = 1 秒,得 24.5 米/秒;取 0.1 秒,得 20.09;取 0.01 秒,得 19.649;取 0.001 秒,得 19.6049。

这串数在往哪里走?如果直接令 Δt = 0,会得到什么?

这串数越来越接近 19.6。看起来,“第 2 秒那一刻的速度”就应该是 19.6 米/秒。

但如果直接令 Δt = 0,分子是 4.9 × 4 − 4.9 × 4 = 0,分母也是 0,又回到了 0 ÷ 0。我们明明“看见”了答案,却没法合法地“算出”它。

困难被压缩成了一句话:我们需要让 Δt 无限小,却又不能让它等于 0。牛顿和莱布尼茨靠“无穷小”绕过了这堵墙,却留下了贝克莱讥讽的“鬼魂”。下一章,我们用 19 世纪的办法正式拆掉它。

本章带走

函数描述“谁随着谁变”;斜率衡量“变得多快”,单位里总有一个“每”。

  • 函数:每个输入对应唯一的输出,可用公式、表格或图像表示。
  • 直线的斜率 = Δy/Δx,处处相同。
  • 曲线上两点连成割线,其斜率是这一段的平均变化率。
  • 想要“一瞬间”的变化率,就得让 Δt 缩到无限小——然后撞上 0 ÷ 0。

于是,下一个问题平均变化率一算就有;可一瞬间的变化率,Δt = 0 时成了 0/0。怎样让 Δt 无限小,却又不等于 0?

4Chapter 4 · Limits

第二块积木:极限

“无限接近”如何变成可以严格计算的东西?

上一章留下的问题:平均变化率一算就有;可一瞬间的变化率,Δt = 0 时成了 0/0。怎样让 Δt 无限小,却又不等于 0?

这一章是整座阶梯里最“哲学”的一级,也是人类花了一百五十年才迈上去的一级。好消息是,一旦换个问法,它就变得出奇地朴素。

4.1换一个问法

先把上一章的数据整理成一张表。

表 4-1 自由落体:第 2 秒起、时长 Δt 内的平均速度
Δt(秒)平均速度(米/秒)与 19.6 的差距
124.54.9
0.120.090.49
0.0119.6490.049
0.00119.60490.0049
→ 0→ 19.6→ 0

表里每一行,Δt 都不是 0,对吗?

对。每一行都是正常的除法,没有 0 ÷ 0。

差距一栏有什么规律?

每次 Δt 缩小 10 倍,差距也缩小 10 倍,正好是 4.9 × Δt。

那我们何必非要算“Δt = 0 时等于多少”?我们能不能改问:当 Δt 越来越接近 0 时,平均速度越来越接近哪个数?

这个问题有明确的答案:19.6。而且回答它,从头到尾不需要让 Δt 等于 0。

这就是极限的全部秘密:不问“到了那里是多少”,只问“往那里去时,结果向哪里靠拢”。我们把它写成:

limΔt → 0(平均速度)= 19.6读作“当 Δt 趋于 0 时,平均速度的极限是 19.6”

limlimit · 极限记号

怎么读:英文读 limit /ˈlɪmɪt/,中文直接读“极限”。下方小字 Δt → 0 读作“delta t 趋于零”,箭头 → 读“趋于”(英文 approaches /əˈprəʊtʃɪz/)。

从哪来:lim 是 limit(法语 limite,源自拉丁文 limes:边界、界限)的缩写。带句点的“lim.”最早见于瑞士数学家吕伊利埃 1786 年的论文;魏尔斯特拉斯在 1850 年代已把趋近条件写在 lim 下方;箭头“→”的写法 1905 年出现,1908 年经哈代等人的教科书流行开来。

为什么选它:极限就是一个过程无法越过、只能不断靠近的“边界”,用“界限”这个词再贴切不过。

类比

极限像一张机票上的目的地,而不是你此刻所在的位置。飞机一路向北京靠近,距离从 1000 公里缩到 100 公里、10 公里、1 公里……“目的地是北京”这件事,在飞机落地之前就已经完全确定了。极限问的就是目的地;至于最后那一刻飞机是否真的落地,与目的地是哪里无关。

极限是
  • 一个过程“正在去往”的那个确定的数
  • 只看“靠近时”的行为,永远不需要真的到达
极限不是
  • “差不多”或“近似值”:19.6 是精确的,不是 19.6 左右
  • 把 Δt 代成 0 算出来的值(那是 0 ÷ 0,没有意义)

4.2割线的去向:切线

把同样的想法画到图上。在曲线 y = x² 上固定一点 (1, 1),另一个点从远处向它滑过来。每个位置都连一条割线。

012246xy(1, 1)紫线(割线)另一端 x = 2、1.5、1.2斜率 3 → 2.5 → 2.2 → …红虚线(切线)斜率 2

图 4-1割线的另一端从 x = 2 滑到 1.5、再到 1.2,斜率从 3 变成 2.5、2.2。另一端离 (1, 1) 为 h 时,割线斜率恰好是 2 + h。h 趋于 0,割线就转向了斜率为 2 的红色切线。

动手试一试 · 割线滑块

让 h 变小,看紫色割线怎样一点点贴向红色切线,斜率怎样逼近 2。

这就回答了第 1 章留下的疑问:“放大到足够大,曲线就变成直线”——那条直线到底是哪一条?它就是割线的极限,也就是切线。“放大”和“让两点无限靠近”,是同一件事的两种说法。

4.3芝诺的回答:无穷多项可以加成有限

极限不仅能处理“无限小”,也能处理“无限多”。回到第 2 章的阿基里斯。

设阿基里斯每秒跑 10 米,乌龟每秒爬 1 米,乌龟先跑 100 米。阿基里斯跑完 100 米用 10 秒,乌龟又前进 10 米;再追 10 米用 1 秒,乌龟又前进 1 米;再追 1 米用 0.1 秒……总时间是:

10 + 1 + 0.1 + 0.01 + … = 11.111… 秒

无穷多段时间,加起来只有约 11.1 秒。芝诺的错误在于默认了“无穷多个正数相加,一定是无穷大”。下面这张图说明它为什么不对。

1/21/41/81/161/32每次取剩下的一半块数:无穷多总和:永远不超过 1差距:每次减半1/2 + 1/4 + 1/8 + …= 1

图 4-2把一个正方形切下一半,再把剩下的切下一半……块数无穷多,但它们全在正方形里面,总面积永远不会超过 1;而没切到的部分每次减半,趋于 0。所以 1/2 + 1/4 + 1/8 + … 的极限恰好是 1。

“无穷多个数相加”在数学里叫级数。它的值被定义为“前 n 项之和”在 n 趋于无穷时的极限。第 11 章会看到,计算器算 sin 和 eˣ,靠的就是这种无穷的加法。

4.4把“无限接近”说严格:一场挑战游戏

“越来越接近”这种话,听起来还是有点虚。19 世纪的魏尔斯特拉斯把它变成了一场可以判输赢的游戏。

你说石头第 2 秒那一刻的速度是 19.6,我不信。我要求平均速度和 19.6 的差距小于 0.01,你做得到吗?

做得到。差距是 4.9 × Δt,只要 Δt 小于 0.01 ÷ 4.9,约 0.002 秒,差距就一定小于 0.01。

那我要求差距小于 0.000001 呢?

那我就让 Δt 小于 0.000001 ÷ 4.9。无论你提出多小的误差要求,我总能找到一个足够小的 Δt 范围来满足你。

所以,只要你永远能接招……

“极限是 19.6”就成立。

数学家习惯用希腊字母 ε 表示挑战者要求的误差,用 δ 表示应战者给出的范围。所以这个定义被称为 ε-δ 定义(读作“epsilon-delta 定义”)。

εepsilon · 希腊字母第 5 个

怎么读:英文读 epsilon,英式 /ˈɛpsɪlɒn/、美式 /ˈɛpsəlɑːn/,中文近似“艾普西隆”(也常听到“伊普西龙”)。英式还有一种常见读法 /ɛpˈsaɪlən/,重音在第二个音节,两种都对。

从哪来:它就是希腊字母里的 e。名字的原意是“单纯的 e”(e psilon),用来和发音相同的字母组合区分开。

为什么选它:通常的解释是,它对应法语 erreur(误差)的首字母 e——这是后人的解读,柯西本人没有说明。法国数学家柯西 1821 年的《分析教程》已用 ε 表示“任意小的量”,1823 年的《无穷小计算教程概要》第一次在同一个证明里同时使用 δ 和 ε,这个习惯一直沿用至今。所以在数学里,看到 ε,几乎总可以把它理解为“一个很小的正数,代表允许的误差”。

δdelta(小写)· 希腊字母第 4 个

怎么读:和第 3 章的大写 Δ 同一个字母,英文读 delta /ˈdɛltə/,中文近似“德尔塔”。

从哪来:它是 Δ 的小写,相当于拉丁字母的 d。

为什么选它:通常认为它对应 différence(差)或 distance(距离)的首字母 d:它描述的是“Δt 离 0 有多近”这段距离。大写 Δ 常用于一段具体的变化,小写 δ 常用于一个很小的范围,正好搭配 ε 这个“很小的误差”。

用这两个符号,定义可以写成:

对任意 ε > 0,都存在 δ > 0,使得只要 0 < |Δt| < δ,就有 |平均速度 − 19.6| < ε

类比

这很像工厂接订单。客户说:零件尺寸误差不能超过 0.01 毫米。工厂回答:只要把机床的进给控制在某个精度内,我就能保证。客户把要求提到 0.0001 毫米,工厂就把机床精度再提高。如果无论客户怎么提要求,工厂都有办法保证,我们就说这家工厂“能造出精确的 10 毫米”——尽管没有任何一个零件真的是“精确的 10 毫米”。

ε-δ 定义第一次读会觉得绕,这很正常。你只需要记住它的精神:“无限接近”被翻译成了“任何精度要求都能被满足”。这句话里没有任何“无穷小量”,也没有任何鬼魂。

4.5两个值得认识的极限

第一个:sin x / x。当 x(用弧度表示的角度;弧度就是“弧长 ÷ 半径”,180° 等于 π ≈ 3.14 弧度,0.1 弧度约 5.7°)趋于 0 时,分子分母都趋于 0,又是 0/0 的样子。数值实验会告诉你答案:

表 4-2 小角度时,sin x 与 x 几乎相等
x(弧度)sin x / x
10.841471
0.50.958851
0.10.998334
0.010.999983
→ 0→ 1

它的意思是:角度很小时,sin x ≈ x。物理学家分析钟摆、工程师计算桥梁的微小形变、光学设计里处理近轴光线,都在大量使用这个近似。这正是“放大看,曲线就变直”的又一个例子:正弦曲线在原点附近,放大后就是直线 y = x。

严格证明它时,要用到一个很形象的工具——夹逼定理:如果一个量总是被夹在两个量中间,而这两个量都趋向同一个数,那么中间这个量也只能趋向那个数。就像一个人被两名警察一左一右押着走,警察走进了警局,他也只能跟着进去。

第二个:(1 + 1/n)n。当 n 越来越大,它依次是 2、2.25、2.594、2.705、2.717……最后趋向一个不再变化的数:2.71828…。这个数叫 e。它是伏笔 C(利息拆得无限细,钱会不会无限多)的答案所在,第 10 章再细说。

4.6连续:笔不离纸

有了极限,还能顺手说清另一个日常直觉:连续。

连续:一笔画成有洞:缺了一个点跳跃:阶梯收费连续的直觉:画的时候笔不离纸

图 4-3左:连续的曲线,一笔画成。中:在一点处缺了个洞。右:在一点处突然跳了一级,比如快递按“每满 1 公斤”阶梯收费。

直觉上,连续就是“画的时候笔不离纸”。用极限的语言说:当 x 趋向 a 时,f(x) 的极限恰好等于 f(a)——往那里去的方向,和那里实际的值,没有错位。

大多数自然量是连续的:气温、身高、水位,不会从一个值瞬间跳到另一个值。连续有一个很有用的推论,叫介值定理:连续变化的量,不会跳过中间的任何值。你 10 岁时身高 1.4 米,15 岁时 1.7 米,那么在这之间必然有某一刻,你恰好是 1.5 米高。

早上 6 点你从山脚出发,傍晚 6 点到达山顶;第二天早上 6 点沿原路下山,傍晚 6 点回到山脚。两天里,是否一定存在某个时刻,你在同一钟点恰好处在同一个位置?

一定存在。想象两天的你在同一天出发:一个从山脚往上走,一个从山顶往下走。两人走的是同一条路,从两端相向而行,途中必然相遇。相遇的那个时刻、那个位置,就是答案。

用介值定理说:“上山者的位置 − 下山者的位置”这个量是连续变化的,早上 6 点它是负的,傍晚 6 点它是正的,所以中间某一刻它必然等于 0。

4.7鬼魂被驱散

回头看贝克莱的批评。牛顿的做法是:先用一个“无穷小”的 Δt 做除法,算完再把它当作 0 扔掉——前后矛盾。

极限的做法是:Δt 从头到尾都是普通的、不为零的数。我们合法地化简出 19.6 + 4.9Δt,然后只问一个问题:Δt 趋于 0 时,它去往哪里?答案 19.6 由 ε-δ 游戏担保。没有任何一步除以零,也没有任何一步“既是零又不是零”。

极限问的是“去往哪里”,而不是“到了哪里”。
本章带走

极限把“让 Δt 等于 0”换成了“看 Δt 趋于 0 时结果去往哪里”,0 ÷ 0 的墙就此消失。

  • 割线的极限是切线;“放大到变直”和“两点无限靠近”是同一件事。
  • 无穷多个数可以加成有限:1/2 + 1/4 + … = 1,阿基里斯约 11.1 秒追上乌龟。
  • ε-δ:无论要求多高的精度,总能满足——这就是“无限接近”的严格含义。
  • 两个重要极限:sin x/x → 1(小角度 sin x ≈ x),(1 + 1/n)n → e。
  • 连续 = 极限值等于实际值;连续量不会跳过中间值。

于是,下一个问题有了极限,终于可以正式定义“一瞬间的变化率”。它长什么样,又该怎么算?

5Chapter 5 · The derivative

导数:一瞬间的变化率

怎样算出任何一刻的变化速度?

上一章留下的问题:有了极限,终于可以正式定义“一瞬间的变化率”。它长什么样,又该怎么算?

前四章搭好了两块积木:函数(描述变化的语言)和极限(驯服“无限接近”的工具)。把它们叠在一起,就得到微积分的第一个主角——导数。

5.1导数的定义

把第 3 章的平均变化率和第 4 章的极限合起来,就是导数的定义:

f ′(x) = limh → 0 [f(x + h) − f(x)] / h分子:输出变了多少;分母:输入变了多少;lim:让输入的变化趋于 0

读法有三种,说的是同一件事:

  1. 代数上:平均变化率在区间缩成一点时的极限。
  2. 几何上:曲线在这一点的切线斜率。
  3. 物理上:这一瞬间的变化速度——位置的导数是速度,速度的导数是加速度。

序章里速度表的悖论到这里有了答案。“此刻 72 公里/小时”说的不是“一瞬间走了多少路”,而是:在那一刻前后取越来越短的时间段,平均速度去往的那个数是 72。它是一个极限,因此既有意义,又可以测量。实际的速度表和测速仪也无法真正测量“一瞬间”,它们是在极短时间内测出位置(或车轮转过的圈数)的变化,再用这个平均速度去逼近瞬时速度。

5.2亲手算第一个导数:正方形长大

我们来求 f(x) = x² 的导数。先不用公式,用一张图。

x²x·dxx·dxxdx新增面积= 2·x·dx + (dx)²除以 dx:= 2x + dxdx → 0:= 2x琥珀色小角:“小的平方”,最先消失

图 5-1边长为 x 的正方形,边长增加一点点 dx。新增的面积是两条细长条(各为 x·dx)加上角落里一个极小的正方形 (dx)²。dx 越小,角落那块越可以忽略。

新增面积 = 2x·dx + (dx)²。除以 dx,得到 2x + dx。让 dx 趋于 0,结果是 2x。

(x²)′ = 2x

这个结果和第 4 章对得上:在 x = 1 处,切线斜率是 2;石头下落 4.9t²,在第 2 秒的速度是 4.9 × 2 × 2 = 19.6。

请留意那个琥珀色的小角。它是“两个小量相乘”,比任何一个小量本身都小得多。导数的全部计算,本质上都是在做同一件事:保留和 dx 成正比的部分,扔掉比它更小的部分。

用同样的方法想一想:边长为 x 的正方体,每条边长长 dx,体积增加的主要部分是什么?由此猜出 x³ 的导数。

正方体有三个面朝外“长肉”,每个面新增一块 x² × dx 的薄板,一共 3x²·dx;其余是棱和角上的细条小块,都含 (dx)² 或 (dx)³,可以忽略。所以 (x³)′ = 3x²。

规律出来了:(x²)′ = 2x,(x³)′ = 3x²。一般地,(xn)′ = nxn−1,这叫幂法则。

5.3导数本身也是一个函数

曲线上每一点都有一个切线斜率。把“每一点的斜率”也画成一条曲线,就得到一个新函数:导函数,简称导数。

0123412xf(x)01234−112xf′(x)山顶:坡度 0谷底:坡度 0

图 5-2上图是函数 f,下图是它的导数 f ′。下图每一点的高度,等于上图同一位置切线的坡度:上坡处 f ′ 为正,下坡处为负,山顶和谷底处恰好为 0。

学会看这对图,你就学会了导数最实用的读法:

  • f ′ > 0:f 在上升;f ′ 越大,升得越猛。
  • f ′ < 0:f 在下降。
  • f ′ = 0:f 此刻不升不降,可能在山顶或谷底。第 6 章会把这一点变成“找最优解”的武器。

5.4求导的几条法则

如果每求一次导数都要从极限的定义出发,那就太慢了。好在只需几条法则,就能像搭积木一样求出绝大多数函数的导数。

表 5-1 常用导数与求导法则
函数导数一句话理解
常数 c0不变的东西,变化率为零
xnnxn−1幂法则:正方形、正方体“长肉”
exex变化率等于自己(第 10 章主角)
ln x1/x越往后长得越慢
sin xcos x圆周运动:位置的“高度”变化率,是水平位置
cos x−sin x同上,差一个方向
u + vu′ + v′和的变化率 = 变化率的和
c · uc · u′放大 c 倍,变化率也放大 c 倍
u · vu′v + uv′长方形两边都在长:两条新长条
u / v(u′v − uv′) / v²由乘积法则推出

表中的 e(约 2.718)和自然对数 ln 第 10 章才会正式登场,这里先记住结果即可。

乘积法则值得多看一眼,因为它就是图 5-1 的推广:一个长方形,长 u、宽 v 同时在长,新增面积是“宽方向长的那条” u′v 加上“长方向长的那条” uv′,角上那个“小乘小”照例忽略。

它在生活里也随处可见。一家店的收入 = 单价 × 销量。如果单价每月涨 2%,销量每月跌 1%,收入怎么变?按乘积法则,收入的变化率约为 2% − 1% = 1%。

5.5链式法则:一串齿轮

现实中的变化往往是一环套一环的。给气球打气:时间决定了打进多少气,气量决定了半径,半径决定了表面积。表面积对时间的变化率是多少?

x转 1 圈u转 3 圈y转 6 圈dy/dx= 2 × 3= 6u 对 x:每转 1 圈带 3 圈;y 对 u:每转 1 圈带 2 圈

图 5-3三个咬合的齿轮。x 每转 1 圈,u 转 3 圈;u 每转 1 圈,y 转 2 圈。所以 x 每转 1 圈,y 转 3 × 2 = 6 圈。变化率沿着链条相乘。

这就是链式法则:

dy/dx = (dy/du) × (du/dx)左边看起来就像右边把 du“约掉”了

第 2 章说莱布尼茨的记号“会替你思考”,指的就是这里:dy/dx 虽然严格说不是分数,但在链式法则中它表现得像分数一样可以约分。你几乎不用记公式,写下来它自己就对了。

举个例子:y = (3x + 1)⁵。令 u = 3x + 1,则 y = u⁵。外层对 u 求导得 5u⁴,内层对 x 求导得 3,相乘:dy/dx = 15(3x + 1)⁴。

链式法则的应用远不止课本习题。今天训练人工智能的核心算法“反向传播”,本质上就是在一个有上亿个齿轮的链条上,反复使用链式法则。第 12 章还会回来谈它。

5.6变化率的变化率:二阶导数

导数是一个函数,所以它也可以再求导。位置求一次导得到速度,再求一次导得到加速度。坐车时你感觉不到匀速,却能感到加速和刹车——你的身体对二阶导数敏感。

新闻里说:“本月物价涨幅收窄。”这意味着物价在下降吗?

不是。“涨幅”是物价的变化率(一阶导数),它仍然是正的,物价还在涨;“收窄”说的是涨幅在变小,也就是二阶导数为负。

同理,“新增病例增速放缓”“房价涨势趋缓”都只是二阶导数为负,一阶导数仍为正。把一阶导数和二阶导数混为一谈,是新闻解读里最常见的误会之一。

5.7三种记号,一个意思

你会在不同的书里看到不同的导数记号。它们是历史留下的“方言”:

  • 牛顿记号 ẋ:头上一个点,专指对时间求导,物理学里常用;
  • 拉格朗日记号 f ′(x):简洁,适合强调“导数也是函数”;
  • 莱布尼茨记号 dy/dx:适合链式法则和换元,也最能提醒你导数是“两个微小变化之比”。

d ′d(微分)与 ′(撇)

怎么读:dy/dx 读作“d y 比 d x”,英文 “dee-y dee-x” /diː waɪ diː ɛks/,也可读“y 对 x 的导数”。f ′(x) 读作“f 撇 x”,英文 “f prime of x” /ɛf praɪm əv ɛks/。ẋ 读作“x 点”,英文 “x dot” /ɛks dɒt/。

从哪来:d 通常认为取自拉丁文 differentia(差)的首字母,莱布尼茨 1675 年 11 月 11 日的手稿里开始使用;它是第 3 章大写 Δ 的“无穷小版本”——Δ 表示看得见的变化,d 表示缩到无限小的变化。撇号 ′ 的用法可以追溯到欧拉,拉格朗日 1770 年代起使用,并在 1797 年的《解析函数论》里系统使用,从而推广开来。

为什么选它:用拉丁字母 d 而不是希腊字母,是为了与有限差 Δ 区分开,同时一眼看出它和“差”的关系。

最后一个小技巧:有时 y 和 x 的关系不是写成 y = … 的形式,比如单位圆 x² + y² = 1。我们照样可以对等式两边同时求导(把 y 看作 x 的函数,用链式法则):2x + 2y·y′ = 0,于是 y′ = −x/y。这叫隐函数求导,它再次说明:只要曲线光滑,放大看就是直线,不管它的方程写成什么样。

放大看,曲线就变直。那条直线的斜率,就是导数。
本章带走

导数 = 平均变化率的极限 = 切线斜率 = 瞬时速度;只需几条法则,就能求出绝大多数函数的导数。

  • (x²)′ = 2x:保留与 dx 成正比的部分,扔掉“小乘小”。
  • 导数本身是函数:正则升、负则降、零则可能是山顶或谷底。
  • 法则:和、常数倍、乘积、商;常用导数见表 5-1。
  • 链式法则:变化率沿链条相乘,dy/dx = dy/du · du/dx。
  • 二阶导数:变化率的变化率;“涨幅收窄”不等于“下降”。

于是,下一个问题会算导数了。可是,知道一个量每一刻变多快,到底有什么用?

6Chapter 6 · Using derivatives

导数的用武之地

知道了变化率,我们能做什么?

上一章留下的问题:会算导数了。可是,知道一个量每一刻变多快,到底有什么用?

导数至少能干五件实事:找最优、判断形状、从平均推断瞬间、用直线代替曲线做近似、解方程。本章一件一件看,还会顺手回收第一个伏笔。

6.1找最优:山顶的坡度为零

先做一个动手题。一张 30 厘米见方的纸板,四个角各剪掉一个边长为 x 的小正方形,把四边折起来,做成一个无盖的盒子。剪多大,盒子装得最多?

剪得很小,比如 x = 0.5 厘米,盒子怎么样?

底很大,但边太矮,像个托盘,装不了多少。

剪得很大,比如 x = 14 厘米呢?

边很高,但底只剩 2 厘米见方,像根细管子,也装不了多少。

所以体积先随 x 增大,后随 x 减小,中间某处有个最大值。在那个最高点上,体积的变化率是多少?

山顶上不升不降——导数为 0。

盒子底边长 30 − 2x,高 x,体积 V = x(30 − 2x)²。求导并化简:

V ′ = (30 − 2x)(30 − 6x)

令它等于 0,得 x = 15(纸板剪没了,舍去)或 x = 5。剪 5 厘米,体积 = 5 × 20 × 20 = 2000 立方厘米。

x30 厘米四角各剪去 x × x,沿虚线折起x(厘米)05101510002000体积 V最大:x = 5,V = 2000

图 6-1左:四角剪去 x × x 后折成盒子。右:体积随 x 的变化。在 x = 5 处,曲线到达山顶,切线(红色)是水平的。

这套方法可以一般化成三步:第一,把目标写成一个变量的函数;第二,求导并令它为 0,解出候选点;第三,连同区间端点一起比较,挑出最好的那个。企业定价、工程设计、物流调度里的无数“最优化”问题,都以这三步为起点。

仓库一次该进多少货?设一年要卖出 D 件商品,每次订货的固定成本(运费、人工、手续)是 S 元,每件商品在仓库放一年的持有成本是 H 元。每次进 Q 件,一年要订 D/Q 次,平均库存约 Q/2 件。

年总成本 = 订货成本 DS/Q + 持有成本 HQ/2。进得少,前一项大;进得多,后一项大——又是一个“先降后升”的曲线。对 Q 求导并令其为 0,得到 Q* = √(2DS/H)。这就是 1913 年由哈里斯提出、今天仍写在每本供应链教材里的经济订货批量公式。

示例:一年卖 10,000 件,每次订货 200 元,每件年持有成本 4 元,则 Q* = √(2 × 10000 × 200 ÷ 4) = 1000 件,一年订 10 次。第 13 章会讲它在真实供应链里的样子和局限。

6.2判断形状:二阶导数与凹凸

导数为 0 的点不一定是山顶,也可能是谷底。怎么区分?看二阶导数。

  • 在山顶,坡度从正变成负——坡度在减小,二阶导数 < 0,曲线像一顶帽子(向下弯)。
  • 在谷底,坡度从负变成正——坡度在增大,二阶导数 > 0,曲线像一只碗(向上弯)。

盒子问题里,V ″(5) = −120 < 0,所以 x = 5 确实是山顶。二阶导数描述的“弯曲方向”在很多地方都有用:经济学家用它判断“边际收益递减”,工程师用它计算横梁的弯曲,公路设计师用它控制弯道的急缓。

6.3从平均推断瞬间:区间测速

高速公路上有一种测速方式叫区间测速:在一段路的两端各设一个抓拍点,用“路程 ÷ 用时”算你的平均速度。

一段 20 公里的区间,限速 100 公里/小时。你用了 10 分钟跑完,平均时速 120。你辩解说:“我每一刻都没超过 100,只是平均起来快。”这可能吗?

不可能。如果你每一刻都不超过 100 公里/小时,那么 10 分钟最多只能走 100 × 1/6 ≈ 16.7 公里,走不完 20 公里。

更进一步,数学能保证的不只是“某一刻超过了 100”,而是:一定有某一刻,你的瞬时速度恰好等于 120。这就是下面要讲的中值定理。

0121020时间(分钟)位置(公里)终点起点紫:起点到终点的割线 = 平均速度红:某一刻的切线,与割线平行

图 6-2把位置随时间画成曲线。起点到终点的连线(紫色割线)的斜率是平均速度。把这条割线平行移动,它总会在某处恰好“擦过”曲线,成为一条切线(红色)——那一刻的瞬时速度等于平均速度。

拉格朗日中值定理说:如果一个量在一段区间上连续、并且处处光滑(可导),那么区间里至少有一个时刻,它的瞬时变化率恰好等于整段的平均变化率。它是连接“平均”和“瞬间”的桥梁,也是后面证明微积分基本定理时的关键一步。

6.4用直线代替曲线:线性近似

“放大看,曲线就变直”不只是一个比喻,它可以直接拿来算数。

问:√4.1 约等于多少?我们知道 √4 = 2,而 √x 的导数是 1/(2√x),在 x = 4 处等于 1/4。意思是:在 4 附近,x 每增加 1,√x 大约增加 1/4。现在 x 增加了 0.1,所以:

√4.1 ≈ 2 + 0.1 × 1/4 = 2.025真值 2.02485…,误差不到万分之二

一般地,在已知点 a 附近,f(a + Δx) ≈ f(a) + f ′(a)·Δx。这叫线性近似。工程师每天都在用它:把复杂的非线性系统在工作点附近“拉直”,就能用简单得多的线性方法去分析和控制。飞机的自动驾驶、电网的稳定分析,很多都从这一步开始。

放大看,曲线就变直——所以在足够小的范围里,可以放心地用直线去算。

6.5解方程:牛顿法

你的计算器怎样算出 √2?一种经典的办法,是牛顿本人提出的。

求 √2,就是求方程 x² − 2 = 0 的根,也就是曲线 y = x² − 2 与横轴的交点。牛顿的想法是:先随便猜一个点,在那里用切线代替曲线,顺着切线滑到横轴上,得到一个更好的猜测;再重复。

12348xy = x² − 21.8331.462第 3 步:1.41500;第 4 步:1.41421真值 √2 = 1.41421…

图 6-3从 x = 3 出发,沿切线滑到 1.833;从 1.833 再做切线,滑到 1.462;再一步到 1.41500,第四步到 1.41421。每一步正确的位数大约翻一倍。

x新 = x旧 − f(x旧) / f ′(x旧)

牛顿法的收敛速度非常快:离答案足够近之后,每迭代一次,正确的小数位数大约翻一倍。今天的科学计算软件、工程仿真、金融定价里,到处是它和它的变体。

6.6化解 0/0:洛必达法则

第 4 章的 sin x / x 在 x → 0 时是 0/0 的样子。有了导数,可以换一个角度看:分子分母都从 0 出发,谁“跑得快”,比值就由谁决定。而“跑多快”正是导数:

lim sin x / x = lim cos x / 1 = 1

这就是洛必达法则:0/0 型的极限,可以换成分子分母各自导数之比的极限(在一定条件下)。一个小趣闻:这条法则以第 2 章那位写了第一本教科书的洛必达命名,但它实际上是约翰·伯努利发现的——1694 年,洛必达与伯努利约定:每年付给伯努利 300 里弗尔,伯努利则把自己的新发现告诉洛必达、不告诉别人。这条法则就是伯努利当年在信里寄给洛必达的,后来被写进了洛必达的教科书。

6.7一环扣一环:相关变化率

给气球打气,每秒打进 100 立方厘米。当半径是 10 厘米时,半径每秒长多少?

体积 V = (4/3)πr³。两边对时间求导(链式法则):dV/dt = 4πr²·dr/dt。代入 dV/dt = 100、r = 10:

dr/dt = 100 ÷ (4π × 100) ≈ 0.08 厘米/秒

这解释了一个你可能注意过的现象:刚开始吹气球时,它“噌”地鼓起来;越往后越吹不大。原因是同样的气量,要摊到越来越大的表面积 4πr² 上。

表 6-1 导数的五种用法
用法核心想法现实例子
找最优最高点、最低点处导数为 0剪纸盒、经济订货批量、定价
判断形状二阶导数的正负决定弯曲方向边际收益递减、横梁弯曲
从平均推断瞬间中值定理区间测速
近似计算局部用切线代替曲线√4.1、小角度近似、系统线性化
解方程沿切线逼近根计算器开方、工程仿真
本章带走

导数是一把多用途的工具:它能找最优、判形状、连接平均与瞬间、化曲为直、逼近方程的根。

  • 最优点处导数为 0;二阶导数判断是山顶还是谷底。
  • 伏笔 E 的答案:经济订货批量 Q* = √(2DS/H)。
  • 中值定理:平均速度 120,必有一刻恰好 120——区间测速的数学依据。
  • 线性近似与牛顿法,都是“放大看,曲线就变直”的直接应用。

于是,下一个问题导数把整体拆成了每一刻的变化。反过来——已知每一刻的变化,能不能拼回整体?

7Chapter 7 · The integral

积分:切碎,再加起来

已知每一刻的变化,怎样求出总量?

上一章留下的问题:导数把整体拆成了每一刻的变化。反过来——已知每一刻的变化,能不能拼回整体?

从这一章开始,我们换到仪表盘的另一块表:里程表。前四章一直在做“放大”,这一章做“切碎,再加起来”。

7.1从速度回到路程

匀速每小时 60 公里,开 2 小时。把速度画成随时间变化的图,是什么形状?

一条水平线,高度 60。

这条线下方、从 0 到 2 小时的那块区域,面积是多少?

长方形,60 × 2 = 120。咦,正好是路程。

是巧合吗?

不是。长方形的面积是“高 × 宽”,这里高是速度、宽是时间,“速度 × 时间”本来就是路程。

那么速度在变的时候呢?

图像不再是长方形,而是一条曲线。但只要把它切成很多窄条,每一窄条都近似是个长方形……路程就应该是曲线下方的面积。

012306090小时速度60 × 2 = 120匀速:面积 = 长方形012306090小时速度面积 = 路程变速:面积 = 曲线下的面积

图 7-1速度-时间图下方的面积就是路程。匀速时是长方形,一次乘法就够;变速时是曲边形,需要“切碎再加起来”。

这个发现很重要:任何“变化率 × 时间”的累积,都可以画成“曲线下的面积”。于是,“求总量”这个物理问题,变成了“求面积”这个几何问题——正是阿基米德和刘徽研究了两千年的问题。

7.2切得越细,越准

我们用一个具体例子动手算。一辆车从静止附近起步,速度(米/秒)是 v(t) = 2 + 0.5t²。前 4 秒走了多远?

把 4 秒切成 4 段,每段 1 秒。用每段开头那一刻的速度代表整段:第 1 段 2 米/秒,第 2 段 2.5,第 3 段 4,第 4 段 6.5。路程 ≈ (2 + 2.5 + 4 + 6.5) × 1 = 15 米。

速度一直在增加,用“开头的速度”会系统性地低估。切得更细,低估就更少:

044 条:15.00 米048 条:16.75 米0432 条:18.17 米真值 18.67 米;切得越细,缺掉的小三角越少

图 7-2同一块面积,切成 4 条、8 条、32 条。每条都用左端的高度,所以每条顶上都缺一个小三角;条越窄,小三角越小,总和越接近真值。

表 7-1 切得越细,结果越接近 18.667 米
切成几条左端点求和(米)中点求和(米)
415.00018.500
816.75018.625
1617.68818.656
3218.17218.664
10018.50718.666
100018.65118.667
→ ∞→ 18.667→ 18.667
动手试一试 · 细条滑块

增加细条数,看锯齿怎样贴近曲线,误差怎样缩小。

两列数字从不同方向逼近同一个数,这又是第 4 章的极限。我们把这个极限值定义为曲线下的精确面积。取点方式(左端、中点、右端)不影响极限,只影响逼近得快慢——中点法快得多。

7.3积分号:一句话写下整个过程

上面的过程是:切成 n 条,每条宽 Δt,高 v(t),面积 v(t)·Δt,全部加起来,再让 n 趋于无穷。莱布尼茨把这整件事压缩成了一个符号:

∫04 v(t) dt∫ 是拉长的 S(summa,总和);v(t) dt 是一条细条的面积;下标 0、上标 4 是从哪里加到哪里

∫积分号 · integral sign

怎么读:中文读“积分”,∫04 v(t) dt 读作“v(t) 从 0 到 4 的积分”或“从 0 到 4 积分 v(t) d t”;英文 integral /ˈɪntɪɡrəl/(也读 /ɪnˈtɛɡrəl/),读作 “the integral from 0 to 4 of v of t, dee t”。

从哪来:它不是希腊字母,而是拉长的拉丁字母 s——17 世纪手写体里的“长 s”。莱布尼茨 1675 年 10 月 29 日在手稿中首次使用,取自拉丁文 summa(总和)。

为什么选它:积分就是“求和”的极限,所以用“和”的首字母。它和 d 是一对:d 表示“差”,∫ 表示“和”,一拆一合,正好对应第 8 章的基本定理。

这个符号可以当成一句话来读:“从 0 到 4,把每一条‘高 v(t)、宽 dt’的细条面积全部加起来。”它叫定积分。1854 年,德国数学家黎曼用极限给它下了严格的定义(论文 1868 年才正式发表),所以“切成细条求和”也叫黎曼和。

类比

积分像一台收银机的“小计”功能。顾客一件一件地扫商品:每件商品是“单价 × 数量”,收银机不停地累加。积分做的是同一件事,只不过它扫的“商品”是无穷多条无限窄的细条。∫ 就是那个不停累加的“小计”键。

积分是
  • “变化率 × 微小区间”的无限细分之和
  • 一切“累积”问题的通用写法:面积只是它最直观的画像
积分不只是
  • “求面积”:它同样可以求路程、电量、药量、体积、功
  • 近似值:极限是精确的;只有“切有限条”时才是近似
切成碎片,再加起来。

7.4面积也可以是负的

如果车开到一半开始倒车,速度变成负数,积分会怎样?

036−33时间速度+ 前进− 倒车积分 = 上方面积 − 下方面积 = 净位移(这里恰好回到原点)

图 7-3速度先正后负。横轴上方(绿色)的面积记为正,代表前进;下方(红色)记为负,代表后退。积分把两者相加,得到的是净位移,而不是走过的总路程。

这正是积分“带符号”的含义:它算的是净累积。银行账户里,一天的净变化 = 收入 − 支出;一个月的余额变化 = 每天净变化的累加。水库、库存、碳排放的“净值”,都遵循同样的逻辑。如果想要“总共走了多少路”,就要对速度的绝对值积分。

7.5一切累积都是积分

“面积”只是积分的一种画像。只要一个量是“某个变化率在一段范围上的累积”,它就是一个积分:

表 7-2 同一个模式:变化率 × 微小区间,再加起来
变化率(被积函数)× 微小区间积分得到
速度(米/秒)dt(秒)路程(米)
用电功率(千瓦)dt(小时)电量(千瓦时,即“度”)
河水流量(立方米/秒)dt(秒)水库蓄水量(立方米)
截面积(平方米)dx(米)体积(立方米)
血药浓度(毫克/升)dt(小时)药时曲线下面积 AUC,衡量药物“总暴露量”
力(牛顿)dx(米)功(焦耳)

请注意单位:被积函数的单位 × 区间的单位 = 积分的单位。这是第 3 章“斜率单位里有个‘每’”的镜像:导数除以输入单位,积分乘以输入单位。第 8 章会说明,这种镜像关系不是巧合。

表中第五行的 AUC,就与伏笔 D(为什么一日三次吃药)有关:药物的疗效和毒性,很大程度上取决于血药浓度曲线下的面积。第 13 章会细讲。

7.6平均值:把起伏摊平

天气预报说“今天平均气温 22°C”,这个平均是怎么算的?如果只取最高温和最低温的平均,会忽略一天里气温停留在不同温度的时间长短。更精确的办法是:把一天的温度曲线积分,再除以 24 小时。

平均值 = ∫ab f(x) dx ÷ (b − a)

几何上,它是把曲线下起伏的面积“推平”成一个等面积的长方形,长方形的高就是平均值。前面那辆车 4 秒走了 18.667 米,平均速度就是 18.667 ÷ 4 ≈ 4.67 米/秒。

7.7一个令人疲惫的问题

为了得到 18.667,我们把面积切成了 1000 条,做了 1000 次乘法和 1000 次加法。如果每道积分题都要这样算,你还愿意学微积分吗?

多半不愿意。17 世纪以前的数学家正是困在这里:每个面积都要设计一套巧妙的切法,费时费力,而且常常算不出精确值。

但你也许已经从表 7-1 的最后一行里嗅到了一丝线索:18.667 = 56/3,一个很“整齐”的数。整齐的答案,往往意味着背后有一条捷径。

本章带走

积分 = 把变化率切成无数细条、每条乘以宽度、全部加起来的极限。

  • 速度曲线下的面积就是路程;任何“变化率的累积”都能画成面积。
  • 黎曼和:切得越细越准;极限值就是定积分 ∫ab f(x) dx。
  • 积分带符号:横轴下方的面积为负,结果是“净”累积。
  • 平均值 = 积分 ÷ 区间长度。
  • 困难:按定义求和太慢,需要捷径。

于是,下一个问题用无穷多个小矩形求和,理论上可行,实际上累死人。有没有捷径?

8Chapter 8 · The fundamental theorem

基本定理:两个问题原是一个

为什么“求变化率”与“求总量”互为逆运算?

上一章留下的问题:用无穷多个小矩形求和,理论上可行,实际上累死人。有没有捷径?

这一章是全书的高峰。你已经搭好了所有需要的积木:函数、极限、导数、积分。现在只差最后一步——看清它们之间的一条隐秘通道。牛顿和莱布尼茨争了一辈子的,说到底就是“谁先看清了这条通道”。

8.1让面积“动”起来

第 7 章的积分都有固定的起点和终点,比如从 0 到 4。现在我们做一个小改动:固定起点,让终点变成一个可以移动的 x。

想象曲线下有一道幕布,从左边的起点一直拉到 x。幕布盖住的面积,记作 A(x)。你把幕布往右拉,A 就变大;往左推,A 就变小。A(x) 是一个新的函数,叫面积函数,也叫累积函数。

在汽车的例子里,f 是速度表的读数,A(x) 就是到时刻 x 为止里程表跳过的公里数。

8.2先下个注

现在提一个问题。请先别往下读,凭直觉下个注。

面积函数 A(x) 是一个函数,它当然也有导数,也就是“幕布往右拉时,面积增长的速度”。这个速度等于什么?(A)一个很复杂的式子;(B)与 f 无关;(C)就是 f(x) 本身。

答案是(C):A ′(x) = f(x)。面积此刻增长的速度,恰好等于曲线此刻的高度。

如果你选对了,很可能是想起了第 1 章的仪表盘:里程表跳动的速度,就是速度表的读数。下一节说明为什么。

8.3揭晓:细条的高度就是增长率

0x512xfA(x)细条:高 ≈ f(x),宽 h0x548xA此处斜率 = f(x)上图:面积越攒越多 下图:攒的速度 = 上图此刻的高度

图 8-1上图:幕布从 0 拉到 x,面积为 A(x)。再往右拉一小步 h,面积多出一条细条(琥珀色),它的高约为 f(x)、宽为 h。下图:A(x) 的曲线;它在 x 处的切线斜率,恰好等于上图曲线在 x 处的高度。

推理只有三步,每一步你都已经会了:

  1. 幕布从 x 拉到 x + h,面积增加了 A(x + h) − A(x),就是那条琥珀色细条。
  2. 细条很窄,它的顶几乎是平的,高度约为 f(x),所以面积 ≈ f(x) × h。
  3. 于是 [A(x + h) − A(x)] / h ≈ f(x)。让 h 趋于 0,左边正是导数的定义,“约等于”变成了“等于”。

A ′(x) = f(x)对连续的 f 成立。严格证明时,细条的真实高度被夹在细条内 f 的最小值和最大值之间,h → 0 时两者都趋于 f(x)——这正是第 4 章的夹逼定理

这就是微积分基本定理的第一部分:对一个函数先积分、再求导,就回到了它自己。网页版封面的“微积分显微镜”一直在展示这件事:无论你把点移到哪里,“面积此刻增长的速度”总等于“曲线此刻的高度”。

变化率与总量,是同一件事的两面。

8.4捷径:牛顿–莱布尼茨公式

这个发现立刻给出了第 7 章苦苦寻找的捷径。

我们要求 ∫04 (2 + 0.5t²) dt。与其切 1000 条,能不能换个问法?

基本定理说,面积函数的导数就是被积函数。那么只要找到一个函数 F,使它的导数恰好是 2 + 0.5t²……

这相当于把求导倒过来做。什么函数求导后得到 2?

2t。

什么函数求导后得到 0.5t²?

幂法则倒着用:t³ 求导得 3t²,所以 t³/6 求导得 0.5t²。合起来,F(t) = 2t + t³/6。

那面积呢?

面积 = F 在终点的值减去在起点的值:F(4) − F(0) = 8 + 64/6 − 0 = 56/3 ≈ 18.667。和切 1000 条的结果一致,而且是精确值。

这就是基本定理的第二部分,通常称为牛顿–莱布尼茨公式:

∫ab f(x) dx = F(b) − F(a),其中 F ′ = f求总量 = 找一个“导数是 f”的函数,再做一次减法

用汽车的话说:想知道这 4 秒走了多远,不必把每一瞬间的速度都加起来,只需看看里程表:结束时的读数减去开始时的读数。这句话几乎是废话;但把它翻译成数学,就把“无穷多项求和”变成了“一次减法”。

再试一个历史名题。阿基米德用无穷多个三角形求出了抛物线下的面积。现在,求 y = x² 在 0 到 1 之间的面积:x³/3 的导数是 x²,所以面积 = 1/3 − 0 = 1/3。一行字,就完成了阿基米德那部专著的核心计算。

8.5原函数与那个神秘的 +C

“导数是 f 的函数 F”叫作 f 的原函数。它不唯一:2t + t³/6 的导数是 2 + 0.5t²,2t + t³/6 + 100 的导数也是,因为常数的导数是 0。

类比

两辆车在同一时刻以完全相同的速度曲线行驶,一辆的里程表从 0 开始,另一辆从 35,000 公里开始。它们的里程表读数永远差 35,000,但跳动的速度一模一样。速度表只能告诉你“跳了多少”,告诉不了你“从哪里开始跳”。

所以,所有原函数写在一起是 F(x) + C,C 是任意常数,这叫不定积分,记作 ∫f(x) dx。求定积分时做减法,C 会自动抵消,所以用哪个原函数都一样。而在后面的微分方程里,C 需要由“起点的读数”来确定,它有一个专门的名字:初始条件。

8.6两条路,原来是一条

总量 F里程表 · 位置变化率 f速度表 · 速度求导:放大看积分:切碎,再加起来F ′ = f∫ f dx = F + C

图 8-2从总量到变化率是求导(放大看);从变化率回到总量是积分(切碎再加起来)。基本定理说:这两条路互为往返。

现在,回到第 1 章那张仪表盘:

  • 从里程表推速度表,是求导:放大看,曲线就变直。
  • 从速度表推里程表,是积分:切成碎片,再加起来。
  • 二者互为逆运算:变化率与总量,是同一件事的两面。

三句口号,至此全部推导完毕。

基本定理说的是
  • 积分再求导,回到原函数:A ′ = f
  • 求定积分只需找一个原函数,再做减法
基本定理没说
  • 原函数总能用公式写出来(很多写不出,第 9 章会遇到)
  • “切碎求和”从此没用了(原函数写不出时,计算机依然靠求和)

8.7为什么这是人类思想的一座高峰

第 2 章说,阿基米德会求面积,费马会求切线,巴罗已经用几何的形式触到了两者的互逆关系。那牛顿和莱布尼茨的功劳到底在哪里?

答案就在这一章。他们第一次清楚地看到并证明了求切线与求面积是互逆的,并把它变成了一套任何人照着做都能算出答案的算法。从此,两千年里一个个需要天才灵感的“手工艺品”,变成了流水线上的标准件:会求导,就会求积分。

它的影响远远超出数学。自然规律大多以“变化率”的形式出现:牛顿第二定律说力决定加速度,热传导定律说温差决定热量流动的速率。人类能直接写下的是“每一刻怎么变”,而想知道的是“最后会怎样”。基本定理正是连接这两者的桥。没有它,就没有经典力学、没有天气预报,也没有下一章要讲的“用变化的规律预言未来”。

这也回答了序章的问题:“一瞬间有多快”为什么值得发明一门新数学?因为算出“一瞬间”只是第一步;一旦看清它和“总量”之间的这座桥,人类就握住了从自然规律推算整个世界的钥匙。难怪牛顿和莱布尼茨后来都那么在意“谁先看清了它”。

本章带走

微积分基本定理:积分与求导互为逆运算;求总量 = 找原函数、做一次减法。

  • 面积函数 A(x) 的增长速度等于曲线此刻的高度:A ′(x) = f(x)。
  • 牛顿–莱布尼茨公式:∫ab f dx = F(b) − F(a),里程表终点读数减起点读数。
  • 原函数差一个常数 C;C 由起点(初始条件)决定。
  • 牛顿与莱布尼茨的核心贡献:看清这座桥,并把它变成通用算法。

于是,下一个问题基本定理把积分变成了“找原函数”。可原函数不总是一眼看得出——怎么找?找到后又能算什么?

9Chapter 9 · Techniques and applications

积分的工具箱与应用

怎样真正算出积分,它又能算出什么?

上一章留下的问题:基本定理把积分变成了“找原函数”。可原函数不总是一眼看得出——怎么找?找到后又能算什么?

基本定理说,积分就是“求导倒过来”。那么,每一条求导法则倒过来,就是一件积分工具。本章前半部分打开工具箱,后半部分用它去算体积、算功,并回收两个伏笔:火箭能跑多快,以及怎样“看见”地下。

9.1换元法:链式法则倒着用

求 ∫ 2x cos(x²) dx。

这个被积函数像不像某个链式法则的结果?

像。sin(x²) 求导,外层得 cos(x²),内层 x² 求导得 2x,乘起来正是 2x cos(x²)。

所以原函数是?

sin(x²) + C。

系统的做法叫换元:令 u = x²,则 du = 2x dx,原式变成 ∫ cos u du = sin u + C。莱布尼茨的记号又一次替我们思考:du = 2x dx 这一步,看起来就像把 du/dx = 2x 两边同乘 dx。

9.2分部积分:乘积法则倒着用

乘积法则是 (uv)′ = u′v + uv′。两边积分再移项,得到:

∫ u dv = uv − ∫ v du把一个难积的式子,换成一个可能好积的式子

例:∫ xex dx。令 u = x、dv = ex dx,则 = xex − ∫ ex dx = (x − 1)ex + C。你可以求导验证:结果正是 xex。

表 9-1 积分工具箱:每件工具都是一条求导法则的倒影
求导法则倒过来的积分工具何时想到它
幂法则 (xn+1)′ = (n+1)xn∫xn dx = xn+1/(n+1) + C(n ≠ −1)多项式
(ln x)′ = 1/x∫ dx/x = ln|x| + C幂法则唯一的例外 n = −1
(ex)′ = ex∫ ex dx = ex + C增长、衰减
链式法则换元法被积函数里有“内层函数及其导数”
乘积法则分部积分两类不同函数相乘
—数值积分(切碎求和)找不到原函数时

最后一行不是凑数的。有些函数看起来很简单,原函数却无法用初等函数写出来。最著名的例子是 e−x²——统计学里的“钟形曲线”(正态分布)就是它。考试成绩、身高分布、测量误差都近似服从这条曲线,而计算“落在某个范围内的概率”就是求它下方的面积。对这种积分,人们只能回到第 7 章:切碎,再加起来,交给计算机去算。

9.3体积:把立体切成薄片

第 2 章的祖暅说:每一层截面相同,体积就相同。积分把这个思想变成了计算:体积 = 每一层截面积 × 厚度,全部加起来。

04xy = √x每片 ≈ π·y²·dx体积 = ∫₀⁴ π·x dx = 8π ≈ 25.1

图 9-1把曲线 y = √x 绕 x 轴转一圈,得到一只碗状(旋转抛物面)的立体。切成薄圆片,每片是半径为 y、厚为 dx 的圆盘,体积 πy²dx = πx dx。从 0 加到 4:πx²/2 在 4 处的值减去在 0 处的值,等于 8π。

工厂计算储罐的容量、医院用 CT 断层图像估算肿瘤体积、开普勒当年计算酒桶的容积,用的都是这个办法。CT 本身更是积分的杰作:X 射线穿过人体时,衰减的总量是沿路径的积分;从成千上万个角度的积分反推出每一处的密度,是 1917 年拉东就解决了的数学问题,五十多年后才被做成机器,1979 年的诺贝尔生理学或医学奖授予了 CT 的两位开创者。

9.4功:力随位置变化时

把一个箱子推动 10 米,用力 50 牛,做功 50 × 10 = 500 焦耳。如果力是变化的呢?比如把卫星从地面送向太空,地球的引力随距离的平方减小:离地心越远,拉得越轻。

办法依然是切碎:把路程切成一小段一小段,每段里力几乎不变,功 ≈ 力 × 小段长度,再全部加起来。所以功 = ∫ 力 dx。

9.5无限长的路,有限的功:反常积分

要让一个物体彻底摆脱地球引力,需要把它从地面(离地心 R)一直推到无穷远。积分的上限是“∞”,这叫反常积分。它的值定义为:先积到一个很远的 b,再让 b 趋于无穷,看结果去往哪里——又是极限。

15101xy = 1/x:面积无限y = 1/x²:面积 = 1都趋于 0,但 1/x² 趋于 0 得更快,快到“尾巴”加起来有限

图 9-2两条曲线都向右无限延伸、都趋于 0。1/x² 下方从 1 到无穷远的面积恰好是 1;1/x 下方的面积却会无限增长。趋于 0 还不够,要趋于 0 得“足够快”。

引力正是按 1/x² 减弱的,所以把物体推到无穷远所需的功是有限的:∫R∞ GMm/x² dx = GMm/R。(G 是引力常数,M 是地球质量,m 是物体质量。)让物体的动能 ½mv² 等于这个功,就得到逃逸速度:

v = √(2GM/R) = √(2gR) ≈ √(2 × 9.8 × 6,371,000) ≈ 11.2 公里/秒即第二宇宙速度;g 为地表重力加速度,R 为地球半径(米)

11.2 公里/秒大约是步枪子弹速度的十几倍,从北京到上海只需不到两分钟。假如引力是按 1/x 减弱的,逃逸所需的功就是无穷大,任何火箭都飞不出地球。宇宙的几何,藏在一个反常积分是否收敛里。

火箭一路减重,最后能跑多快?火箭每喷出一小团燃气(质量 dm,相对火箭的喷射速度 ve),自己就获得一点点速度 dv。动量守恒给出:m·dv = −ve·dm,也就是 dv = −ve·dm/m。

这是一个“每一刻怎样变”的规律。把它从起飞质量 m0 积分到燃料烧完后的质量 mf,用上表 9-1 的 ∫dm/m = ln m:

Δv = ve · ln(m0 / mf)齐奥尔科夫斯基火箭方程,1903 年发表

示例:喷射速度约 3 公里/秒,起飞时燃料占总质量的 90%(m0/mf = 10),Δv = 3 × ln 10 ≈ 6.9 公里/秒。进入近地轨道需要约 7.8 公里/秒,加上克服空气阻力和重力的损耗,实际约需 9 公里/秒以上。对数长得很慢:质量比从 10 翻到 100,速度也只多出 6.9 公里/秒。这就是火箭要分级、要一路扔掉空壳的原因。第 13 章还会继续这个故事。

看不见地下,怎样知道那里有什么?方法之一是测重力。地下如果埋着一块密度较大的矿体,它会让正上方的重力略微变大(通常只有地表重力的千万分之一到百万分之几,要用专门的精密重力仪才测得出)。地面上某一点感受到的额外引力,等于把地下切成无数小块,每一小块按“质量 ÷ 距离²”贡献一点点,再全部加起来——这是一个三维积分。

勘探者做的是反方向的事:在地面上测出一大片重力读数,反推地下的密度分布。第 13 章会讲另一种更强大的办法——听地震波的回声。

9.6找不到原函数时:数值积分

工程和科学里遇到的积分,多数没有漂亮的原函数;有时连被积函数本身都没有公式,只有一串传感器读数。这时,计算机回到最朴素的办法:切碎,再加起来。

不过它加得比左端点法聪明。梯形法把每条的顶连成斜线,辛普森法用一小段抛物线去贴合顶部。对光滑的曲线,同样切 100 条,辛普森法的误差往往比左端点法小好几个数量级。你手机里的计步器估算路程、电表累计度数、飞控计算机积算位置,都在做这件事。

本章带走

积分工具都是求导法则的倒影;找不到原函数时,就回到“切碎,再加起来”。

  • 换元 = 链式法则倒用;分部积分 = 乘积法则倒用。
  • 体积 = ∫ 截面积 dx;功 = ∫ 力 dx。
  • 反常积分:积到无穷远也可能有限;逃逸速度约 11.2 公里/秒。
  • 伏笔 F:火箭方程 Δv = ve ln(m0/mf),来自积分 dm/m。
  • 伏笔 B:地下物体的重力效应是一个积分,勘探是在反推它。

于是,下一个问题到此为止都是已知函数去求导或积分。现实常常反过来:只知道变化的规律,不知道函数本身。

10Chapter 10 · e and differential equations

e 与微分方程:用变化的规律预言未来

只知道变化的规律,怎样推出未来?

上一章留下的问题:到此为止都是已知函数去求导或积分。现实常常反过来:只知道变化的规律,不知道函数本身。

牛顿说“力决定加速度”,没说物体下一秒在哪里;医生知道“药物每小时被代谢掉一定比例”,却想知道 12 小时后血液里还剩多少。自然界递给我们的,几乎总是变化的规律,而我们想要的是结果。把前者变成后者,就是本章的主题:微分方程。我们从一笔存款说起。

10.1利息拆得无限细:e 的诞生

1683 年,瑞士数学家雅各布·伯努利(第 2 章里那对兄弟中的哥哥)研究了一个问题:年利率 100%,存 1 元,如果把利息拆开、更频繁地计入本金,一年后能拿到多少?

一年结一次息呢?

1 × (1 + 1) = 2 元。

半年结一次,每次利率 50%,利息再生利息呢?

(1 + 0.5)² = 2.25 元,多了 0.25。

每月一次呢?每天一次呢?

(1 + 1/12)¹² ≈ 2.613,(1 + 1/365)³⁶⁵ ≈ 2.715。越拆越多……会不会无限多?

再看每小时:(1 + 1/8760)⁸⁷⁶⁰ ≈ 2.7181。你觉得呢?

增长越来越慢,好像被一堵看不见的墙挡住了。

2.02.22.42.6一年后金额(元)e ≈ 2.71828年2.000半年2.250季2.441月2.613周2.693日2.715时2.718计息周期(越往右越细)

图 10-1计息越频繁,一年后的金额越多,但增量越来越小,最终贴近一条水平线:e ≈ 2.71828。这是第 4 章那个极限 (1 + 1/n)n 的来历。

表 10-1 计息频率与一年后的金额(本金 1 元)
计息方式年利率 100%年利率 3%
每年一次2.0000001.030000
每月一次2.6130351.030416
每天一次2.7145671.030453
每小时一次2.7181271.030454
连续计息(无穷细)e ≈ 2.718282e0.03 ≈ 1.030455

利息拆得无限细,钱会不会无限多?不会。拆得越细,利息确实越多,但多出来的部分越来越少,最终有一个上限:年利率为 r 时,连续计息一年后的本息是 er 倍。对年化 3% 的理财来说,“按日计息”和“按年计息”一年只差万分之四点五左右;1 万元一年多出约 4.5 元。按日计息的意义主要在于灵活——随存随取、按天计息——而不是让钱多出很多。

真正让钱“滚起来”的不是拆得细,而是时间长。第 13 章会讲复利与时间的关系,以及金融里另一个著名的微积分公式。

动手试一试 · 复利计算器

选择计息频率、输入年利率,看一年后的本息怎样逼近 e 的幂。

计息频率  年利率(%)

10.2e 为什么特别:导数等于自己

连续计息的钱有一个性质:此刻增长的速度,正比于此刻的金额。账户里有 1 万元,每年按 3% 的速度长;长到 2 万元,就按每年 600 元的速度长。

写成方程:y ′ = r · y。满足它的函数是 y = C·ert。特别地,当 r = 1 时,ex 的导数就是它自己——这是表 5-1 里那一行的来历,也是 e 在数学中无处不在的原因:凡是“增长速度正比于自身大小”的东西,都会长成 e 的指数形状。

e ln自然常数 e 与自然对数 ln

怎么读:e 读作字母 e,英文 /iː/,中文近似“衣”;也叫“自然常数”或“欧拉数”。ln x 读作“自然对数 x”,英文常读 “log of x” 或逐字母读 “L-N x” /ɛl ɛn ɛks/。

从哪来:伯努利 1683 年发现了这个数,但用字母 e 表示它是欧拉在 18 世纪开始的。ln 很可能是拉丁文 logarithmus naturalis(自然对数)的缩写,1893 年美国数学家斯特林厄姆已这样使用。

为什么选它:常见说法是 e 取自 exponential(指数)的首字母;也有人说欧拉只是按顺序取了一个还没被占用的元音字母。欧拉本人没有留下解释,所以这一点只能存疑。

e 的反函数叫自然对数 ln。它回答相反的问题:要长到原来的几倍,需要多久?比如年利率 3% 连续复利,翻倍需要 ln 2 ÷ 0.03 ≈ 23 年。金融界常用的“72 法则”(72 ÷ 年利率百分数 ≈ 翻倍年数,这里是 24 年)就是它的心算版。

10.3微分方程:只写规律,不写答案

y ′ = ry 这样的式子,叫微分方程:它不直接告诉你 y 是什么,只告诉你 y 每一刻怎样变化。解微分方程,就是从“变化的规律”反推出“函数本身”。

类比

微分方程像一份导航指令:“在每个路口,都朝着离家最近的方向走一步。”它没有画出整条路线,但只要知道你从哪里出发(初始条件),每一步都照做,路线就完全确定了。第 8 章那个“+C”,就是起点。

微分方程是
  • 一条描述“每一刻怎样变”的规律,外加一个起点
  • 自然科学最常用的语言:运动、传热、电路、化学反应、人口
微分方程不是
  • 总能写出公式解的方程:大多数只能靠计算机一步步算
  • 对未来的保证:规律本身若不准,或结果对起点过于敏感,预言也会失准

10.4衰减:同一个方程,四种面孔

把 r 换成负数,y ′ = −ky,得到的是指数衰减:减少的速度正比于剩下的量。它的特征是半衰期——无论剩多少,减半所需的时间都一样,等于 ln 2 ÷ k。

061218242550100小时浓度(%)502512.5下降速度 = −k × 当前浓度

图 10-2一种半衰期为 6 小时的药物(示例参数),血药浓度每过 6 小时减半。曲线任一点的下降速度(红色切线的斜率)都与当时的浓度成正比。

  • 药物代谢:大多数药物在体内的清除近似遵循这个规律。医生根据半衰期决定服药间隔——这是伏笔 D 的前一半,后一半留给下一章。
  • 放射性衰变:碳-14 的半衰期约为 5730 年。生物死后停止吸收碳-14,测出遗骸中碳-14 还剩多少,就能反推它死了多久。剩 1/2 约 5730 年,剩 1/4 约 11,460 年。这就是考古学家给古代遗址“断代”的依据,也是伏笔 B 中“地下的年代”那一半。
  • 冷却:一杯热咖啡降温的速度,正比于它与室温的温差(牛顿冷却定律)。用它可以算出一杯 90°C 的茶,放多久才降到适合入口的温度。
  • 电容放电:电路里的电容放电时,电压同样按指数衰减。

10.5增长总有天花板:logistic 曲线

指数增长不可能永远持续。细菌在培养皿里起初成倍分裂,但营养和空间有限,增长终会放缓。1838 年,比利时数学家韦吕勒在 y ′ = ry 上加了一个“刹车”:

y ′ = ry(1 − y/K)K 是环境容量。y 很小时,括号约等于 1,近似指数增长;y 接近 K 时,括号趋于 0,增长停止

010205001000时间数量环境容量 K指数:y′ = rylogistic:y′ = ry(1 − y/K)

图 10-3起初两条曲线几乎重合;随后指数曲线一飞冲天,logistic 曲线则在接近环境容量时放缓,形成 S 形。

S 形曲线随处可见:新产品的市场渗透、传染病的累计感染人数、一个人学一门技能的熟练度。它提醒我们:看到一段指数增长时,要问天花板在哪里。把早期的指数趋势直接外推,是预测里最常见的错误之一。

10.6解不出公式怎么办:一步一步走出未来

大多数微分方程写不出公式解。但这难不倒我们,因为方程本身就是一份“每一步怎么走”的说明书。

最朴素的走法叫欧拉法(由 18 世纪的欧拉提出):站在起点,用方程算出此刻的斜率;沿着这个斜率走一小步;到了新位置,再算斜率,再走一步……这就是“放大看,曲线就变直”的又一次应用:在一小步之内,把曲线当作直线。

01234204060ty真值 e⁴ ≈ 54.639.416红:步长 1紫:步长 0.25

图 10-4用欧拉法求解 y ′ = y、y(0) = 1。步长为 1 时,4 步后得到 16;步长为 0.25 时,16 步后得到约 39.4;真值 e⁴ ≈ 54.6。步子越小越准,但计算量越大。

实际工程中用的是更精巧的方法(比如龙格–库塔法),思想却完全一样:把未来切成小段,每段按当下的变化规律走一步,再把所有步子累加起来——先放大,再切碎求和。

明天的天空还没发生,计算机凭什么算出来?答案就是图 10-4 的放大版。大气的运动遵循几条物理定律:动量守恒(风怎样被气压差推动)、质量守恒、能量守恒、水汽的蒸发与凝结。它们都是微分方程,说的是“此刻的空气状态决定了下一刻怎样变”。

气象局先测出“此刻”全球的气温、气压、湿度、风(初始条件),再让超级计算机按方程一小步、一小步地往前推,推出明天、后天的天空。难点在于规模:要把整个大气切成数以亿计的小格子。第 13 章会讲这件事的历史与现状。

本章带走

微分方程只写“每一刻怎样变”;给定起点,一步步累加,就能推出未来。

  • e ≈ 2.71828:利息拆得无限细的极限;伏笔 C:钱不会无限多,er 是上限。
  • ex 的导数是自己:凡增长速度正比于自身的量,都长成指数形状。
  • 衰减 y ′ = −ky:药物、碳-14、冷却、放电,半衰期 = ln 2 / k。
  • logistic:增长有天花板,S 形曲线。
  • 欧拉法:沿当前斜率走一小步,再重复——天气预报的原理。

于是,下一个问题计算器只会加减乘除,它是怎样算出 eˣ 和 sin x 的?

11Chapter 11 · Series

级数:用无穷个简单拼出复杂

计算器只会加减乘除,它怎样算出 sin x 和 eˣ?

上一章留下的问题:计算器只会加减乘除,它是怎样算出 eˣ 和 sin x 的?

计算器的芯片里只有加法器和乘法器,却能在一瞬间给出 sin 0.5 = 0.4794255…。它是怎么做到的?答案藏在第 4 章芝诺那个问题里:无穷多个数加起来,可以是一个有限的数。如果能把 sin x 写成无穷多个简单项之和,只取前几项,就能用加减乘除把它算到任意精度。

11.1几何级数:最听话的无穷加法

第 4 章的 1/2 + 1/4 + 1/8 + … = 1,是几何级数的一个例子:每一项都是前一项乘以同一个比 q。只要 |q| < 1,它就有一个整齐的和:

a + aq + aq² + aq³ + … = a / (1 − q)推导:设和为 S,则 qS 恰好是 S 去掉第一项,所以 S − qS = a

这个公式能解释一个让很多人不服气的等式:0.999… = 1。0.999… 就是 0.9 + 0.09 + 0.009 + …,首项 0.9,公比 0.1,和为 0.9 ÷ 0.9 = 1。它不是“无限接近 1”,而是等于 1——因为一个无穷级数的值,被定义为它的极限。

11.2每一项都趋于 0,和却可能无穷大

如果一个无穷级数的每一项都越来越小、趋于 0,它的和一定是有限的吗?

不一定。最著名的反例是调和级数:1 + 1/2 + 1/3 + 1/4 + …。每一项都趋于 0,但和会无限增大,只是增大得极慢。

表 11-1 调和级数的前 n 项和:慢,但永不停止
项数 n前 n 项和
102.93
1005.19
1,0007.49
1,000,00014.39

为什么会发散?把项分组看:1/3 + 1/4 > 1/2,1/5 + … + 1/8 > 1/2,1/9 + … + 1/16 > 1/2……可以分出无穷多组,每组都大于 1/2,加起来当然没有尽头。这和第 9 章的图 9-2 是同一个现象:1/x 下的面积无限,1/x² 下的面积有限。

教训是:各项趋于 0 只是必要条件,还要趋于 0 得足够快。数学家为此发明了许多“收敛判别法”,核心思路都是拿待判断的级数去和几何级数这样“已知听话”的级数比较:如果它的项最终缩小得比某个公比小于 1 的几何级数还快,它就一定收敛。

11.3泰勒级数:用多项式模仿任何光滑函数

多项式(a + bx + cx² + …)是计算器最擅长的东西:只需要乘法和加法。那么,能不能造一个多项式,让它在某点附近和 sin x 一模一样?

先只要求在 x = 0 处“值相同”。sin 0 等于多少?

0。所以常数项是 0。

再要求“斜率相同”。sin x 在 0 处的导数是 cos 0 = 1。

那就加一项 x,它在 0 处的斜率也是 1。这就是第 4 章的 sin x ≈ x——放大看,曲线就变直。

再要求“弯曲程度”也相同,也就是二阶导数、三阶导数……都相同呢?

那就一项一项往上加:每多匹配一阶导数,就多一项,模仿得就更像。

按这个思路一直做下去,得到的就是泰勒级数(英国数学家泰勒于 1715 年发表):

sin x = x − x³/3! + x⁵/5! − x⁷/7! + …
ex = 1 + x + x²/2! + x³/3! + x⁴/4! + …n!(读作 n 的阶乘)= 1 × 2 × … × n,增长极快,所以后面的项缩小得极快

−6−336−11xsin x1 次3 次5 次7 次

图 11-1黑色是 sin x。只取 1 项(x)时,只在原点附近贴合;取到 3 次、5 次、7 次项时,贴合的范围一次比一次宽。只要项数足够多,在任何有限范围内都能贴到你想要的精度。

类比

泰勒级数像一位模仿秀演员逐步学一个人:先学他站的位置(函数值),再学他走路的方向(一阶导数),再学他转弯的习惯(二阶导数),再学更细微的小动作……学得越细,越难分辨真假。

泰勒级数能做到
  • 用加减乘除,把 sin、cos、eˣ 等算到任意精度
  • 在展开点附近,用前几项给出很好的近似
泰勒级数不保证
  • 对任何函数、在任何范围都收敛(例如 ln(1 + x) 的级数只在 −1 < x ≤ 1 内收敛)
  • 离展开点很远时,前几项仍然准确

11.4亲手当一回计算器

算 sin 0.5,只取前三项:

0.5 − 0.125/6 + 0.03125/120 = 0.5 − 0.0208333 + 0.0002604 = 0.4794271真值 0.4794255…,只用三项,误差已不到百万分之二

算 e(即 e¹),取前 7 项:1 + 1 + 0.5 + 0.16667 + 0.04167 + 0.00833 + 0.00139 = 2.71806;取前 11 项,得到 2.7182818,已经准确到小数点后 7 位。

实际的计算器和电脑芯片还会配合其他技巧:先利用周期性把角度缩到很小的范围(小角度时级数收敛得最快),再用专门优化过的多项式;有些芯片用一种叫 CORDIC 的“旋转逼近”算法。但核心思想始终是同一个:用有限次的加减乘除,去逼近一个无穷过程的极限。

11.5误差:知道自己错多少,才敢用

工程师从不追求“精确”,而是追求“误差已知且足够小”。泰勒级数的好处在于,截断之后的误差可以估计:对于正负交替、项越来越小的级数(比如 sin),误差不超过第一个被扔掉的项。上面算 sin 0.5 时,扔掉的第一项是 0.5⁷/5040 ≈ 0.0000016,实际误差正在这个范围内。

“够用就好”是微积分思维的重要一面:GPS 定位、飞行控制、股票期权定价,所用的都不是精确值,而是误差被严格控制的近似值。

11.6一日三次:药物的几何级数

现在回到伏笔 D 的后一半。

024487212小时浓度(单剂峰值 = 1)稳态峰值 = 211.51.751.875

图 11-2每 8 小时服一剂,药物半衰期也是 8 小时(示例参数)。下一剂服下时,上一剂还剩一半,于是浓度锯齿状上升:每次服药后的峰值为 1、1.5、1.75、1.875……逐渐稳定在 2。

服下第 n 剂后的峰值是 1 + 1/2 + 1/4 + … + 1/2n−1,一个几何级数。服药次数趋于无穷时,峰值趋于 1 ÷ (1 − 1/2) = 2。药量不会无限累积,而是停在一个稳态上。几次服药后,离稳态就不远了:4 个半衰期后达到稳态的约 94%,5 个半衰期后约 97%。这就是为什么很多药要“连续服用几天才起效”。

为什么一日三次,而不是一次吃三片?比较两种服法(半衰期 8 小时,每天总量 3 片,示例参数):

表 11-2 同样的日剂量,不同的服法(单位:一片药的峰值浓度)
服法稳态峰值稳态谷值峰谷比
每 8 小时 1 片2.01.02 倍
每 24 小时 3 片3.430.438 倍

一次吃三片,峰值高出七成以上,更容易越过“中毒线”;到下一次服药前又跌到很低,可能掉出“有效线”。分三次服,浓度就被稳定在有效和安全之间的“治疗窗”里。稳态峰值来自几何级数:每 24 小时 3 片时,一天后只剩 1/8,峰值 = 3 ÷ (1 − 1/8) ≈ 3.43。第 13 章会讲药厂怎样用积分评估一种药。

11.7另一种无穷拼图:傅里叶级数

泰勒用多项式拼函数。1807 年前后,法国的傅里叶在研究热传导时提出了另一种拼法:任何周期性的信号,都可以拆成许多不同频率的正弦波之和。

这个想法后来无处不在:音乐播放器把声音拆成频率,扔掉人耳听不见的成分来压缩文件;降噪耳机测出噪声的频率,再发出反相的声波去抵消;图片压缩格式 JPEG 用的是它的近亲(离散余弦变换);Wi-Fi 和 5G 同时在许多频率上传输数据。它们都在做同一件事:把复杂的东西拆成无穷多个简单的东西,只保留需要的那些。

本章带走

无穷多个简单项可以拼出一个复杂函数;截取前几项,就能用加减乘除把它算到需要的精度。

  • 几何级数 a/(1 − q);0.999… = 1。
  • 调和级数发散:各项趋于 0 还不够,要足够快。
  • 泰勒级数:逐阶匹配导数,用多项式模仿函数;计算器由此算出 sin 与 eˣ。
  • 伏笔 D:药量按几何级数趋于稳态;分次服用让浓度留在治疗窗内。
  • 傅里叶级数:把信号拆成正弦波,现代音频、图像、通信都依赖它。

于是,下一个问题到目前为止,变化只沿一个方向。气温却同时随经度、纬度、高度和时间变化——怎么办?

12Chapter 12 · Many variables

走向多维:偏导数、梯度与重积分

当变化来自多个方向,微积分如何扩展?

上一章留下的问题:到目前为止,变化只沿一个方向。气温却同时随经度、纬度、高度和时间变化——怎么办?

好消息是:多元微积分没有新思想。它只是把“放大”和“切碎再加起来”搬到了更多的方向上。这一章是大一微积分的最后一块积木,也是通往天气预报、人工智能和工程优化的门。

12.1多元函数:一张等高线地图

地面上每一点都有一个海拔。给出经度和纬度两个输入,得到一个输出——这是一个二元函数 h(x, y)。

它的图像是一片起伏的曲面,很难画在纸上。地图绘制者早就找到了办法:把海拔相同的点连成线,画成等高线地图。你在徒步地图上见过它:线越密的地方,坡越陡。天气图上的等压线、等温线,也是同一回事。

12.2偏导数:一次只动一个

你站在山坡上,问“这里有多陡”,能给出一个数吗?

不能。朝东走可能很陡,朝北走可能是平的。坡度取决于方向。

那先简化一下:只朝正东走,坡度是多少?

只动 x、把 y 当常数,这就回到了一元函数,照常求导就行。

再只朝正北走呢?

只动 y、把 x 当常数,再求一次导。

“只让一个变量动、其他变量冻住”时求出的导数,叫偏导数,记作 ∂h/∂x 和 ∂h/∂y。例如 h = x² + 3xy:∂h/∂x = 2x + 3y,∂h/∂y = 3x。

∂偏微分号 · partial

怎么读:中文读“偏”,∂h/∂x 读作“h 对 x 的偏导数”或“偏 h 偏 x”;英文 partial /ˈpɑːʃəl/(美式 /ˈpɑːrʃəl/),读作 “partial h, partial x”。也有人读作 “del”,但容易和下面的 ∇ 混淆。

从哪来:它不是希腊字母,而是手写体小写 d 的一种弯曲写法。法国数学家孔多塞 1770 年已用弯曲的 d 表示“偏差分”;勒让德 1786 年第一次用它写偏导数,后来自己放弃了;1841 年德国数学家雅可比重新启用,从此固定下来。

为什么选它:它仍然是一个“d”,提醒你这是导数;只是故意写弯,告诉你“只对这一个变量求导,其他变量不动”,和普通的 d 区分开。

偏导数是经济学家最爱的工具之一。“其他条件不变的情况下,价格每涨 1 元,销量减少多少”——这句经济学里的套话,说的正是一个偏导数。

12.3梯度:最陡的上坡

把两个偏导数排成一对,(∂h/∂x, ∂h/∂y),就得到一个箭头,叫梯度,记作 ∇h。它有两个性质:

  1. 方向:指向该点上坡最陡的方向,且总是与等高线垂直。
  2. 长度:就是那个最陡方向上的坡度。

∇nabla(纳布拉)· 梯度算子

怎么读:英文读 nabla /ˈnæblə/(常见词典未收这个词,此为按拼写的通行读法),中文近似“纳布拉”;也常读作 del /dɛl/。∇h 读作 “nabla h” 或 “grad h”(梯度 h,grad /ɡræd/ 是 gradient 的缩写)。

从哪来:它的形状是一个倒过来的大写 Δ。19 世纪中叶,爱尔兰数学家哈密顿引入了这个“向量微分算子”,最初写成横放的三角形;1867 年苏格兰物理学家泰特确立了今天的 ∇ 写法。“nabla”这个名字是史密斯 1870 年写信向泰特建议的,取自一种形状相似的古代竖琴(希腊语 νάβλα),泰特和麦克斯韦在通信里用它时常带着玩笑的口吻。“del”这个读法则由吉布斯和威尔逊 1901 年的《向量分析》倡导。

为什么选它:Δ 表示“变化”,把它倒过来,表示把各个方向上的变化率(偏导数)收集到一起,组成一个指向最陡上坡的箭头。

主峰小山包

图 12-1两座山丘的等高线地图。每个红色箭头是该点的梯度:它垂直于等高线、指向上坡;等高线越密,箭头越长。沿任何其他方向的坡度,都等于梯度在那个方向上的投影,这叫方向导数。

为什么一对偏导数就能决定所有方向的坡度?还是“放大看,曲线就变直”:光滑的曲面放大到足够细,局部就是一块平面(切平面)。平面的倾斜只需要两个数来描述——东西方向的坡度和南北方向的坡度。一元时是“曲线局部是直线”,二元时是“曲面局部是平面”,思想完全一样。

放大看,曲面就变平。

12.4梯度下降:人工智能怎样学习

反过来走,沿负梯度方向,就是最陡的下坡。这一点支撑着今天整个人工智能行业。

训练一个 AI 模型,本质是在找一组参数,让“预测误差”最小。误差是参数的函数——只不过参数不是 2 个,而可能是几十亿、上千亿个。你无法画出这座“误差地形”,但可以站在当前位置,算出梯度,然后朝下坡方向迈一小步;再算梯度,再迈一步……

起点碗底

图 12-2在一只椭圆形的“误差碗”里做梯度下降。每一步都沿当前最陡的下坡方向走一小段,折线逐渐落到碗底。碗越扁,路线越容易左右摇摆,这正是工程师要调节“步长”(学习率)的原因。

那么梯度怎么算?模型是一层套一层的函数,参数的影响要穿过许多层才能传到最终误差上——这正是第 5 章的链式法则。把链式法则从输出端往输入端系统地倒推一遍,就能高效地算出误差对每个参数的偏导数,这个算法叫反向传播。一个大语言模型的训练,就是在一个维度极高的曲面上,反复执行“链式法则求梯度、沿负梯度走一步”。

梯度下降能做到
  • 在无法画出、维度极高的地形上找到低处
  • 只需要知道“此处”的坡度,不需要看到全局
梯度下降不保证
  • 找到全局最低点:它可能停在某个局部的小坑里
  • 走得快:步子太大会来回震荡,太小又慢

12.5重积分:切成小方柱

一元积分把区间切成小段;二元积分就把平面区域切成小方格。求一座山的土方量:把地图切成许多小方格,每格上方的土柱体积 ≈ 海拔 × 方格面积,全部加起来。

体积 = ∬ h(x, y) dx dy两个积分号:在两个方向上切碎,再加起来

实际计算时,常常一次只积一个方向:先把每一条东西向的“切片”积出面积,再把所有切片沿南北方向积起来。这正是祖暅“切片求体积”思想的直接推广。三重积分同理:第 9 章说的地下矿体产生的重力,就是在三维空间里把每一小块的贡献加起来。

12.6有约束的最优:拉格朗日一瞥

现实中的优化几乎总有约束:预算有限、材料有限、时间有限。比如要在“成本不超过 100 万”的前提下让产量最大。

拉格朗日在 18 世纪给出了一个几何上很漂亮的答案:在最优点,目标函数的等高线恰好与约束曲线相切——两者的梯度指向同一条直线。如果不相切,沿着约束线再挪一点,目标还能更好。这个方法叫拉格朗日乘子法,是经济学、工程设计、机器学习中约束优化的起点。

12.7偏微分方程:天气、热与波

第 10 章的微分方程只有一个自变量(时间)。当一个量同时随空间和时间变化——比如一块铁板上各点的温度、大气中各处的风速——描述它的规律就要用偏导数写成,叫偏微分方程。

  • 热传导方程:某点温度升高的速度,取决于它比周围平均温度低多少。热量总是从热处流向冷处,把起伏抹平。
  • 波动方程:描述声波、地震波、光波怎样传播。第 13 章的地震勘探靠的就是它。
  • 纳维–斯托克斯方程:描述流体(空气、水)的运动,是天气预报和飞机设计的核心。

这些方程大多没有公式解,只能用第 10 章的思路:把空间切成网格、把时间切成小步,让计算机一格一格、一步一步地推。

表 12-1 从一维到多维:思想不变,方向变多
一元微积分多元微积分不变的思想
导数 dy/dx偏导数、梯度 ∇f放大看:曲线变直线,曲面变平面
导数为 0 找极值梯度为 0 找极值;梯度下降山顶与谷底处不升不降
定积分 ∫二重、三重积分 ∬、∭切碎再加起来
常微分方程偏微分方程只写每一刻、每一处怎样变
本章带走

多元微积分没有新思想:放大看,曲面就变平;切成小方柱,再加起来。

  • 偏导数:一次只动一个变量;梯度:最陡上坡的方向与坡度。
  • 梯度下降 + 链式法则(反向传播)= 今天训练人工智能的核心。
  • 重积分:在多个方向上切碎求和;土方量、质量、重力都这样算。
  • 拉格朗日乘子:约束下的最优点,等高线与约束线相切。
  • 偏微分方程描述热、波和流体;天气预报就是求解它们。

于是,下一个问题工具已经齐全。走出教室,看它们在真实世界里怎样工作。

13Chapter 13 · Calculus at work

微积分在现实世界

天气、地质、复利、制药、供应链、航天……微积分在其中做了什么?

上一章留下的问题:工具已经齐全。走出教室,看它们在真实世界里怎样工作。

第 1 章在你的一天里埋下了六个伏笔。一路走来,每个伏笔都被回收了一部分。现在,所有工具都已在手,我们逐一把它们讲完。每一节都从当初那个问题开始。

13.1天气预报:把明天算出来

07:30 出门前看天气

明天的天空还没有发生,计算机凭什么把它算出来?

第一次世界大战期间,英国气象学家理查森在法国的公谊会救护队服务。他在服役间隙做了一件前无古人的事:只用纸笔和计算尺,按照大气物理的微分方程,从 1910 年 5 月 20 日早上 7 点的观测数据出发,手算两个格点上未来 6 小时的天气。这项计算花了他至少 6 周。

结果是一次惨败:他算出的气压在 6 小时内上升了 145 百帕,而实际气压几乎没变。几十年后,气象学家林奇重新检查他的计算,发现方法本身是对的,问题出在初始数据里的“噪声”没有被平滑掉;加上平滑后,理查森的结果基本准确。

1922 年,理查森把这项工作写成《用数值方法预报天气》出版,并在书中畅想了一座“预报工厂”:一座像剧院一样的大厅,环形的楼座绕满四周,墙上画成一幅世界地图,64,000 名计算员(他的估算:32 × 2000)分坐各处,每人负责一小块区域,在指挥者的协调下同步计算,才能让计算速度赶上天气变化的速度。

理查森的梦想,是在 1950 年才第一次实现的。那一年,查尼、冯·诺伊曼等人用电子计算机 ENIAC 完成了第一次数值天气预报:算出 24 小时后的天气,大约也用了 24 小时。今天的做法与理查森一脉相承:

① 把大气切成网格② 每格一组数气温T气压p湿度q风(东西)u风(南北)v③ 一步步推向未来此刻 tt + Δtt + 2Δt……明天每一步:新状态 = 旧状态 + 变化率 × Δt(变化率由物理方程给出)全球数以亿计的格子,每一步都要算一遍

图 13-1数值天气预报的三步:把大气切成三维网格;每个格子记录气温、气压、湿度和风;按物理方程算出每格此刻的变化率,乘以一小段时间,得到下一刻的状态,再一步步推向明天。这就是第 10 章欧拉法的全球版。

  • 放大:物理定律都写成偏微分方程(第 12 章),告诉我们每个格子“此刻”怎样变化。
  • 切碎,再加起来:时间切成几分钟一步,每一步把变化率乘以步长、累加到当前状态上(第 10 章)。
  • 规模:欧洲中期天气预报中心(ECMWF)的全球模式,水平格距约 9 公里,垂直方向分为 137 层。粗略算一下:地球表面约 5.1 亿平方公里,每格约 81 平方公里,约 630 万个“气柱”,再乘以 137 层,约 8.6 亿个格点——理查森的 64,000 人即使算上一辈子也跟不上。

进步是实实在在的。据气象学家鲍尔等人 2015 年在《自然》杂志上的综述(估算),数值预报的准确度大约每十年提前一天:今天的 5 天预报,和几十年前的 3 天预报差不多准。

那“降水概率 70%”又是什么意思?1961 年,气象学家洛伦茨在计算机模拟中偶然发现,大气模型对初始条件高度敏感,初值里微小的误差会随时间放大;他在 1963 年发表了这一发现。1972 年他的一次报告题为“巴西一只蝴蝶扇动翅膀,会在得克萨斯州引发龙卷风吗?”,“蝴蝶效应”由此得名。也是第 10 章说的“微分方程不是对未来的保证”。于是气象中心会把初始状态做几十种微小扰动,各算一遍,得到一组“集合预报”;再结合统计校正,给出概率。按美国国家气象局的定义,它指在规定时段内(比如某个 12 小时),预报区域里任意一点出现可测量降水的概率。直观地说:在类似的条件下,大约 10 次里有 7 次会下雨。

13.2地质勘测:听地下的回声

08:10 地铁穿过城市地下

看不见地下,怎样知道几公里深处是什么?

第 9 章讲了重力勘探,第 10 章讲了碳-14 测年。地质学家手里最强大的工具,是第三种:地震勘探。

砂岩页岩石灰岩(可能含油)震源检波器实线:浅界面回波(先到)虚线:深界面回波(后到)

图 13-2在地面用炸药或可控震源车制造一次“人工地震”,声波向地下传播,在不同岩层的分界面上反射回来,被一排检波器记录下来。界面越深,回波到得越晚。

最简单的情形里,深度 ≈ 波速 × 回波时间 ÷ 2。可是岩层的波速随深度变化,界面也高低起伏。真正的计算要用到第 12 章的波动方程:它描述声波在每一点怎样随时间变化。勘探公司做的是一个巨大的反问题——先猜一个地下结构,用波动方程模拟出“应该听到的回声”,与实际记录比较,再用第 12 章的梯度下降去修改猜测,直到模拟与实测吻合。这种方法叫“全波形反演”,计算量之大,让石油勘探长期是超级计算机的大用户。

同样的数学也在保护城市。地铁和高楼动工前,工程师用浅层地震和钻孔资料判断地下有没有溶洞、流沙;地震预警系统则利用两种地震波的速度差:纵波(P 波)每秒约 6 公里,横波(S 波)约 3.5 公里且破坏性更强。离震中 100 公里的城市,P 波约 17 秒到达,S 波约 29 秒到达,中间十来秒就是逃生时间。

13.3投资复利:时间才是指数的燃料

12:00 午休时看一眼银行 App

如果把计息拆得无限细,钱会不会变得无限多?

第 10 章已经回答:不会,上限是 er。拆细带来的差别很小,真正让复利显出威力的是时间。连续复利下,本金 P 在 t 年后变成 Pert,t 在指数上。

表 13-1 1 万元连续复利:时间比利率拆分重要得多(示例)
年数年化 3%年化 7%
1013,49920,138
2018,22140,552
3024,59681,662
4033,201164,446

年化 7% 时约每 10 年翻一倍(ln 2 ÷ 0.07 ≈ 9.9 年)。示例不代表任何产品的收益承诺。

表里有两个值得反思的地方。第一,利率从 3% 到 7%,差距看似只有 4 个百分点,40 年后结果却相差约 5 倍——因为差距在指数上被放大。第二,前 10 年的增长看起来平淡无奇,后 10 年才“起飞”。指数增长的曲线在早期几乎是平的,这让很多人过早放弃。

金融里另一个著名的微积分成果是 1973 年的布莱克–斯科尔斯公式,用来给期权定价。它把股价看作随机波动的量,推导出一个偏微分方程——形式上和第 12 章的热传导方程是近亲。1997 年,斯科尔斯和默顿因此获得诺贝尔经济学奖(布莱克已于 1995 年去世)。

微积分在金融里能做
  • 精确计算复利、折现、按揭月供
  • 在给定假设下为风险定价、衡量敏感度
微积分不能做
  • 预测明天的股价
  • 保证模型的假设(比如“波动率不变”)在真实市场里成立

13.4生物制药:一条曲线下的面积

13:00 饭后吃药

为什么是分三次,而不是早上一次吃三片?天天吃,药会不会在身体里越积越多?

第 11 章用几何级数回答了:药量会趋于稳态,不会无限累积;分次服用让浓度留在治疗窗里。现在看药厂怎样用微积分评价一种药。

06121824246小时血药浓度Cmax(峰浓度)TmaxAUC = ∫ C(t) dt曲线下面积 = 总暴露量

图 13-3口服一剂药后的“药时曲线”(示例参数):药物先被吸收,浓度上升到峰值 Cmax,随后按半衰期衰减。三个关键数字:峰浓度 Cmax、达峰时间 Tmax,以及曲线下面积 AUC。

这条曲线本身来自微分方程。药理学家把人体简化为几个“房室”(比如胃肠道和血液),写出药物在房室之间转移、被清除的速率方程:吸收的速度正比于胃肠道里剩下的药,清除的速度正比于血液里的药。解出来就是图中先升后降的曲线。

AUC 是一个积分:∫ C(t) dt,衡量身体在整个过程中“总共暴露于”多少药物(第 7 章表 7-2)。它在药品审批中举足轻重。仿制药要上市,必须证明与原研药生物等效:在健康受试者身上测量两者的 AUC 和 Cmax,其比值的 90% 置信区间必须落在 80% 到 125% 之间。你在药店买到的每一盒仿制药背后,都有一次这样的积分比较。

13.5供应链:平坦的谷底

18:30 外卖与快递

一次进多少货最划算?这个“最划算”的点在哪里?

第 6 章已经求出经济订货批量 Q* = √(2DS/H)。把成本曲线画出来,还能看到一个公式里看不到的道理。

10002000300050001000020000每次订货量 Q年成本(元)最低点:Q* = 1000,总成本 4000订货成本 DS/Q持有成本 HQ/2总成本

图 13-4第 6 章的示例:年需求 10,000 件、每次订货 200 元、每件年持有成本 4 元。订货成本随订货量增大而下降,持有成本随之上升,总成本在 Q = 1000 处最低,为 4000 元。注意谷底非常平坦。

如果仓库经理算错了,每次订 800 件或 1250 件,而不是 1000 件,总成本会高出多少?

只高出 2.5%。订 800 件:2500 + 1600 = 4100 元;订 1250 件:1600 + 2500 = 4100 元。订货量偏离最优值 20%–25%,成本只多 2.5%。

原因在于最优点处导数为 0:谷底的切线是水平的,“放大看,曲线就变直”,而且变成了一条平线。离最优点不远时,成本几乎不变。这给了管理者一个重要的启示:在最优点附近,不必追求精确,把精力放在防止大偏差上更划算。

真实的供应链比 EOQ 复杂得多:需求在波动,运输有延迟,一个仓库要为上千种商品同时决策。这时,导数的另一面开始发挥作用。著名的牛鞭效应说的是:零售端需求的一点小波动,传到批发商、厂家、原料商那里会越放越大。原因之一是每一级都在对下游订单的变化率作出反应,而且总想多备一点以防万一,于是每经过一级,波动都被放大一次。理解这一点的公司会共享终端销售数据,让上游看到真实的需求,而不是被放大过的订单。

13.6航空航天:从火箭方程到轨道

21:00 新闻里的火箭发射

一枚火箭装多少燃料,最后才能跑到足够快、进入太空?

1102040604812质量比Δv(公里/秒)入轨约需 9.4(含损耗,估算)10 → 6.923 → 9.4Δv = vₑ · ln(起飞质量 ÷ 燃尽质量)

图 13-5火箭方程 Δv = ve ln(m0/mf),喷射速度取 3 公里/秒(示例)。质量比为 10 时只有 6.9 公里/秒;要达到入轨所需的约 9.4 公里/秒(含重力与空气阻力损耗,估算),质量比要约 23,即 96% 的起飞质量都是燃料。

第 9 章从 dv = −ve dm/m 积分得到了火箭方程。对数增长得太慢,单级火箭几乎不可能把有效载荷送入轨道,于是工程师想出了多级火箭:第一级燃料烧完就把沉重的空壳扔掉,第二级从一个更轻的起点重新开始“对数增长”。每一级的 Δv 相加,就能达到单级做不到的速度。

火箭进入太空后,它的运动由牛顿第二定律决定:加速度 = 引力 ÷ 质量。这是一个微分方程,轨道计算就是一步步对它积分。1962 年,美国宇航员格伦执行美国首次载人环绕地球轨道飞行前,坚持要求 NASA 的数学家凯瑟琳·约翰逊用台式机械计算器,把 IBM 电子计算机给出的轨道数据逐项核算一遍——她的故事后来被拍成了电影《隐藏人物》。今天,空间站的轨道维持、探测器的借力飞行、卫星星座的调度,依然是这件事的延续。

在大气层里,飞机的升力等于机翼表面每一处压力的积分;飞控计算机每秒数百次地读取加速度计,把加速度积分成速度、再积分成位置。每一次平稳的起降背后,都有无数次“切碎,再加起来”。

13.7更多:同一套思想,无数种面孔

  • 医学影像:CT 从成千上万个角度的积分反推人体各处的密度(第 9 章)。
  • 流行病:1927 年克马克和麦肯德里克提出 SIR 模型,用三个微分方程描述易感者、感染者、康复者之间的转移。它给出了“基本再生数” R0 的概念:R0 > 1 时疫情扩散,< 1 时消退;群体免疫的门槛约为 1 − 1/R0。
  • 人工智能:梯度下降与反向传播(第 12 章)。
  • 手机导航:芯片把加速度和角速度不断积分,在隧道里暂时没有卫星信号时推算你的位置。
  • 新能源:电池管理系统对电流积分,估算“还剩多少电”。
表 13-2 六个伏笔的全景:问题、工具与章节
伏笔领域核心问题微积分工具章节
A天气预报从此刻推出明天偏微分方程、欧拉法(数值积分)10、12
B地质勘测从地面信号反推地下重力积分、指数衰减、波动方程、梯度下降9、10、12
C投资复利拆细与时间的效应极限 e、指数函数、偏微分方程4、10
D生物制药给药方案与药物评价微分方程、几何级数、积分 AUC7、10、11
E供应链最优订货与波动放大导数为 0 求最优、变化率6
F航空航天速度与轨道积分、对数、微分方程9、10

回头看这张表,你会发现一个共同的结构:人们能直接写下的,是“每一刻、每一处怎样变化”;人们想知道的,是“整体会怎样”。放大,是为了写下局部的规律;切碎再加起来,是为了从局部拼出整体;而基本定理保证了这两者可以互相转换。

放大写下规律,累加得到结果。
本章带走

六个日常伏笔背后是同一个结构:已知局部的变化规律,求整体的结果。

  • 天气预报:偏微分方程 + 一步步数值积分;蝴蝶效应让预报只能给出概率。
  • 地质勘测:用波动方程模拟回声,再反推地下结构。
  • 复利:拆细有上限 er,时间才是指数的燃料。
  • 制药:药时曲线来自微分方程,AUC 是积分,仿制药要过 80%–125% 这道关。
  • 供应链:最优点附近的成本曲线很平坦;牛鞭效应是变化率被逐级放大。
  • 航天:火箭方程来自积分,对数增长太慢,所以要分级。

于是,下一个问题工具可以借用,思维却要自己长出来。拥有与缺乏“微积分思维”,差别在哪里?

14Epilogue · Thinking in calculus

微积分思维:回到速度表上的 72

微积分思维是什么?读完你该带走什么?

上一章留下的问题:工具可以借用,思维却要自己长出来。拥有与缺乏“微积分思维”,差别在哪里?

你也许永远不会亲手去解一个偏微分方程。天气预报有气象局,药物剂量有医生,火箭有工程师。那么,读完这本书,你的生活会有什么不同?

本章的回答是:微积分真正值得带走的,是一种看世界的方式。它由四个习惯组成。

14.1习惯一:放大看——复杂的东西,局部往往简单

面对一个复杂的问题,先问:在足够小的范围里,它像什么简单的东西?

一个大项目看起来无从下手,但它的下一周往往是清楚的;一个非线性的系统难以预测,但在工作点附近可以当作线性处理。这是“放大看,曲线就变直”的日常版本。

它同时带着一条警告:局部的直线不能无限延长。把过去三个月的趋势画成直线外推十年,就是把切线当成了曲线。线性近似的价值,恰恰在于你知道它在哪里失效。

14.2习惯二:看变化率,而不只看数值

缺乏这个习惯的人看“水平”:今天多少钱,这个月多少人。拥有它的人还会看变化率和变化率的变化率:它在涨还是在跌?涨得越来越快还是越来越慢?

经济学里的“边际”就是导数:再多生产一件,成本多多少;再多学一小时,成绩多多少。很多决策的关键不在于总量,而在于边际——当边际收益降到边际成本以下,就该停了。

14.3习惯三:区分“流量”和“存量”——总量是累积出来的

浴缸里的水量是存量,水龙头的流速和下水口的流速是流量。存量是净流量的积分。这个区分简单,却常常被忽视。

一个国家的碳排放量今年比去年减少了 5%,大气中的二氧化碳浓度会下降吗?

不一定,而且在短期内通常不会。排放量是流量(往浴缸里放水的速度),大气中的浓度是存量(浴缸里的水)。只要排放的速度仍然大于海洋和植被吸收的速度,浴缸里的水就会继续上涨,只是涨得慢一点。

要让浓度下降,必须让净流量变成负数。混淆流量和存量,是公共讨论里最常见的误解之一。同样的道理适用于国债与赤字、体重与热量、知识与每日学习。

积分思维还提醒我们:微小的流量,经过足够长的时间,会累积成巨大的存量。每天多读 20 页书,一年约 7300 页,二三十本书;第 13 章的复利表里,40 年的差距大部分出现在最后十几年。

14.4习惯四:逼近与误差——够用,并且知道差多少

极限教会我们:无法一步到达的东西,可以通过无穷多个小步逼近;而逼近的每一步,都应当知道自己离目标还差多少。

这个习惯让人既不完美主义,也不草率。第 13 章的订货问题里,最优点附近的成本曲线很平:偏离 20%,成本只多 2.5%。许多决策都是如此,在最优点附近不必苛求,要防的是大偏差。第 11 章的泰勒级数则说明:一个好的近似,一定附带一个误差估计。

微积分思维是
  • 放大看局部、盯住变化率、区分流量与存量、带着误差去逼近
  • 从“每一刻怎样变”推出“整体会怎样”的习惯
微积分思维不是
  • 会背公式、会做习题
  • 认为一切都能算准:蝴蝶效应和模型假设都在提醒我们谦逊

14.5有与没有的差别

表 14-1 同一个情境,两种看法
情境缺乏微积分思维拥有微积分思维
新闻:“物价涨幅收窄”物价要降了物价仍在涨,只是涨得慢了(二阶导数为负)
碳排放下降 5%问题开始解决了存量仍在增加,除非净流量转负
某指标连续三个月翻倍照这个速度,一年后涨 4000 倍指数增长必有天花板,S 形曲线的拐点在哪?
区间测速:平均 120,限速 100我每一刻都没超速平均 120,必有一刻恰好 120(中值定理)
理财产品“按日计息”拆得越细收益越高拆细有上限 er,时间和利率才是关键
一日三次服药一次吃三片更省事分次服用,浓度才留在治疗窗里
纠结方案是否最优必须找到唯一最佳最优点附近很平坦,先排除大偏差
天气预报说 70% 降水预报又不准初值敏感的系统只能给出概率

14.6回到速度表上的 72

现在,让我们回到本书的第一页:速度表上那个“此刻 72 公里/小时”。

开篇时,它是一个悖论:一瞬间走 0 米、用 0 秒,0 ÷ 0 没有意义。现在你可以这样解释它:在那一刻前后取越来越短的时间段,平均速度去往的那个数是 72——它是一个极限,是位置曲线在那一点的切线斜率,是导数。你还知道,把这块表每一刻的读数“切碎再加起来”,就得到里程表上的数字;而这两块表之间的关系,就是微积分基本定理。

再回想那两个年轻人。一个在英格兰乡间从运动出发,一个在巴黎从数学新手起步;走的路不同,看到的却是同一座山。他们后来为“谁先登顶”争论了多年,可站在三百年后回看,更值得记住的是另一件事:微积分本身,就是一个积分。芝诺提出问题,阿基米德和刘徽切片逼近,开普勒、卡瓦列里、费马、巴罗各自摸到边角,牛顿和莱布尼茨看清了那座桥,柯西和魏尔斯特拉斯打牢了地基——无数人的微小贡献,在两千年里一点一点累加成了今天的总量。

1676 年初(当时英国用旧历,记为 1675 年),牛顿在给胡克的信里写下那句名言:“如果说我看得更远,那是因为我站在巨人的肩膀上。”这句话,正是积分的精神。读完这本书,你也站到了这些巨人的肩膀上。

认知阶梯:每一级一块积木、一个隐喻、一句话函数自动售货机谁随着谁变斜率“每”字变化率 = Δy/Δx极限机票上的目的地问去往哪里,不问到了哪里导数显微镜放大看,曲线就变直导数的用途山顶的坡度为零最优、近似、牛顿法积分收银机的小计切成碎片,再加起来基本定理仪表盘的两块表变化率与总量是两面积分工具法则的倒影换元、分部、体积、功微分方程导航指令只写规律,一步步走出未来级数模仿秀演员无穷个简单拼出复杂多元等高线地图曲面放大就变平;梯度下降

图 14-1全书认知阶梯总图。每一级是一块积木,配一个隐喻和一句可以复述的话。如果你能从下往上把这十一句话讲给别人听,你就已经理解了大一微积分的骨架。

14.7核心贡献

  1. 微积分只回答两个问题。此刻变得多快(导数)?一共变了多少(积分)?麻烦只来自“不均匀”。
  2. 放大看,曲线就变直。光滑的变化在足够小的尺度上是线性的;导数就是那条直线的斜率,极限让“一瞬间”有了严格的意义。
  3. 切成碎片,再加起来。不均匀的总量,切成近似均匀的小块,逐块相乘再求和;积分就是这个过程的极限。
  4. 变化率与总量,是同一件事的两面。基本定理把无穷求和变成一次减法,把两千年的难题变成标准算法。
  5. 从规律推出未来。微分方程只写“每一刻怎样变”,给定起点,就能一步步算出天气、药量、轨道。
  6. 它是一种思维。看局部、看变化率、分清流量与存量、带着误差逼近——这四个习惯,在读完这本书之后仍然有用。

14.8留给你的问题

  1. 你的工作或生活里,哪一个指标你一直只看“数值”,却从没看过它的“变化率”?如果开始看,你的判断会变吗?
  2. 找一个你关心的“存量”(存款、体重、技能、信任)。它的流入和流出分别是什么?净流量现在是正还是负?
  3. 最近一次你把短期趋势直线外推,结果错了吗?那条“切线”在哪里开始偏离了曲线?
  4. 你正在纠结的某个决定,最优点附近是平坦的还是陡峭的?如果是平坦的,你是否在为一点点差距付出过多的精力?
  5. 莱布尼茨的符号让千千万万后来者更轻松地思考。在你的领域里,你能做的哪件小事,能像一个好符号那样,让更多人用上一个好想法?

14.9术语小词典

函数
每个输入对应唯一输出的规则(第 3 章)
斜率 / 变化率
输出的变化 ÷ 输入的变化,单位里有个“每”(第 3 章)
极限
一个过程“去往”的确定的数,不要求真的到达(第 4 章)
连续
极限值等于实际值;笔不离纸(第 4 章)
导数
平均变化率的极限;切线斜率;瞬时速度(第 5 章)
链式法则
变化率沿链条相乘:dy/dx = dy/du · du/dx(第 5 章)
中值定理
必有一刻的瞬时变化率等于平均变化率(第 6 章)
定积分
切成细条、逐条相乘、全部相加的极限(第 7 章)
基本定理
求导与积分互为逆运算;∫ab f = F(b) − F(a)(第 8 章)
原函数
导数等于 f 的函数,彼此相差常数 C(第 8 章)
反常积分
积分区间无限长或函数无界时,用极限定义的积分(第 9 章)
e
(1 + 1/n)n 的极限,约 2.71828;eˣ 的导数是它自己(第 10 章)
微分方程
描述“每一刻怎样变”的方程;加上起点即可推出未来(第 10 章)
泰勒级数
逐阶匹配导数,用多项式逼近函数(第 11 章)
偏导数 / 梯度
只动一个变量时的导数;最陡上坡的方向与坡度(第 12 章)

14.10符号读音表

本书用到的希腊字母与数学符号都汇总在这里。读音以国内课堂通行的英文读法为准,音标以剑桥、牛津词典的英式音标为主(nabla 常见词典未收,按拼写给出);中文近似读音只是帮助记忆,和原音并不完全一样。

表 14-2 全书符号读音表
符号英文名音标中文近似来源在本书中的意思首次细讲
Δ / δdelta/ˈdɛltə/德尔塔希腊字母第 4 个(相当于 D)Δ:一段有限的变化;δ:很小的范围3、4
εepsilon/ˈɛpsɪlɒn/
(又 /ɛpˈsaɪlən/)
艾普西隆希腊字母第 5 个(单纯的 e)很小的误差(法语 erreur)4
πpi/paɪ/派希腊字母第 16 个圆周 ÷ 直径(一般认为取 periphery 首字母)2
limlimit/ˈlɪmɪt/极限limit,源自拉丁文 limes:界限极限4
→approaches/əˈprəʊtʃɪz/趋于箭头无限接近4
ddee/diː/d拉丁文 differentia:差无穷小的变化5
′prime/praɪm/撇源自欧拉,拉格朗日推广导数:f ′ 读 f 撇5
∫integral/ˈɪntɪɡrəl/
(又 /ɪnˈtɛɡrəl/)
积分拉长的 s,summa:总和积分7
ee/iː/衣欧拉采用自然常数 2.71828…10
lnL-N / log/ɛl ɛn/自然对数很可能取自 logarithmus naturalis以 e 为底的对数10
∂partial/ˈpɑːʃəl/偏弯曲的 d(孔多塞、勒让德、雅可比)偏导数12
∇nabla / del/ˈnæblə/纳布拉倒置的 Δ(哈密顿、泰特),名取自古竖琴梯度12
全书带走

放大看,曲线就变直;切成碎片,再加起来;变化率与总量,是同一件事的两面。

  • 微积分是人类用来描述“变化”的语言,也是两千年接力的结果。
  • 它让我们从“每一刻怎样变”推出“整体会怎样”:天气、药量、利息、轨道。
  • 它留给每个人的,是四个思考习惯:放大、看变化率、分清流量与存量、带着误差逼近。

∞Appendix · Fact-check and sources

事实核查与出处

书中的史实、数据和符号来历,出处在哪里?可信吗?

第 4 章说:好的近似,一定附带误差估计。一本书也一样,读者应当知道每个说法有多可靠。本附录把全书可以核查的陈述逐条列出,给出核查结论和出处。

附.1怎么核查的

  • 核查时间:2026 年 9 月 30 日,联网逐条核对。
  • 范围:共 95 条,分四组:A 牛顿与莱布尼茨(31 条)、B 数学史(25 条)、C 符号的来历与读音(15 条)、D 应用与数据(24 条)。
  • 来源优先级:一手文献与官方机构(原书全文、诺贝尔奖官网、NASA、ECMWF、EMA、威斯敏斯特教堂官网)优先;其次是专业数学史资料(圣安德鲁斯大学 MacTutor 数学史档案、Jeff Miller《数学符号的最早使用》、Cajori《数学史》、《英国人名词典》);再次是剑桥、牛津词典和维基百科(主要作为索引,并核对它所引用的文献)。
  • 结论标记:属实 与来源一致;已修正 原文有误或不够准确,正文已按核查结果改写,说明栏写明改了什么;来源不足或互相矛盾的说法,一律改为保守表述或删去,并计入“已修正”,说明栏会写明原因。
表 15-1 核查结果汇总
分组条数属实已修正
A 牛顿与莱布尼茨31256
B 数学史25223
C 符号的来历与读音1578
D 应用与数据24186
合计957223

23 处修正多数是细节:年份(黎曼论文的发表年、牛顿那封信的新旧历)、归属(1705 年那篇匿名书评)、措辞强度(英国“落后一个世纪”、矿体重力异常的量级),以及此前说得太满的轶事(理查森的“球形大厅”、洛必达“付费听课”)。没有一处修正改变全书的核心论证。

仍需留意的边界:① 部分官方页面(FDA 指南、USGS)核查时无法访问,相关条目改用 EMA 指南与维基百科所引文献;② 维基百科中“牛顿是首位葬入威斯敏斯特教堂的科学家”“首次因智识成就举行国葬”两点未找到第二个独立来源,正文已不再使用;③ 书中标“估算”“示例”的数字(如预报技巧的进步速度、订货与药物示例参数),其含义见各章说明。链接为核查当日可访问的地址,日后可能变动。

附.2A 组:牛顿与莱布尼茨

表 15-2 牛顿与莱布尼茨
编号书中陈述(位置)结论与说明出处
A1牛顿 1665–1666 年因瘟疫剑桥停课,回乡发展“流数术”,时年二十出头(序章、第 2 章)属实
剑桥 1665 年夏至 1667 年春两度因瘟疫遣散学生;牛顿生于 1642 年圣诞(旧历),即 1643 年 1 月 4 日(新历)。
MacTutor:Newton
《英国人名词典》(1885–1900):Newton, Isaac
A21666 年 10 月有一份流数术手稿(第 2 章)属实
“October 1666 tract”存世。
维基百科:Leibniz–Newton calculus controversy
A3《分析学》写于 1669 年,经巴罗传给柯林斯私下流传(第 2 章)属实维基百科:Leibniz–Newton calculus controversy
MacTutor:Newton
A4《流数法》写于 1671 年,1736 年才出版(第 2 章)属实
1736 年出版的是科尔森的英译本。
维基百科:Method of Fluxions
A5《原理》1687 年出版,推导多以几何形式写成(第 2 章)属实
第 1 卷第 1 节“首末比方法”是几何形式的微积分。
维基百科:Leibniz–Newton calculus controversy
A6流数记号 1693 年部分、1704 年较完整发表(表 2-1)属实
1693 年见于沃利斯著作;1704 年《光学》附《曲线求积》。
维基百科:Leibniz–Newton calculus controversy
Cajori《数学史》(1893):Newton to Euler
A7牛顿早年因光学论文受胡克等批评,此后厌恶公开争论(第 2 章)属实MacTutor:Newton
A8阿诺尔德:在“不发表”与“争优先权”之间,牛顿两样都选了(第 2 章)属实
出自阿诺尔德 1989 年《惠更斯与巴罗,牛顿与胡克》。
维基百科:Leibniz–Newton calculus controversy
A9莱布尼茨生于 1646 年,1672 年以外交官身份赴巴黎,数学薄弱,以惠更斯为导师,1676 年离开(序章、第 2 章)属实维基百科:Gottfried Wilhelm Leibniz
MacTutor:Leibniz
A101675 年 10 月 29 日手稿首用 ∫(取 summa),几周后用 d(序章、第 2 章)属实
d 首见于 1675 年 11 月 11 日手稿(科学院版全集)。
维基百科:Integral symbol
维基百科:Leibniz's notation
A11莱布尼茨 1673、1676 年两访伦敦,1676 年在柯林斯处看到牛顿部分手稿(第 2 章)属实
莱布尼茨晚年致孔蒂的信中承认。
维基百科:Leibniz–Newton calculus controversy
A121676 年牛顿两封信经奥尔登堡转交;后信用字母易位密码藏起流数法(第 2 章)属实
两信日期为 6 月 13 日、10 月 24 日;密码串与原句核对无误。后信迟至 1677 年才送达。
Cajori《数学史》(1893):Newton to Euler
维基百科:Trusted timestamping
A131677 年莱布尼茨回信用 d 记号展示求切线(第 2 章)属实维基百科:Leibniz–Newton calculus controversy
《英国人名词典》(1885–1900):Newton, Isaac
A141684 年《教师学报》发表微分论文,1686 年发表积分论文(第 2 章)属实
1686 年论文首次印出 ∫。
MacTutor:Leibniz
A151696 年洛必达出版第一本微积分教科书,称《原理》“几乎全是这种演算”(第 2 章)属实
原文“presque tout de ce calcul”。
维基百科:Guillaume de l'Hôpital
维基百科:Leibniz–Newton calculus controversy
A161699 年法蒂奥公开暗示莱布尼茨是“第二发明人”(第 2 章)属实维基百科:Nicolas Fatio de Duillier
Cajori《数学史》(1893):Newton to Euler
A17匿名书评暗示牛顿借用莱布尼茨的方法,作者为莱布尼茨(第 2 章)已修正
原写“1704 年……后世普遍认为”。已改为:书评 1705 年初刊于《教师学报》,评论牛顿 1704 年的求积论文;作者是莱布尼茨,他在 1716 年的信中承认。
《英国人名词典》(1885–1900):Newton, Isaac
MacTutor:Keill
A181708 年凯尔在《哲学汇刊》指控莱布尼茨剽窃(第 2 章)属实
按期刊卷期年份为 1708 年。
维基百科:Gottfried Wilhelm Leibniz
A191711 年莱布尼茨向皇家学会申诉(第 2 章)属实
1711 年 3 月 4 日致学会秘书斯隆。
《英国人名词典》(1885–1900):Newton, Isaac
A20牛顿任会长;委员会 1712 年报告、1713 年初以《通信集》出版,裁定牛顿优先,主要由牛顿起草,未听取莱布尼茨(第 2 章)属实
牛顿 1703–1727 年任会长。
MacTutor:Leibniz
维基百科:Isaac Newton
A211715 年为报告叫好的匿名长文作者是牛顿(第 2 章)属实
朴次茅斯文稿证实。
《英国人名词典》(1885–1900):Newton, Isaac
A22莱布尼茨也匿名散发攻击传单(第 2 章)已修正
原写“还曾试图否认自己是作者”,证据不足。已改为:1713 年匿名散发单页传单,其中引用的来信出自约翰·伯努利,伯努利事后郑重否认。
MacTutor:Leibniz
维基百科:Leibniz–Newton calculus controversy
A231849 年格哈特发现莱布尼茨手抄的《分析学》摘录,时间不明(第 2 章)属实维基百科:Leibniz–Newton calculus controversy
A24现代共识:独立发明;牛顿先发现、莱布尼茨先发表;莱布尼茨改日期一事有争议(第 2 章)属实维基百科:Leibniz–Newton calculus controversy
维基百科:Gottfried Wilhelm Leibniz
A25莱布尼茨 1716 年 11 月 14 日卒于汉诺威,身后冷清,巴黎科学院致悼词(第 2 章)属实
葬礼除私人秘书外无廷臣到场;墓地五十余年无标记。
维基百科:Gottfried Wilhelm Leibniz
A26牛顿 1727 年去世,隆重安葬于威斯敏斯特教堂(第 2 章)已修正
原写“国葬,首位葬入该教堂的科学家”,这两点只有维基百科一个来源。已改为教堂官网可证实的表述:大法官、两位公爵、三位伯爵抬棺,葬于教堂中殿。
威斯敏斯特教堂官网:Sir Isaac Newton
维基百科:Isaac Newton
A27莱布尼茨编《中国近事》(1697)、造步进计算器、研究二进制(原序章,现已删去)属实
书名与年份已证实;“盛赞康熙”未找到可直接查证的原文,改版后正文已不再使用。
维基百科:Stepped reckoner
维基百科:Novissima Sinica
A28牛顿致胡克信:“站在巨人的肩膀上”(尾章)已修正
信写于 1675 年 2 月 5 日(旧历),即新历 1676 年。正文已改为“1676 年初(旧历记为 1675 年)”。
维基百科:Standing on the shoulders of giants
A29洛必达法则实为约翰·伯努利发现(第 6 章)已修正
原写“付费请伯努利讲课并约定可使用成果”。已改为:1694 年洛必达约定每年付 300 里弗尔,伯努利把新发现只告诉他;该法则由伯努利当年在信中寄出。
维基百科:L'Hôpital's rule
A301812 年剑桥分析学会推广莱布尼茨记号;巴贝奇“D 主义 vs 点时代”;1816 年译拉克鲁瓦;1817 年考试引入 d(第 2 章)属实MacTutor:Babbage
维基百科:Analytical Society
巴贝奇《一个哲学家的生活片段》(古登堡计划)
A31英国因坚持牛顿记号而落后欧陆(第 2 章)已修正
原写“约一个世纪”,也把原因归于记号。已改为:18 世纪明显落后,约 1820 年赶上;原因还包括争论造成的隔阂和英国对几何传统的坚持。
Cajori《数学史》(1893):Newton to Euler

附.3B 组:数学史

表 15-3 数学史
编号书中陈述(位置)结论与说明出处
B1芝诺约前 5 世纪提出“阿基里斯追乌龟”“飞矢不动”(序章、第 2 章)属实MacTutor:Zeno of Elea
维基百科:Zeno's paradoxes
B2阿基米德穷竭法:抛物线弓形 = 内接三角形的 4/3(第 2 章)属实
每轮新增三角形合计为上一轮的 1/4。
维基百科:The Quadrature of the Parabola
MacTutor:Archimedes
B3阿基米德用正 96 边形得 223/71 < π < 22/7(第 2 章)属实维基百科:Measurement of a Circle
B4刘徽 263 年注《九章算术》,割圆术原文(第 2 章)属实维基百科:刘徽
B5祖冲之:3.1415926 < π < 3.1415927(第 2 章)属实维基百科:Zu Chongzhi
B6祖暅“幂势既同,则积不容异”;卡瓦列里 1635 年提出同一原理(第 2 章)属实
原文句首有“缘”字;祖暅约 480—525 年。
维基百科:祖暅原理
维基百科:Cavalieri's principle
B7开普勒 1615 年《酒桶新立体几何》(第 2 章)属实维基百科:Johannes Kepler
B8笛卡尔 1637 年《几何学》,费马独立发现;费马 1630 年代求极值(第 2 章)属实
费马的极值法手稿 1636 年流传。
维基百科:La Géométrie
维基百科:Pierre de Fermat
B9巴罗与“求切线—求面积”互逆(第 2、8 章)已修正
原写“牛顿的老师……隐约看到”。巴罗已用几何形式给出互逆关系;他是否算牛顿的正式导师,各来源说法不一。已改为“前辈和提携者……已用几何形式触到互逆关系”。
维基百科:Isaac Barrow
MacTutor:Barrow
B10贝克莱 1734 年《分析学家》:“逝去量的鬼魂”(第 2 章)属实维基百科:The Analyst
B11柯西 1821 年《分析教程》;魏尔斯特拉斯 1860 年代 ε-δ(第 2、4 章)属实
魏尔斯特拉斯约 1861 年给出现代形式;波尔查诺 1817 年已有雏形。
维基百科:Cours d'analyse
维基百科:Limit of a function
B12黎曼 1854 年严格定义积分(第 7 章)已修正
论文 1854 年提交,1868 年才发表;正文已补注。
维基百科:Riemann integral
B13雅各布·伯努利 1683 年研究复利发现 e(第 10 章)属实
他是约翰·伯努利的哥哥,当时并未用 e 命名。
维基百科:E (mathematical constant)
B14泰勒 1715 年发表泰勒级数(第 11 章)属实维基百科:Taylor series
B15傅里叶约 1807 年提出三角级数(第 11 章)属实
1807 年 12 月 21 日提交热传导论文。
维基百科:Fourier series
B16韦吕勒 1838 年提出 logistic 方程(第 10 章)属实
“logistic”一名 1845 年才起。
维基百科:Logistic function
B17欧拉法由欧拉提出(第 10 章)属实
见《积分学原理》(1768—1770)。
维基百科:Euler method
B18惠更斯是莱布尼茨的数学导师(序章、第 2 章)已修正
“惠更斯给他出了几道题”这一细节在所查来源中未找到,已删去,只保留“导师”。
维基百科:Gottfried Wilhelm Leibniz
MacTutor:Huygens
B19伯努利兄弟迅速掌握并发扬莱布尼茨的微积分(第 2 章)属实MacTutor:Jacob Bernoulli
B20拉格朗日 18 世纪提出乘子法(第 12 章)属实
见 1788 年《分析力学》。
维基百科:Lagrange multiplier
B21牛顿法求 √2:3 → 1.8333 → 1.4621 → 1.4150 → 1.41421(第 6 章)属实
数值已本地复算。
维基百科:Newton's method
B22调和级数发散的分组论证(第 11 章)属实
奥雷姆约 1350 年给出。
维基百科:Harmonic series (mathematics)
B23辛普森法以托马斯·辛普森命名(第 9 章)属实
开普勒 1615 年已用过。
维基百科:Simpson's rule
B24拉东 1917 年提出拉东变换(第 9 章)属实维基百科:Radon transform
B25龙格–库塔法约 1900 年(第 10 章)属实维基百科:Runge–Kutta methods

附.4C 组:符号的来历与读音

表 15-4 符号的来历与读音
编号书中陈述(位置)结论与说明出处
C1π 的来源与普及(第 2 章符号卡)已修正
原写“取自 περιφέρεια 首字母……后经欧拉推广”。已补充:另有 περίμετρος 一说,琼斯本人未说明;欧拉 1736 年《力学》使用,1748 年《无穷分析引论》使之普及。
MacTutor / Jeff Miller:常数符号的最早使用
维基百科:Pi
C2epsilon 原意“单纯的 e”(第 4 章符号卡)属实维基百科:Greek alphabet
维基词典:epsilon
C3ε 取自 erreur、δ 取自 différence/distance;柯西 1820 年代已用(第 4 章符号卡)已修正
已注明这是后人解读;柯西 1821 年已用 ε,1823 年首次在同一证明中同时用 δ 与 ε。
MacTutor / Jeff Miller:微积分符号的最早使用
维基百科:Limit of a function
C4lim 与箭头写法的历史(第 4 章符号卡)已修正
已改为:lim. 最早见于吕伊利埃 1786 年;魏尔斯特拉斯 1850 年代把条件写在 lim 下方;箭头 1905 年出现,1908 年流行。
MacTutor / Jeff Miller:微积分符号的最早使用
维基百科:Limit of a function
C5Δ 为第 4 个希腊字母,对应 D;三角洲因形得名(第 3 章符号卡)属实维基百科:Delta (letter)
C6∫ 为长 s、取 summa、1675-10-29 首用;d 同年 11 月(第 5、7 章符号卡)属实
“d 取自 differentia”是通行说法,所查来源未明言,正文已写作“通常认为”。
MacTutor / Jeff Miller:微积分符号的最早使用
维基百科:Integral symbol
C7撇号 ′ 由拉格朗日推广(第 5 章符号卡)已修正
已补充:可追溯到欧拉;拉格朗日 1770 年代起使用,1797 年系统使用。
MacTutor / Jeff Miller:微积分符号的最早使用
维基百科:Notation for differentiation
C8牛顿点记号 ẋ 表示对时间求导(第 5 章)属实
通行惯例;所查来源只写明“ẏ 表示 y 对 t 的导数”。
维基百科:Notation for differentiation
C9∂ 的来历(第 12 章符号卡)已修正
已补充孔多塞 1770 年的用法;勒让德 1786 年、雅可比 1841 年。
MacTutor / Jeff Miller:微积分符号的最早使用
维基百科:Partial derivative
C10∇ 的来历与名称(第 12 章符号卡)已修正
已改为:哈密顿引入算子(最初横放),泰特 1867 年确立 ∇;史密斯 1870 年建议 nabla 之名;del 读法由吉布斯、威尔逊 1901 年倡导。哈密顿的具体年份,各来源说法不一。
MacTutor / Jeff Miller:微积分符号的最早使用
维基百科:Nabla symbol
C11用 e 表示自然常数始于欧拉,选字母的原因未知(第 10 章符号卡)属实
1727/1728 年手稿;1736 年《力学》首次刊出。
MacTutor / Jeff Miller:常数符号的最早使用
维基百科:E (mathematical constant)
C12ln 为 logarithmus naturalis 缩写(第 10 章符号卡)已修正
已改为“很可能是”,并补充 1893 年斯特林厄姆的用法。
MacTutor / Jeff Miller:函数符号的最早使用
维基词典:ln
C13δ/Δ 第 4、ε 第 5、π 第 16 个字母(符号卡、表 14-2)属实维基百科:Greek alphabet
C14读音与音标(符号卡、表 14-2)已修正
主体与词典一致。已补充:epsilon 英式另读 /ɛpˈsaɪlən/;integral 另读 /ɪnˈtɛɡrəl/;nabla 常见词典未收,按拼写给出。π 在现代希腊语读 [pi]。
剑桥词典:epsilon
牛津高阶词典:integral
剑桥词典:partial
C15ε-δ 现代形式由魏尔斯特拉斯给出(第 2、4 章)属实
约 1861 年。
维基百科:Limit of a function

附.5D 组:应用与数据

表 15-5 应用与数据
编号书中陈述(位置)结论与说明出处
D1理查森一战期间手算 6 小时预报,得出 145 百帕的变化;林奇分析为未平滑所致(第 13 章)已修正
已改为:在公谊会救护队服务(“救护车司机”未能证实);气压“上升”145 百帕;手算只覆盖两个格点,耗时至少 6 周。
维基百科:Lewis Fry Richardson
维基百科:Numerical weather prediction
D21922 年《用数值方法预报天气》,64,000 人的“预报工厂”(第 13 章)已修正
原书写的是“像剧院一样的大厅,四壁绘成地球地图”,不是球形大厅;64,000 = 32 × 2000。正文已改。
Richardson 1922 原书全文(Internet Archive)
D31950 年 ENIAC 首次数值预报,24 小时预报约算 24 小时(第 13 章)属实Lynch 2008, The ENIAC Forecasts, BAMS
D4预报技巧约每十年提前一天(第 13 章,标“估算”)属实Bauer, Thorpe & Brunet 2015, Nature 525:47–55
D5ECMWF 全球模式约 9 km、137 层;地球表面积约 5.1 亿平方公里(第 13 章)属实
当前业务系统 IFS Cycle 50r1 的配置未变。
ECMWF:Implementation of IFS Cycle 50r1
NASA Earth Fact Sheet
D6洛伦茨与“蝴蝶效应”(第 13 章)已修正
原写“1963 年发现”。已改为:1961 年发现,1963 年发表,“蝴蝶效应”得名于 1972 年的报告标题。
维基百科:Butterfly effect
D7P 波约 6 km/s、S 波约 3.5 km/s;震级每增 1 级能量约增 32 倍(第 3、13 章)属实
取的是地壳中的典型值。
维基百科:P wave
维基百科:Moment magnitude scale
D8矿体造成的重力变化量级(第 9 章)已修正
原写“百万分之一量级”。1 毫伽约为 g 的百万分之一,而矿体异常一般只有零点几到几个毫伽。已改为“千万分之一到百万分之几”。
维基百科:Gal (unit)
维基百科:Gravity anomaly
D9碳-14 半衰期约 5730 年(第 10 章)属实
最新核数据评估为 5700 ± 30 年;测年惯例仍用 5568 年(利比值)。
维基百科:Carbon-14
维基百科:Radiocarbon dating
D10生物等效:AUC、Cmax 比值的 90% 置信区间在 80%–125%(第 13 章)属实
EMA 指南原文核实;高变异药、窄治疗窗药另有规定。
EMA:Guideline on the Investigation of Bioequivalence
维基百科:Bioequivalence
D11EOQ = √(2DS/H),哈里斯 1913 年(第 6、13 章)属实维基百科:Economic order quantity
D12牛鞭效应(第 13 章)属实
又称弗雷斯特效应(1961)。
维基百科:Bullwhip effect
D13齐奥尔科夫斯基 1903 年发表火箭方程(第 9 章)属实
摩尔 1810、1813 年更早提出。
维基百科:Tsiolkovsky rocket equation
D14入轨约需 9.4 km/s,液氧煤油喷速约 3 km/s(第 9、13 章,标“估算”)属实
入轨约 9.3–9.8 km/s;RD-180 喷速约 3.05–3.31 km/s。
维基百科:Delta-v budget
维基百科:RD-180
D15逃逸速度约 11.2 km/s(第 9 章)属实
NASA 给出 11.186 km/s。
NASA Earth Fact Sheet
D16布莱克–斯科尔斯 1973;1997 年诺贝尔奖;可化为热传导方程(第 13 章)属实诺贝尔奖官网:1997 年经济学奖
维基百科:Black–Scholes model
D17CT:科马克与豪恩斯菲尔德获 1979 年诺贝尔奖(第 9 章)属实
首例临床扫描在 1971 年。
诺贝尔奖官网:1979 年生理学或医学奖
D18SIR 模型 1927 年;群体免疫阈值 1 − 1/R₀(第 13 章)属实
适用于均匀混合的简单模型。
维基百科:Compartmental models (epidemiology)
维基百科:Herd immunity
D19凯瑟琳·约翰逊为格伦核算轨道(第 13 章)已修正
已改为“美国首次载人环绕地球轨道飞行”,用台式机械计算器逐项核算 IBM 计算机的数据。
NASA:Katherine Johnson Biography
D20牛顿冷却定律(第 10 章)属实
在温差较小、传热方式不变时较准确。
维基百科:Newton's law of cooling
D21多数药物按一级动力学消除;4–5 个半衰期达稳态约 94%–97%(第 11 章)属实
4 个半衰期为 93.75%,5 个为 96.875%。
维基百科:Biological half-life
D2272 法则(第 10 章)属实维基百科:Rule of 72
D23地球半径 6371 km,g ≈ 9.8 m/s²(第 9 章)属实NASA Earth Fact Sheet
D24“降水概率”的含义(第 13 章)已修正
已补全定义:在规定时段内,预报区域任一点出现可测量降水的概率。
美国国家气象局:Probability of Precipitation