Appearance
第 1 章 狭义相对论与平直时空
返回系列目录 · 上一篇:扉页、版权页与前言 · 下一篇:第 2 章 流形
1.1 前奏
广义相对论(general relativity,GR)是 Einstein 关于空间、时间和引力的理论。就其核心而言,它是一门非常简单的学科——比如与任何涉及量子力学的学科相比。基本思想十分直截了当:自然界的大多数力都由定义在时空上的场来表示,例如电磁场或亚核力所特有的短程场;引力则内在于时空本身。具体说来,我们所体验到的“引力”,正是时空曲率的表现。
这样一来,我们的任务就很清楚了。我们需要理解时空,需要理解曲率,还需要理解曲率如何成为引力。大体而言,本书前两章用于探索时空,第三章讨论曲率,第四章在进入理论的各种应用之前解释曲率与引力之间的关系。不过,让我们先稍稍纵容自己,简短预览一下接下来将要看到的内容;这或许能为旅程最初的几步提供动力。
GR 是一种引力理论,因此我们可以先回顾此前的引力理论,也就是 Newton 理论。它包含两个基本要素:一个方程描述物质如何影响引力场,另一个方程描述物质如何响应这个场。通常,Newton 理论用粒子之间的力来表述这些规则。质量分别为
这个力作用在质量为
等价地,我们也可以使用引力势
而加速度由引力势的梯度给出:
作者勘误(印刷页 1):扫描本式 (1.1) 与式 (1.4) 的右端均漏印了负号;这里已依照作者官方勘误补正。
式 (1.1) 与式 (1.2) 这一组,或式 (1.3) 与式 (1.4) 这一组,都可以用来定义 Newton 引力。为了定义 GR,我们需要把其中每一条都替换成有关时空曲率的陈述。
困难之处在于写出一个方程,用来支配时空曲率对物质与能量之存在所作的响应。最终,我们会以 Einstein 方程的形式得到所需的方程:
这个方程看上去比它本应有的样子更令人生畏,很大程度上是因为那些作为下标的希腊字母。事实上,它只是一个
物质对时空曲率的响应稍微容易把握一些:自由粒子沿着“可能的最短距离”所对应的路径,也就是测地线运动。换句话说,粒子会尽其所能地沿直线运动;但在弯曲时空中,可能根本没有我们从欧几里得几何中所熟悉的那种直线,于是粒子只能选择最接近直线的路径。它们由参数表示的路径
此时,我们并不要求你对式 (1.6) 的理解多于对式 (1.5) 的理解;不过用不了多久,这一切都会变得清楚。
正如稍后将讨论的,测地线运动的普适性是 GR 一项极为深刻的特征。正是这种普适性,使我们能够声称引力本身并非一种“力”,它是时空的一项性质。电场中的带电粒子会感受到加速度,从而偏离直线运动;相比之下,引力场中的粒子沿着最接近直线的路径运动。这类粒子感受不到加速度;它们处于自由落体状态。等我们更加熟悉 GR 的思想以后,就会很自然地认为,飞过空中的球比静置在桌面上的球更真正地处于“无加速”状态:桌面上的球正被迫偏离它本来想要遵循的测地线——这也正是我们站在地球上时,双脚会感受到力的原因。
作者勘误(印刷页 2):原文此处把 sitting on a table 漏排成 sitting a table;译文已按勘误补出“静置在桌面上”的介词关系。
描述时空曲率时,最基本的概念将是度规张量,通常记为
其中,
失效;而通过追踪 Pythagoras 关系的改变方式,我们可以刻画曲率的大小。这些信息都包含在度规张量中。我们将从度规导出 Riemann 曲率张量,用它定义 Einstein 方程;我们也会从度规导出测地线方程。搭建这套数学装置,正是接下来几章的主题。
虽然要定量讨论曲率,就必须引入一定程度的形式体系,但 GR 的核心观念——“引力就是时空的曲率”——相当简单。那么,为什么 GR 至少在某些不甚开明的圈子里,仍以困难甚至晦涩而闻名?原因在于,Einstein 理论中优美的真理被一层层相对论出现之前的观念遮蔽了。这些观念虽然非常有用,但要领会 GR 所描述的世界,我们首先必须将它们抛开。具体来说,我们生活的世界里时空曲率很小,而且绝大多数粒子的运动速度相对于光速都很慢。因此,Galileo 和 Newton 的力学对我们而言显得非常自然,尽管它只是那个更深层故事的一种近似。
所以,我们将逐层剥去那些有用却容易误导的 Newton 式直觉,由此开始学习这个更深层的故事。第一步也就是本章的主题:探索狭义相对论(special relativity,SR),即不存在引力——也就是不存在曲率——时的时空理论。希望这里的大部分内容都只是复习,因此叙述会进行得比较快。我们的目的,一方面是回顾 SR 究竟讲了什么,另一方面是在暂时不叠加曲率所带来的额外复杂性的情况下,引入后来至关重要的张量及相关概念。因此,本章始终研究平直时空,并且只使用惯性坐标,也就是类似 Cartesian 坐标的坐标。当然,你完全可以在任意坐标系中研究 SR;不过事实表明,引入为此所需的工具,几乎已经让我们走完了通往弯曲空间的一半路程,所以这件事暂且留到以后。
1.2 空间与时间:分开来看与合在一起
一种完全冷静、不顾教学铺垫的 GR 讲法,会把第 2 章“流形”和第 1 章“狭义相对论与平直时空”的次序倒过来。流形是用于描述时空的一类数学结构,而狭义相对论则是一种采用特定时空的模型——这种时空没有曲率,因而也没有引力。不过,既然你正在读这本书,大概已经对狭义相对论有所了解,却可能对流形一无所知。所以,我们的第一步是探索相对熟悉的 SR 领域,并借此机会引入对后续发展至关重要的概念和记号。
狭义相对论是一种关于时空结构的理论;时空是粒子和场演化时所处的背景。SR 取代了 Newton 力学,而 Newton 力学本身同样是一种关于时空结构的理论。无论在哪一种理论里,我们都可以区分这种基础结构与支配
特定系统的各种动力学定律。Newton 引力是在 Newton 力学框架中设定的动力学系统;Maxwell 电磁学则是在狭义相对论框架中运行的动力学系统。
图 1.1 在 Newton 时空中,存在一种绝对的切分方式:不同时刻分别对应彼此不同的完整空间副本。粒子的世界线只能沿时间向前延伸,但可以用任意速度穿过空间。对于空间中不同位置的两个事件是否发生在同一时刻,所有观察者都会得到一致答案。
图中标注:
时空是一个四维集合,其中的元素由三个空间维度和一个时间维度来标记。(下一章会给出更加严格的定义。)时空中的单个点称为一个事件。粒子的路径是穿过时空的一条曲线,是一个由参数表示的一维事件集合,称为粒子的世界线。这种描述对 SR 和 Newton 力学同样适用。在这两种理论中,“时间”显然都受到与“空间”有所不同的对待:尤其是粒子总是沿时间向前运动,却可以在空间中来回运动。
不过,SR 所允许的粒子路径集合与 Newton 理论所允许的路径集合之间存在一个重要差别。在 Newton 力学中,时空有一种基本划分,可以被切成界定清楚的切片;每个切片都是“某个固定时刻的整个空间”。两个事件发生在同一时刻这一同时性概念,具有毫无歧义的定义。粒子的轨迹总是沿时间向前延伸,除此以外却不受约束;特别是,任意两个这类粒子的相对速度都没有上限。
在 SR 中,情形发生了剧烈变化。尤其重要的是:对于彼此分离的两个事件“发生在同一时刻”,不存在定义良好的绝对概念。 这并不意味着时空完全没有结构。我们可以在任意事件处定义一个光锥;它是穿过时空的一组路径所形成的轨迹集合,这些路径都是经过该事件的光线在设想中可能采取的路径。Newton
力学把时空绝对划分成由时间参数化的唯一空间切片;在 SR 中,这种划分被一条规则取代:物理粒子不能比光运动得更快,因此它们所沿的路径始终留在这些光锥内部。
图 1.2 在狭义相对论中,“某一时刻的整个空间”没有绝对定义。取而代之的是一条规则:粒子的运动速度始终小于或等于光速。因此,我们可以在每个事件处定义光锥,由它在局部描述所有允许轨迹的集合。若两个事件分别位于对方的光锥之外,就不存在一个普遍适用的概念来判定其中哪一个事件在时间上发生得更早。
图中标注:particle worldline——粒子世界线;light cones——光锥。
SR 没有优先选定的时间切分,这正是时空概念在这一理论中比在 Newton 力学中更加根本的核心原因。当然,我们可以在时空中选取特定的坐标系。一旦作出选择,就可以合理地说,彼此分离的若干事件在这个特定坐标系里具有相同的时间坐标值;但同时还会存在其他可用坐标,它们与第一套坐标的关系相当于把空间和时间相互“旋转”。这种现象是欧几里得几何中旋转的一种自然推广,下面我们就来讨论它。
考虑一个再普通不过的二维平面。通常,为了标记平面上的点,我们会引入坐标,例如定义彼此正交的
在另一套 Cartesian 坐标系中,
因此,我们说距离在这类坐标变换下是不变量。
图 1.3 具有两套不同坐标系的二维欧几里得空间。“两点之间的距离”这类概念与所选取的坐标系无关。
图中标注:
这正是我们应当把平面看成一个内在二维空间的原因,而不应把它看成两个本质不同、又被任意拼接到一起的一维空间。虽然我们用两个不同的数来标记每一个点,但这些数字并非几何的本质,因为我们可以让两条坐标轴相互旋转,同时保持距离不变。在 Newton 物理学中,空间与时间并不具有这种性质:把空间和时间相互旋转没有任何有用的含义。相反,“某一时刻的整个空间”这一概念具有与坐标选择无关的意义。
SR 的情况则有所不同。让我们按如下方式在时空中建立坐标
按这种方式构造出的坐标系称为惯性参考系,也可以简称为“惯性坐标”。这些坐标是空间中 Cartesian(正交归一)坐标向时空的自然推广。(之所以要如此谨慎地
构造这些坐标,是因为我们只进行局部比较;例如,我们绝不会在同一时刻直接比较两只相距遥远的时钟。进入广义相对论以后,这种谨慎会变得更加必要,因为届时将无法构造一套覆盖整个时空的惯性坐标。)
图 1.4 在惯性坐标系中同步时钟。当我们让一束光从点 1 传播到点 2 再返回时,如果
图中标注:
通过上述步骤,我们可以构造任意多套惯性参考系。它们与第一套参考系之间可以存在初始位置和初始时间的偏移、角度差以及恒定的速度差。在 Newton 世界里,新坐标
这一性质,并且该关系与空间坐标无关。换句话说,“两个事件同时发生,也就是发生在同一时刻”具有绝对意义。但在 SR 中并非如此;一般来说,由
不过,我们还没有彻底陷入混乱。暂且不说明动机,考虑两个事件之间一个称为时空间隔的量:
请注意,即使对两个并不重合的点,这个量也可以是正数、负数或零。
这里,
正因如此,把狭义相对论视为一种四维时空理论是合理的;这个时空称为 Minkowski 时空。(它是四维流形的一个特例,稍后我们会详细讨论流形。)我们将会看到,前面以隐含方式定义的那些坐标变换,在某种意义上会把空间与时间彼此旋转。不存在绝对的“同时发生的事件”:两件事是否同时发生,取决于所采用的坐标。因此,把 Minkowski 时空划分为空间与时间,是我们为了自己的目的所作的一种选择,并非情形本身所固有的结构。
与狭义相对论有关的几乎所有“悖论”,都源于人们顽固地坚持 Newton 式观念:时间坐标应当是唯一的,并且存在“某一时刻的整个空间”。用时空这一整体来思考,不再把空间与时间简单并置,这些悖论往往就会消失。
下面引入一些方便的记号。时空坐标写成带希腊字母上标指标的字母;这些指标从
(不要开始把这些上标当成幂。)此外,为了简化书写,我们选用满足
的单位制;因此,后面的所有公式都会省略
把时空间隔写成更紧凑的形式也很方便。为此,引入一个
(有些参考资料,尤其是场论教材,用相反的整体符号定义度规,因此要留意。)于是得到简洁的公式
这个公式引入了求和约定:凡是同一个指标既以上标出现、又以下标出现,就对它求和。这样的标记称为哑指标;务必记住,要让它遍历所有可能的取值再求和,不能把它取成某一个特定值。(以后会看到,哑指标总是严格成对出现,一个在“楼上”,一个在“楼下”。)因此,式 (1.16) 的内容与式 (1.10) 完全相同。
时空图是一种极为有用的工具,所以现在从这一视角来考察 Minkowski 时空。先把最初的
所有能够通过以光速运动的直线与同一个事件相连的点,组成光锥;因为若设想再加入一个空间坐标,两条对角线就会补成一个锥面。光锥自然分为未来光锥与过去光锥:点
图 1.5 光锥。 在时空图上画出的一个光锥。图中标出了与原点分别为类空、零、类时分离的点。
图中标注:纵轴为
,横轴为 ;锥内为“类时”,锥面为“零”,锥外为“类空”。
类时线上实际会有低于光速的粒子运动,而类时间隔却为负,这一点很不方便;所以我们定义固有时
时空间隔有一个至关重要的性质:两个事件之间的固有时,测量的是一个观察者沿连接这两个事件的直线路径运动时所经历的时间。 在两个事件具有相同空间坐标、只在时间上分离这个非常特殊的情形中,很容易看出这一点;这对应于在所用坐标系中,穿行于两个事件之间的观察者保持静止。此时
一个关键事实是:对于更一般的轨迹,固有时与坐标时间彼此不同(固有时始终是沿轨迹运动的观察者随身携带的钟所测得的时间)。考虑事件
事件
显然还有
图 1.6 双生子悖论。 沿时空直线路径
旅行的人,会比沿非直线路径 旅行的人老得更多。固有时衡量的是在时空中走过的距离,所以这一结果并不奇怪。(唯一可能令人意外的地方,是直线路径给出最大固有时;这可以追溯到度规类时分量前的负号。) 图中标注:横轴为
,纵轴为 ;竖直路径为 ,折线路径为 ,并标出了坐标差 与 。
尽管两位观察者从时空中的同一点出发,又在同一点结束,他们增加的年龄却不同。这就是著名的“双生子悖论”,它不幸成了各种误解和曲折解释竞相登场的场所。事实很直接:时空中的非直线路径与直线路径具有不同的间隔,就像空间中的曲线路径与直线路径具有不同的长度。它听起来当然没有那么平凡;深刻之处在于,“沿一条世界线流逝的时间”与穿越时空所走过的间隔之间存在这种关系。在 Newton 世界中,坐标
重要区别:非直线路径的固有时更短。在空间中,两点之间最短的距离由直线给出;在时空中,两个事件之间最长的固有时由直线轨迹给出。
并非每条轨迹都规整到足以由若干直线段拼成。在更一般的情形中,引入无穷小时空间隔,也就是线元,很有用:
这里的
其中积分沿整条路径进行。对于类时路径,我们使用固有时
它将是正数。(对于类光路径,间隔就是零。)当然,也可以考虑有些区段类时、另一些区段类空的路径;所幸这种情形很少需要处理,因为物理粒子的路径永远不会改变自身的类别:有质量粒子沿类时路径运动,无质量粒子沿类光路径运动。再强调一次,
狭义相对论中的“加速”概念名声不佳,却没有充分理由。设置惯性坐标时,我们当然十分谨慎,要确保在这种坐标中静止的粒子没有加速度。可是,一旦这类坐标已经建好,我们完全可以考虑物理粒子的任何轨迹,无论它是否加速。尤其要说明,传言“狭义相对论无法处理加速轨迹,必须诉诸广义相对论”毫无根据。引力出现、时空变弯曲时,广义相对论才开始发挥作用。平直时空中的任何过程都可以在狭义相对论框架内描述;特别是,式 (1.22) 这样的表达式具有完全的一般性。
1.3 Lorentz 变换
现在可以在比前面稍微抽象一些的层次上,考察时空中的坐标变换。我们关心的是:如何形式化地描述按上述步骤构造出的各个惯性参考系之间的关系;换言之,就是那些使间隔 (1.16) 保持不变的坐标系。一类简单的变换是平移,它只把坐标作平移(在空间或时间中都可以):
其中
注意,撇号放在指标上,
或者用更常规的矩阵记号写成
(一般情况下我们会使用指标记号;不过眼下需要把讨论同一些通常用矩阵表达的熟悉概念联系起来。)这些变换不会使坐标差
因而
或者写成
(在矩阵记号中,各因子的次序很重要;在指标记号中,书写次序无关紧要。)我们要寻找这样的矩阵
满足式 (1.28) 的矩阵称为 Lorentz 变换;它们在矩阵乘法下构成一个群,称为 Lorentz 群。这个群与三维空间中的旋转群
后,它与式 (1.28) 更为相像。
因此,旋转群
注意,
写出简单 Lorentz 变换的显式表达式并不困难。熟悉的
旋转角
boost 参数
boost 对应于改换坐标,进入一个以恒定速度运动的参考系;这一点应该不会令人意外,不过我们还是把它更明确地看出来。(不要把“boost”与“加速”混淆。boost 到另一个参考系与使一个物体加速之间的差别,正如把坐标系旋转到另一取向与让一个物体自行旋转之间的差别。)对于式 (1.32) 给出的变换,变换后的坐标
由此可见,由
换成熟悉的普通记号,代入
其中
在时空图中考察 Lorentz 变换也很有启发性。根据式 (1.33),在
……(按 Lorentz 意义仍然正交;这正是度规在 boost 下保持不变所蕴含的结论。)这并不令人意外,因为如果时空的行为与空间的四维版本毫无二致,世界将会大不相同。由此可以十分鲜明地看出这种情形与 Newton 世界之间的区别:在狭义相对论中,我们无法以不依赖坐标的方式判断,与
图 1.7 Lorentz 变换把坐标
图中标注:两条光线满足
还要注意,由
1.4 向量
要更细致地探查 Minkowski 时空的结构,就必须引入向量和张量的概念。我们从大家应该熟悉的向量开始。当然,时空中的向量是四维的,通常称为四维向量(four-vector)。这一点会带来相当大的差别——例如,两个四维向量之间不存在叉积。
除了维数这一简单事实之外,最需要强调的一点是:每个向量都位于时空中的某个给定点。你可能习惯于把向量想成在空间中从一点伸向另一点,甚至习惯于把“自由”向量从一个点随意滑到另一个点。这些概念离开平直空间的语境就没有用处;一旦引入曲率,我们就无法从一点到另一点画出一条优先指定的曲线,也无法以唯一方式在流形上移动向量。我们采取的做法是:对时空中的每一点
把附着在一个简单弯曲二维空间中某一点上的向量集合,看成一个与该点相切的平面。(这一图像依赖于把流形及其切空间嵌入某个更高维的外部空间,而一般来说,我们既没有也不需要这样的外部空间。)抛开这种形象上的启发,关键是把这些向量看成位于同一个点,而非从一点伸向另一点(尽管这不会妨碍我们在时空图中把它们画成箭头)。
第 2 章将把每一点的切空间与能够由时空自身构造出来的对象联系起来。眼下,只需把
每个向量空间都有一个原点,也就是在向量加法下充当恒等元的零向量。许多向量空间还带有额外运算,例如取内积(点积);不过,这些都属于超出向量空间基本概念的附加结构。
向量是定义完备的几何对象,向量场也是如此;向量场指时空中每一点恰好配有一个向量的集合。一个
图 1.8 切空间
图中标注:下方曲面为流形
……能由其余基向量线性组合而成)。对任意给定的向量空间,都有无穷多组可能选取的基,但每一组基都含有相同数目的向量;这个数目称为空间的维数。(对于 Minkowski 时空中一点所对应的切空间,维数当然是四。)
设想我们在每个切空间中都选取由四个向量
系数
时空中向量的一个标准例子,是曲线的切向量。时空中的一条参数化曲线或路径,由坐标关于参数的函数指定,例如
完整的向量是
然而,向量
无论分量
要用旧基
于是,由式 (1.41) 得到基向量的变换规则:
因此,这组基向量按照坐标或向量分量所用 Lorentz 变换的逆变换来变换。
让我们停下来片刻,消化一下这些内容。我们引入了以上指标标记的坐标;在 Lorentz 变换下,它们按某种方式变换。接着又考察了同样写成上指标的向量分量;这样做很合理,因为它们的变换方式与坐标函数相同。(在一个固定坐标系中,四个坐标
1.5 对偶向量(一形式)
建立一个向量空间后,我们还可以定义另一个与之相联系、维数相同的向量空间,称为对偶向量空间。对偶空间通常用星号表示,因此,切空间
其中
为了让这一构造更具体一些,可以引入一组对偶基向量
于是,每个对偶向量都能用它的分量写出,而我们用下指标标记这些分量:
通常,与向量的情形完全类似,我们会直接用
分量记号给出了对偶向量作用于向量的一种简洁写法:
这就是很少需要显式写出基向量和对偶基向量的原因:分量完成了全部工作。式 (1.48) 的形式还提示我们,可以把向量看成作用于对偶向量的线性映射,并定义
因此,对偶向量空间的对偶空间就是原来的向量空间本身。
当然,在时空中,我们关心的不会只是单个向量空间,而是向量场和对偶向量场。(
……Lorentz 变换下保持不变;它是从时空到实数、且不依赖坐标的映射。
我们可以沿用先前研究向量时使用的论证——几何对象不依赖坐标,即使它们的分量依赖坐标——推导对偶向量的变换性质。对其分量,答案是
而对对偶基向量,答案是
这正是我们根据指标位置会预期的结果:对偶向量分量的变换,是向量分量所用变换的逆变换。注意,这保证了标量 (1.48) 在 Lorentz 变换下保持不变,正如它应当具有的性质。
在时空中,对偶向量最简单的例子是标量函数的梯度,即它对各时空坐标的偏导数所组成的集合;我们用小写的
通常用于变换偏导数的链式法则,在这里恰好给出对偶向量分量的变换规则:
其中,我们用式 (1.25) 把 Lorentz 变换与坐标联系起来。梯度是对偶向量这一事实,导出了下面这些表示偏导数的简写:
因此,
1.6 张量
向量与对偶向量的一个直接推广就是张量。正如对偶向量是从向量到
这里,
从这个观点看,标量是
所有固定类型
注意,
现在,只要对基向量和对偶基向量取张量积,就可以直接构造所有
在四维时空中,总共有
另一种办法是让张量作用在基向量与对偶基向量上,以此定义它的分量:
利用式 (1.46) 等关系,你可以自行验证这些方程确实彼此协调。
和向量一样,我们通常会走一条捷径:直接用分量
因此,一个
最后,利用我们已经知道的基向量和对偶基向量的变换方式,可以推出 Lorentz 变换下张量分量的变换。答案正如指标位置所暗示的那样:
也就是说,每个上标都像向量那样变换,每个下标都像对偶向量那样变换。
我们把张量定义成从若干向量和对偶向量到
作者勘误(印刷页 22):原文此句第二类自变量误写成 tangent vectors;作者勘误指定为 dual vectors,译文已采用“对偶向量”。
你可以自行验证
就是一个完全合格的
考虑到这部分材料颇为抽象,你也许会担心这里对张量的介绍过于简略。其实,掌握张量概念并不需要费太大力气;关键只是把指标理顺,而操作指标的规则都很自然。事实上,不少书喜欢把张量定义成依照式 (1.63) 变换的一组数。这个定义在操作上固然方便,却往往会遮蔽张量更深一层的含义:张量是几何实体,拥有一种不依赖于任何所选坐标
系的“生命”。不过,我们确实略过了一个细微之处。对偶向量、张量、基以及线性映射这些概念都属于线性代数;只要面对一个抽象向量空间,它们就是合适的工具。而在我们关心的问题中,面对的并非单一向量空间,而是时空中每一点各有一个向量空间。我们更常感兴趣的是张量场,可以把它看成时空上的张量值函数。幸运的是,上面定义的各种操作并不真正关心我们面对的是单个向量空间,还是每个事件各有一个向量空间的集合。因而在合适时,我们只把对象写成
在时空中,我们已经见过一些张量,只是当时没有这样称呼它们。最熟悉的
和通常的欧几里得点积一样,我们把内积为零的两个向量称为正交。内积是标量,所以在 Lorentz 变换下保持不变;因此,任一 Cartesian 惯性参考系的基向量按定义彼此正交,在 Lorentz 变换之后仍然正交,尽管我们早先看到它们会像剪刀一样彼此合拢。向量的范数定义为向量与自身的内积;与欧几里得空间不同,这个数并非正定:
(一个向量的范数可以为零,而它本身并非零向量。)你会注意到,这套术语与我们先前用来分类时空中两点关系的术语相同。这当然绝非巧合,稍后我们会作更详细的说明。
另一个张量是
与 Kronecker delta 和度规相关的是逆度规
(之所以称为逆度规,是因为它与度规相乘会给出恒等映射。)事实上,你可以验证,逆度规的分量与度规本身完全相
同。这一点只在平直空间的 Cartesian 坐标中成立,在更一般的情形中将不再成立。此外还有 Levi–Civita 符号,它是一个
这里,“
上述对象——度规、逆度规、Kronecker delta 与 Levi–Civita 符号——有一个很引人注目的性质:虽然它们全都按照张量变换定律 (1.63) 变换,但在平直时空的任意惯性坐标系中,其分量始终不变。从某种意义上说,这使它们成了并不典型的张量例子,因为绝大多数张量都没有这种性质。事实上,它们是仅有的具有这种性质的张量,不过我们不会证明这一点。Kronecker delta 更加特殊:在任意时空的任意坐标系中,它的分量都完全相同。从张量作为线性映射的定义来看,这很合理:Kronecker 张量可以看成向量到向量(或对偶向量到对偶向量)的恒等映射,无论坐标系如何,它显然都必须有相同的分量。另一方面,度规及其逆刻画时空的结构,Levi–Civita 符号则暗地里根本不是真正的张量。因此,一旦放弃平直时空的假设,我们就必须更谨慎地对待这些对象。
更典型的张量例子是电磁场强张量。我们都知道,电磁场由电场向量
从这个观点出发,只需应用式 (1.63),便很容易把一个参考系中的电磁场变换到另一个参考系。张量形式体系的统一力量一目了然:我们不再面对两个
相互关系及其变换性质都颇为神秘的向量集合,而有了一个张量场来描述全部电磁现象。(不过也不要走得太远:有时在单一坐标系中,直接用电场向量和磁场向量计算会更方便。)
1.7 张量运算
有了这些例子,我们现在可以更系统地讨论张量的若干性质。先来看缩并这一操作,它把一个
你可以验证,所得结果是一个定义良好的张量。只有一个上标与一个下标才能缩并,不能缩并两个同类指标;否则结果将不再是定义良好的张量。(所谓定义良好,可以理解为“按张量变换定律变换”,也可以理解为“从一组向量和对偶向量到实数定义了唯一的多重线性映射”,任选其一。)还要注意,指标的次序很重要,因此不同缩并方式可能得到不同的张量;一般而言,
度规与逆度规可以用来升降张量的指标。也就是说,给定张量
等等。请注意,升降指标不会改变该指标相对于其他指标的位置;还要注意,等式两边的自由指标(即没有被求和的指标)必须相同,而哑指标(即确实被求和的指标)只出现在等式的一边。例如,我们可以通过升降指标在向量与对偶向量之间相互转换:
由于度规与逆度规确实互为逆,我们可以同时升降一对正在缩并的指标:
能够用度规升降指标,解释了为什么在三维平直欧几里得空间中,梯度通常会被当成普通向量,尽管我们已经看到它本来是一个对偶向量:在欧几里得空间里,度规是所有对角元均为
在弯曲时空中,度规的形式通常更复杂,差别也会显著得多。不过还有一个更深的理由:张量通常拥有独立于度规的“自然”定义。虽然我们始终会有一个可用的度规,弄清所引入的每个数学对象在逻辑上的地位仍然很有帮助。梯度通过它对向量的作用来定义,无论有没有度规都完全明确;“带上标的梯度”却没有这种性质。(举例来说,我们最终要对泛函关于度规取变分,所以必须精确知道泛函如何依赖于度规,而指标记号很容易把这种依赖遮蔽起来。)
继续补充张量术语:如果交换一个张量的某些指标后张量保持不变,就称它在这些指标上对称。例如,若
就说
就说
表示
给定任意张量,我们都可以对任意多个上标或下标作对称化(或反对称化)。对称化时,对相关指标的全部排列求和,再除以项数:
反对称化则取交错和:
这里的“交错和”是指:由奇数次交换得到的排列取负号。因此,
注意,圆括号和方括号分别表示对称化与反对称化。有时,我们还希望对彼此不相邻的指标作(反)对称化;这时用竖线标出不参与求和的指标:
如果缩并的一对上标在某个张量上是对称的,那么下标中只有对称部分会有贡献。因此,
无论
但对三个或更多指标而言,一般没有
因为还存在混合对称性的部分,既未由对称部分指定,也未由反对称部分指定。最后,有些人采用省略
反对称张量也同样如此。
对于
如果把
(必须这样做,因为两个下标不能彼此求和。)尽管这是
(在
到目前为止,我们一直很注意清楚地区分:哪些性质总是成立(在带任意度规的流形上),哪些只在 Minkowski 时空的惯性坐标中成立。最重要的区别之一出现在偏导数上。在平直时空的惯性坐标中,一个
在 Lorentz 变换下具有正确的变换性质。然而,在更一般的时空中,这一点不再成立,我们必须定义协变导数来取代偏导数。即便如此,只要牢记这一限制,在当前这个特殊情形中我们仍可以利用偏导数能够给出张量这一事实。[这条警告唯一的例外是标量的偏导数
作者勘误(印刷页 28):原文把此处复数 tensors 误排成单数 tensor;译文按勘误表达为偏导数给出相应类型的张量。
有用的性质之一,是偏导数彼此可交换:
无论被微分的对象属于哪一种类型都成立。
1.8 Maxwell 方程
我们现在已经积累了足够多的张量知识,可以用实际物理来说明其中一些概念。具体来说,我们要考察电动力学的 Maxwell 方程。用十九世纪的记号,它们是
这里,
在这些表达式里,我们随意升降空间指标,并没有试图追踪度规究竟出现在哪里,因为
由式 (1.93) 和场强张量
要检验这一点,例如注意
利用
沿着类似思路推理——细节留作习题——可知式 (1.93) 的第三、第四个方程可以写成
很容易验证,
传统的四个 Maxwell 方程就这样被两个方程取代,生动展示了张量记号的简洁性。更重要的是,式 (1.96) 和 (1.97) 的两边显然都按张量变换;因此,只要它们在一个惯性参考系中成立,就必定在任意经过 Lorentz 变换的参考系中成立。张量在相对论中如此有用,原因就在这里:我们常常希望表述不依赖于任何参考系的关系,而一个方程两边的量必须在坐标变化下以相同方式变换。作为术语,我们有时会把用张量写出的量称为协变的(这里与“逆变”相对的“协变”无关)。因此,我们说式 (1.96) 与 (1.97) 合在一起构成 Maxwell 方程的协变形式,式 (1.92) 或 (1.93) 则是非协变形式。
1.9 能量与动量
关于如何照料和使用张量,需要知道的内容我们基本都已经讲过了。下一章会更仔细地考察流形与张量的严格定义,不过基本操作已经覆盖得相当充分。在进入更抽象的数学之前,先来回顾物理学在 Minkowski 时空中如何运作。
从单个粒子的世界线开始。它由一个映射
参数化曲线
不过,要留意这里悄悄施展的一点手法。度规作为一个
现在从一般路径转向有质量粒子的路径,它们总是类时的。由于固有时由沿类时世界线运动的时钟测量,用
由于
这种绝对归一化反映出:四维速度并非穿过空间的速度——后者当然可以具有不同大小——而是“穿过时空的速度”,我们总以同样速率穿过时空。四维速度的范数总为负,因为这里只对类时轨迹定义它。对于类空路径也可以定义类似的向量;对于类光路径,固有时为零,所以
一个相关向量是动量四维向量,定义为
其中
其中
或者
其中
相对论以前的物理学以 Newton 第二定律
Newton 物理中最简单的力是引力。但在相对论中,引力由时空自身的曲率描述,并不用力来描述。所以我们改看电磁作用。三维 Lorentz 力为
作者勘误(印刷页 32):扫描本在式 (1.106) 右端漏印了负号;这里依照作者官方勘误补为
。
你可以自行验证,在低速极限下它会化为 Newton 版本。请注意,要求这个方程具有张量形式——这是保证 Lorentz 不变性的一种办法——会
严格限制我们能够得到的表达式。这体现了一个非常普遍的现象:面对表面上无穷无尽的候选物理定律,对称性的要求会从中选出少数几个。
虽然
只用一个动量四维向量场不足以描述流体的能量与动量;我们必须进一步定义能量-动量张量(有时称应力-能量张量)
不过,这里的定义确实带来一些物理洞见。考虑静止系中的一个无穷小流体元,其中没有整体运动。于是
这里不对
为使这些说法更具体,先从尘埃这个简单例子开始。(宇宙学家往往把“物质”当作尘埃的同义词。)在平直时空中,尘埃可以定义成一组彼此相对静止的粒子。四维速度场
其中
按定义,能量密度完全确定了尘埃。但
其中
尘埃不足以描述广义相对论中出现的大多数有趣流体;不过只需略作推广,就能得到完美流体的概念。完美流体可由两个量完全指定:静止系能量密度
(请记住,我们仍在平直时空中;引入曲率后这一点会改变。)当然,我们想要一个在任意参考系中都适用的公式。对于尘埃,我们有
老实说,这个猜测并不特别聪明。不过,从我们想要的答案中减去这个猜测,可以看出还需加上
幸运的是,它有一个显然的协变推广,即
导出这个公式的过程看上去也许有些武断,但我们可以对结果完全放心。既然式 (1.111) 应当是
完美流体概念足够一般,能够描述多种多样的物质形态。为了确定这种流体的演化,我们指定一个把压强和能量密度联系起来的状态方程
除了对称以外,
这个表达式是一组四个方程,每个
动量第
为了分析这个方程的含义,把它分别投影到沿四维速度场
要把式 (1.116) 沿四维速度投影,只需与
令它为零,就得到完美流体的相对论性能量守恒方程。在非相对论极限中,它的形式会更熟悉;该极限满足
最后一个条件很合理,因为压强源自各个粒子的随机运动,而在这个极限中,这些运动以及由
这就是能量密度的连续性方程。
接下来考虑式 (1.116) 中正交于四维速度的部分。要把一个向量投影到
要确认它确实有效,可以检验:若一个向量
把它用于
在式 (1.119) 给出的非相对论极限中,令这个表达式的空间分量为零,得到
不过请注意,最后一组项包含
这就是流体力学中熟悉的 Euler 方程。
1.10 经典场论
当我们从狭义相对论过渡到广义相对论时,度规
先从熟悉的例子开始:坐标为
其中函数
其中
例如,
场论的故事很相似,只是把单个坐标
变量的函数,例如一个场在时空某区域中的全部取值。泛函通常表示成积分。每个
这里采取的是非常朴素的观点:把一形式场当作四个不同函数,而不把它当成单个张量对象。只要坚持使用固定坐标系,这个观点就很合理,也会让计算更直接。
在场论中,Lagrangian 可以表示为 Lagrangian 密度
因此作用量是
Lagrangian 密度是 Lorentz 标量。当我们说“Lagrangian”时,通常指的就是“Lagrangian 密度”。用 Lagrangian 密度来指定一个场论最为方便,因为所有运动方程都能很容易地由它导出。
我们将使用“自然单位制”:除了
我们最常用能量或质量作为基本单位。作用量是具有能量单位的
体积元的单位是
所以为了得到无量纲作用量,Lagrangian 密度的单位必须是
Euler–Lagrange 方程来自这样一项要求:在场发生小变分时,作用量保持不变,
相应地,作用量变为
我们希望对第二项分部积分,从被积函数中提出
最后一项是全导数——形如
于是只剩下
泛函
来定义。因此,可以用“泛函导数为零”来表达
这些方程称为平直时空中场论的 Euler–Lagrange 方程。
最简单的场是实标量场:
稍微复杂的例子包括复标量场,或从时空到任意向量空间、甚至任意流形的映射;后者有时称为“非线性 sigma 模型”。量子化以后,场的激发可以作为粒子观测到。标量场产生无自旋粒子,向量场和其他张量则产生更高自旋的粒子。如果场是复的而非实的,它会有两个自由度而非一个,可解释成一种粒子及与之不同的反粒子。实场是它自己的反粒子。实标量场的一个例子是中性
所以来考虑单个实标量场的经典力学。它有一个作为时空局部函数的能量密度,其中包含各种贡献:
实际上,势是 Lorentz 不变的函数,但动能和梯度能各自并不具有 Lorentz 不变性;不过,可以把它们合成一个明显具有 Lorentz 不变性的形式:
[组合
它把“动能减势能”推广为“动能减梯度能再减势能密度”。请注意,由于
对于式 (1.148) 的 Lagrangian,有
这两个方程中的第二个稍微有些棘手,所以慢慢来看。对 Lagrangian 求导时,诀窍是确保指标位置“相容”:如果求导所依据的对象带下标,那么被微分表达式中出现同类对象时也应当只带下标;同时还要确保各指标严格不同。我们的例子已经满足第一条,因为我们正对一个
接着可使用一般规则:对于像
因为
这就导出式 (1.150) 的第二个表达式。
把式 (1.150) 代入式 (1.144),得到运动方程
其中
势
方程是
即著名的 Klein–Gordon 方程。这是线性微分方程,所以两个解之和仍是解;一整套完备解很容易以平面波形式找到,你可以自行检验。
电磁学提供了一个稍微复杂些的场论例子。前面说过,相关的场是向量势
从这个定义可见,场强张量具有规范不变性这一重要性质:对向量势施行规范变换
场强张量保持不变:
最后一个等号来自偏导数彼此可交换,即
我们已经知道,电磁学的动力学方程就是 Maxwell 方程 (1.96) 和 (1.97)。用向量势定义场强张量之后,式 (1.97) 会自动成立:
原因仍是偏导数彼此可交换。另一方面,如果我们颇有先见地选择 Lagrangian,式 (1.96) 就等价于如下形式的 Euler–Lagrange 方程:
其中 Lagrangian 取为
作者勘误(印刷页 42):原文在包含式 (1.160) 的句子中把 strength 误排为 stregth;译文已按勘误采用“场强”。
对这一选择,Euler–Lagrange 方程的第一项很直接:
第二项更棘手。首先把
我们希望
又因为
把式 (1.166) 与式 (1.165) 合并,得到
所以
把式 (1.163) 和 (1.168) 代入式 (1.161),恰好得到式 (1.96):
请注意,为了避免一个讨厌的负号,我们交换了
如果早在知道 Lagrangian 之前,我们就能发明运动方程——Maxwell 对他的方程正是如此——你也许会问,引入 Lagrangian 表述的目的何在。理由有好几个;
作者勘误(印刷页 43):扫描本把式 (1.163) 后一句中的 trickier 误排为 tricker;译文已按勘误写作“更棘手”。
首先,把单个时空标量函数即 Lagrangian 密度作为出发点,在根本上比假定若干条可能取张量值的运动方程更简洁。另一个理由是,对称性很容易实现:要求作用量在某种对称性下保持不变,就能确保动力学也尊重这种对称性。最后,第 4 章会看到,通过一套直接步骤——其中涉及关于度规本身作变分——作用量会导出唯一的能量-动量张量。把这个步骤应用于式 (1.148),直接得到标量场论的能量-动量张量:
类似地,由式 (1.162) 可以导出电磁场的能量-动量张量:
使用相应的运动方程,可以证明这些能量-动量张量守恒,即
我们考察的两个例子——标量场论和电磁学——是当前理解自然界时所采用的大部分范式。粒子物理标准模型由三类场组成:规范场、Higgs 场和费米子。规范场描述自然界的“力”,除了电磁作用,还包括强、弱核力。产生核力的规范场和电磁学一样,也由一形式势描述;不同之处是,它们取矩阵值而非普通一形式的值,因此与规范变换相应的对称群是不可交换的,也就是非 Abel 对称性。Higgs 场与前述标量场十分相似,只是也取矩阵值。费米子包括轻子(例如电子和中微子)与夸克;它们不用我们讨论过的任何张量场来描述,而用另一种称为旋量的场来描述。本书不会讨论旋量,但它们在粒子物理中扮演关键角色,并且它们与引力的耦合既有趣又微妙。量子化以后,这些场产生不同自旋的粒子:规范场为自旋
结束本章之前,先问一个简单得让人有些尴尬的问题:为什么要考虑某一种经典场论,而不考虑别的?更具体地说,假设我们发现了自然界中的某个粒子,也知道想用哪一种场来描述它,那么应当如何为这个场选择 Lagrangian?例如,写下标量场 Lagrangian (1.148) 时,为什么没有包括形如
的一项,
其中
不过,量子场论确实提供了一些简单指导原则;既然我们把经典场论用作某个底层量子理论的近似,利用这些原则就很合理。长话短说:量子场论允许任意高能量下的“虚”过程对低能观测作出贡献。幸运的是,这些过程的影响可以归纳在一个低能有效场论中。在这个有效理论——也就是我们实际观测到的理论——里,高能过程的结果只是把理论的耦合常数“重整化”。考虑任意耦合常数;可以把它写成具有质量量纲的参数
正如本节开头提到的,广义相对论本身就是经典场论,其中动力学场是度规张量。不过,把 GR 看成某种不同的理论仍然很合理:其他经典场论大多依赖预先存在的时空几何,而在 GR 中,几何由运动方程决定。(这也有例外,称为拓扑场论;在这类理论中,度规完全不出现。)接下来几章的任务,是探索由时空度规刻画的弯曲几何之性质,然后在第 4 章用这些观念构造引力理论。
1.11 习题
考虑惯性参考系
,坐标为 ;另一参考系 的坐标为 ,它相对于 沿 轴方向以速度参数 作 boost。设有一面静止在 中的墙,沿直线 放置。从 的观点看,一个在 - 平面内运动并撞上墙的球,其入射角与反射角之间有什么关系?碰撞前后的速度又如何?作者勘误(印刷页 45):习题 1 原文后半句把 wall 误写成 mirror;译文统一采用“墙”。
设想空间——并非时空——实际上是一个有限盒子;更讲究地说,是尺度为
的三维环面。这里的意思是,存在坐标系 ,使坐标为 的每一点都与坐标分别为 、 和 的每一点等同。注意时间坐标保持相同。现在考虑两位观察者:观察者 在这个坐标系中静止,也就是空间坐标恒定;观察者 沿 方向以恒定速度 运动。 和 从同一事件出发; 留在原地, 绕宇宙一周,再回来与 的世界线相交,整个过程中都不必加速,因为宇宙是周期的。在这段时间里, 和 各自经历的固有时之比是多少?这与你对 Lorentz 不变性的理解一致吗?观察者
看到三个事件 按照 的顺序发生。另一个观察者 看到它们按 的顺序发生。第三位观察者是否可能看到这些事件按 的顺序发生?画一幅时空图支持你的结论。投影效应可能让你以为某个天体物理对象在作“超光速”运动。考虑一个类星体,它以速度
喷出气体,喷射方向与观察者视线成角 。投影到天空上,气体看起来以角速度 垂直于视线运动;其中 是类星体的距离, 是表观速度。推导用 和 表示 的表达式。证明:适当选择 与 时, 可以大于 。粒子物理学家太习惯设
,以至于会用能量单位测量质量。具体而言,他们常用电子伏特更常用的还有
、 和 ,分别是 、 和 。测得 μ 子(muon)的质量为 ,静止系寿命为 秒。设这样一个 μ 子在粒子加速器直径为 千米的圆形储存环中运动,其总能量为 。从实验者的观点看,它会存活多久?它会绕环运动多少弧度?在 Euclid 三维空间中,令
为坐标 的点。考虑下列经过 的曲线:(a) 在坐标基
中,计算这些曲线在 点的切向量分量。(b) 令
。计算 、 和 。设有一个张量
和一个向量 ,其分量为
求下列各量的分量:
(a)
(b)
(c)
(d)
(e)
(f)
(g)
若
,那么空间向量 在物理上表示什么?用尘埃的能量-动量张量论证你的结论。对离散点粒子系统,能量-动量张量具有形式
其中指标
标记不同粒子。证明:对于速度各向同性分布的稠密粒子集合,可以把各条粒子世界线平滑化,得到完美流体能量-动量张量 (1.114)。把张量变换定律用于
,说明电场与磁场三维向量 、 在下列变换下如何变化:(a) 绕
轴的旋转;(b) 沿
轴的 boost。验证式 (1.98) 确实等价于式 (1.97),并且它们都等价于式 (1.93) 的后两个方程。
考虑我们明确讨论过的两个场论:Maxwell 电磁学(令
),以及由式 (1.148) 定义的标量场论。(a) 用三维向量记号表示两个理论各自能量-动量张量的分量;使用散度、梯度、旋度、电场、磁场,并用上方圆点表示时间导数。
(b) 使用运动方程验证——可以采用任何你喜欢的记号——这些能量-动量张量都是守恒的。
考虑给电磁学 Lagrangian 增加形如下式的一项:
(a) 用
和 表示 。(b) 证明加入
不会影响 Maxwell 方程。你能想到其中更深层的原因吗?