“我经常举的一个例子是,我对一个矩阵的‘行秩’和‘列秩’为什么会相等的好奇。其实在任何基本的线性代数书里,我们都可以找到它们为什么相等的证明。但是从那些逻辑推理的外表,我实在看不出它们为什么会巧合地相等。在我真正了解到它们为什么会一样的过程中,这个好奇却帮我了解了许多广义逆矩阵的几何意义。”
——李天岩《回首来时路》
编者提醒:文中提到的经典教材《线性代数应该这样学》,最新电子版(包括中文翻译版本)现已免费公开在 Sheldon Axler 教授的个人主页。读者可直接访问 https://linear.axler.net/ 下载获取。该书强调数学结构和几何直观,弱化矩阵计算,适合已经学过一遍线性代数,想要从更高视角加深理解的读者。
撰文| 朱慧坚(广州南方学院数学与统计学院副教授)、丁玖(南密西西比大学数学系退休教授)
在理工科基础课《高等代数》或《线性代数》中, “ 矩阵 ” 或许 是 出现频率最高 的 数学词汇, 其重要性 不亚于 《数学分析》或《高等数学》 中的“函数” 。 对于 电子 工程 或计算机科学 等应用学科的学生们而言 ,矩阵在《线性代数》中 的 一项 基本 用 途是 求解线性方程组,因为线性方程组的 所有 系数 若 不变动位置, 可以 自然 地 排 成一个有几行几列的数组 , 即 矩阵 的形式,然后 利用 课本中 定义的一系列 矩阵 运算 和 性质 ,同学们 便掌握了求解方程组的有力工具。 然而 在面向数学专业的《高等代数》课程中, 矩阵 不仅延续了 求解线性方程组的 传统 功能 ,还 挺身而出 , 担 当了 连接 抽象概念和具体模型 的 桥梁 重任 ,用 更 专业一点的话来说就是:任何 两个 有 限 维向量空间之间的线性 映射 ,只要在定义域 向量 空间和值域所属的 向量 空间中各自选取了一个基底,那么这个线性 映射 就有一个 唯一确定 的 、 看得见摸得着的 “矩阵表示”,这时“矩阵有 大 用”的威力就充分显现了。
“打倒行列式!”
笔者 分别 在中美两国的大学 多次讲授 《线性代数》,所用的都是畅销 教材 。在中国 使用的 教材 是 工程名校同济大学编写 的 《 工程数学· 线性代数》,第一版 四十四 年前问世,第七版三年前推出 ; 在美国 则 教过 一 浅 一 深的 两门课: 《线性代数 I 》和《线性代数 II 》 。 前者本质上只讲矩阵的初等理论,与 上述 同济大学 教材的覆盖面相仿;后者主要 学习 有限维向量空间之间的线性 映射 理论,这时矩阵 大致 起到“助手”或“工具”的次要作用。
矩阵的历史源远流长。早在 近两千年前 的 中国古代数学典籍《九章算术》中 , 它便已初现端倪, 并被 三国时期 的 伟大数学家刘徽 (约 225 年 - 约 295 年 ) 所应用。 1850 年, 英国 大 数学家西尔维斯特 ( James Joseph Sylvester , 1814 - 1897 ) 正式 将其 命名 为 matrix ;随后,比他 小七岁 的 律师 兼 数学家凯莱 ( Arthur Cayley , 1821 - 1895 ) 率先 引入了矩阵的代数运算。 一百五十 年来 ,矩阵 一直 被 代数学家和工程技术家 们“ 玩 ” 个 不停, 其 卓著 功勋,不在话下 。
因为 线性代数 入门 教程 主要讨论作为具 体 代数 运算 对象的矩阵,中美两国的 传统 教科书一般 都 沿着 数学 史 发展 的足迹,在正式开讲矩阵前,第一章先讲行列式。 然后以它为主要工具, 一章又一章、 一节又一节地推演出矩阵 几乎数不清的种种 性质,比如具有非奇异系数矩阵的线性方程组 的著名解公式 ; 它 完全依赖于行列式的 计算 ,名为克 莱姆 法则。还有,可逆矩阵的逆矩阵有个看上去美 丽 简洁的逆矩阵公式,其每个元素的计算 都少不 了行列式帮 大 忙 ; 可惜这个忙帮得 太花时间,以至于后世 强调高效实用 的计算数学家和工程师 早就把这个 “ 中看不中用 ” 的求逆公式弃之不理了。
多年的教学实践提醒我们, 尽管行列式理论曾在 历史上 为 现代数学的 不断进步 立下过汗马功劳 , 但 如今 它 对线性代数的影响力 已 日渐式微 。 其繁琐的计算公式,无论是 基于排列 的 和式 定义 , 还是 拉普拉斯 展开,都 难 以 讨得 学生 欢心 ,有时 甚至 会引起 他们 的恐惧 和 反感 —— 尤其 是在需要 化简一个颇为复杂的行列式时 。 所以,在线性代数的数学教育中 出现了一种质疑的声音: 行列式 是否仍有讲授的必要 ?
恰好三十年前,美国数学家 阿克斯拉 ( Sheldon Axler , 1949 - ) 教授在 读者如云 的 数学期刊 《美国数学月刊》 ( 第 102 卷 )上, 发表了 题为 Down with Determinants! (《打倒行列式!》 ) 的文章。 文章摘要 的 第一句开宗明义:
“ 本文展示了在没有行列式的情况下 , 如何 更好地 构建 线性代数。 ”
第二年,《美国数学月刊》的东家——美国数学协会将 1996 年度的 “ 莱斯特 · R · 福特 阐述写作 奖 ” 颁给了 阿克斯拉 ,表彰他这篇影响深远的数学檄文 。笔者之一在密歇根州立大学数学系 攻 读博士学位时, 修 过 阿克斯拉教授 一 学年的《高等泛函分析》研究生课程, 为 他的教学艺术所倾倒, 当年 提名他 评选 教学奖,他也当之无愧地 将其 收进囊中 ;须知他 1975 年从加州大学伯克利 分校 博士毕业后 , 去麻省理工学院担任 两年 摩尔讲师( 极 富荣誉的一种博士后位置) 期间 , 就获得过 校级 教学奖。
在 “讨伐”行列式的同一年年底, 阿克斯拉教授 出版了教科书 《线性代数应该这样学》 ( Linear Algebra Done Right ) ,其写作风格 继承了他的 师祖 、美国数学写作与演讲高手 哈尔莫斯 ( Paul Halmos , 1916 - 2006 )的名著《有限维向量空间》( Finite - Dimensional Vector Spaces ) ,即用基于集合论的 函数 语言撰写 代数课本。 正如 阿克斯拉教授 在前述文章中所宣称的,他没有拿起行列式这把榔头 来 捶打出线性代数的各种零件 , 不过还是 给予 行列式足够的礼遇 —— 将 它放 进 了 全 书 十章的 最后, 与矩阵 迹 共享一章, 毕竟 它是 矩阵之 子 (西尔维斯特给矩阵所取 的 英文名 字 matrix 来自 拉丁语 matrix ,原意 为 “子宫”, 隐喻 行列式 为 矩阵 所生 ) 。
阿克斯拉 教授精心写作的这部教材在美国高校极受欢迎。 2009 年 , 人民邮电出版社 翻译 出版了该书, 此后一直 跟随英文新版 更新译本 , 目前已出版至第四版。 积极从事数学普及的西北农林 科技 大学林开亮博士 , 还在《数学文化》杂志上发表了热情 洋溢 的书评。
《线性代数应该这样学》 的 译者在序中写道: “ 描述线性算子的结构是线性代数的中心任务之一,传统的方法多以行列式为工具。作者认为行列式既难懂又不直观,还缺少动机,并且导致思路曲折,从而掩盖了线性代数的本质。因此,本书完全抛开行列式,采用更直接的方法阐述了线性算子的基本理论,作者认为这种方法可使学生更加直观、深刻地理解线性算子的结构,线性代数就应该这样教与学。 ”
这本书 起点较低,不需要太多预备知识,而特色鲜明,是公认的阐述线性代数的经典佳作。原书自出版以来,迅速风靡世界,其中包括斯坦福大学和加州大学伯克利分校等著名学府。 根据 阿克斯拉教授 不断更新 的统计 数据 , 到目前 为止 全球 共有超过 四百二十 所大学和学院采用 这本 书 作为 教材 。笔者之一任教的大学数学系也慧眼识珠,及时用它替换了 旧教材 。当笔者再次讲授这门课 时 ,书中清晰易懂的语言表述与滴水 不漏 的 逻辑 推理 , 令 笔者 马上想起八十年代末那个学年 , 自己 坐在教室 里 , 看 阿克斯拉教授演绎 泛函分析 之美 的生动场景。 到了 2020 年 ,阿克斯拉教授出版新书 Measure, Integration & Real Analysis ( 《 测度、积分和实分析 》 ) , 并告诉 笔者 他一如既往地将电子版免费 上线。笔者 毫不犹豫地选择了 这本书 来 讲授《实分析》课程,再一次满怀喜悦地 品味 了他的写作风格。
重新定义“秩”的基石
与矩阵形影不离的一个数学概念是“矩阵的秩”,它在线性代数 中 的 地位,堪比 微积分中的 “导数” 。在通常的教科书中,由于行列式最早登台亮相,自然它必须身兼数职,不仅要服务好之后登场的逆矩阵计算,也要充当矩阵 秩 的 “ 解说员 ” 。它向 学生 们这样介绍矩阵 秩 的概念: 矩阵的秩是其非零子式的最大阶数 。这句简洁的定义更通俗地说就是: 从矩阵中 任取 k 行 k 列 元素 而 不改变相对位置,组成一个 k 阶 方阵,其对应的行列式称为原矩阵的 k 阶 子式 。如果 所给的矩阵有一个 k 阶子式不等于 0 ,但所有更高阶的子式都等于 0 ,那么我们就说这个矩阵的 秩 为 k 。
看来,按照这个定义,要找到一个矩阵的秩,我们必须耐心地计算 不同阶数的 子式,直到算出一个 子式 不为 0 ,但又 要 确保 更高 阶数的子式统统 等于 0 ,才 算 大功告成。对学生而言,即便 将 这个定义 背得滚瓜烂熟 , 也很难 理解“秩”的意义到底是什么 , 可能 知其然而不知其所以然 。为了做习题 应付 考试,只好 硬着头皮 死算一通 ,以期熟能生巧。
现在, 让 我们暂时忘掉行列式,或 者干脆 假设它只是小说家杜撰出的一个 莫名其妙的 概念, 以此来 重新定义矩阵的秩。 当然 到 了最后,为了让读者信服新定义 其实与基于行列式计算的旧定义殊途同归, 我们 将 再 请行列式 “ 复活回归 ” , 举杯 共贺对“秩”的新解释。
在进入 下面的数学 讨论之 前,我们 先 做两点说明 。 首先, 为了 与 笔者此前 文章 保持 一致,本 文将 继续采用泛函分析中 的 通用 术语 “线性算子” ( linear operator ) ,而不用 常见的 “ 线性映射 ” ( linear map , 如 前述 阿克斯拉教授的 著作 )或 “ 线性变换 ”( linear transformation , 见 多数线性代数教科书 ) 。 其次, 和以前一样,我们只在实数范围内谈论矩阵,当然文中的结果对复矩阵甚至一般数域 上 的矩阵 也成立 。 照常, 符号 R 代表实数 集 。
既然矩阵是上下左右排列整齐 、 有几行几列的一组数,它免不了要和只有一行的数组 (称为 行向量 ) 和只有一列的数组(称为 列向量 )发生联系。某 个 向量中的分量个数如果是 n ,就称它是 n 维向量 ,并把所有的 n 维向量全体用符号 R n 表示。这样, R n 中的一般元素写下来就是 行向量 x = ( x 1 , …, x n ) 或 列向量 x = ( x 1 , …, x n ) T , 其中大写 的 T 是英文单词 transpose 的首字母, 表示“ 转置 ” ,即将矩阵的 第 i 行变为 第 i 列的操作。
为了节省 篇幅 , 本 文中的向量一般写成行 向量 ,但为了满足矩阵乘法 对行或列数 的基本要求, 它们 有时被看成是列向量,反之亦然。在 R n 中 定义了 标准的向量加法(对应分量相加)和数乘向量( 数乘各分量 ) 这两种代数运算,因而 R n 有资格成为一个 向量空间 (也称线性空间) 。 向量空间中的元素称为向量。 R n 的子 集 M 如果对这两种运算是封闭的,也就是说, M 中任意 两个向量之和以及任意数与向量的标量积 依然属于 M ,则 M 也是一个向量空间,称为 R n 的 子空间 。 在 R n 内再定义标准的 内积 运算: 向量 x = ( x 1 , …, x n ) 和 向量 y = ( y 1 , …, y n ) 的 内积 是数 x 1 y 1 + … + x n y n ; 熟悉 矩阵乘法的读者可以把它写成 更紧凑的形式 y T x ( 这里向量 x 、 y 被理解为列向量 ) 。有了内积, R n 便升格为 欧几里得空间 ,因为内积概念引出了正交 —— 就像欧几里得平面几何中两条互相垂直的线段那样。 通过内积还可以定义向量的 长度 , 正式 学名叫范数: R n 中向量 x = ( x 1 , …, x n ) 的 范数
它是 二维或三维向量通常长度的直接推广。
按照定义,如果欧几里得空间 R n 中的向量 x 和 向量 y 的 内积为 0 ,则说 x 和 y 正交 ,记为 x ⊥ y 。 任给 R n 的一个子集 S ,空间 R n 中所有与 S 内 每一个向量都正交的向量组成的集合, 称为 S 在 R n 中的 正交补 , 记为 S ⊥ 。 读者可以证明 S ⊥ 也 是 R n 的一个子空间。比如说,在平面 R 2 内,单点集 S = {( 1 , 1 )} 的 正交补是 一条 通过原点的直线 {( t , -t ) : t 为所有实数 } ,这是极易验证的。
笔者一年前在《返朴》 登载文章《》,把任意给定的 m 行 n 列矩阵 A = ( a ij ) 视为 将 R n 映射到 R m 的 一个 线性算子, 其函数法则是 , 将 R n 里 的 任意 向量 x 映到 R m 中的 对应 向量 y = Ax , 即矩阵 ( a ij ) 与 列向量 ( x 1 , …, x n ) T 的 乘积, y 的 第 i 个 分量是
取 遍 R n 中的所有向量 x ,得到 的 所有向量 Ax 在 R m 中组成一个集合 ,很容易验证 ,这个集合是 R m 的一个子空间,叫做线性算子 A 的 值空间 ,记成 R ( A ) 。这里 的字母 R 与表示实数集的 R 没有关系,而是英文单词 range (值域)的首字母。 与 A 相关的 还有一个向量空间,它是定义域 R n 的 一个 子空间,由 R n 中所有被 A 映到 R m 中零向量的向量 组成 ,记为 N ( A ) 。这里的 N 是英文单词 null (零) 的首字母。这两个 线性子空间 在线性代数中与线性算子 A 地位同等 , 将在下面的讨论中大放异彩。为了让它们给读者留下更深刻的印象,我们用数学语言 把 它们 写成 :
线性相关 与基底
有了 上面的预备知识,我们 现在 着手建立矩阵 秩 的概念 。 不过在此之前,必须先掌握线性代数中另一个 关键 概念。 先 看 一个示例 , 给出三个向量
x= ( 1, 2, 3 ) , y= ( 1, 1, 1 ) , z= ( 0, 1, 2 ) .
通过 简单的观察 可以 发现, x 减去 y 恰好就是 z ,即 z = x – y 。等式的左端 只有 一个单独的向量,而右端是另外两个向量的某种组合。 因为这种组合是 将一个向量组中的向量乘以 常数系数 ( 本例中是 1和-1) 再求和的结果 , 所以我们说这 是一个线性组合 , 即 向量 z 是向量 x 和 y 的线性组合 。 现在,我们将这个线性组合的关系 式 z = x - y 改写 成 一边 只 剩零向量 的形式 :
1x+ ( -1 ) y+ ( -1 ) z=0,
注意到三个向量 x, y, z 前面 的系数不全为 0 (事实上就此例而言,它们都不为 0 ) 。这时我们说给定的向量 x, y, z 线性相关。
接下来, 我们 考察 这三个向量中的前两个 x 和 y ,看一看 它们 是否也 线性相关—— 是否存在两个不全为 0 的数 α 和 β ,满足等式 α x + βy = 0 。 将 x 和 y 的分量代入,简单的 代数 运算给出 下面关于未知数 α 和 β 的一个线性方程组:
α+β=0, 2α+ β =0, 3α+β=0.
它只有平凡解, 即零解 α = 0, β = 0 。 这说明,使得线性组合 α x + βy 等于 零向量 的 系数 α 和 β 只能全为 0 。 换言之,两向量 x 和 y 不像上面的 x, y, z 那样是线性相关的。这 个 时 候 我们说 向量 x 和 y 是线性无关或线性独立的。
读懂了上面的例子,下面关于线性相关或线性无关的定义就 不难 理解了。 由于涉及 多个向量,我们不再 使用 x, y, z ,而是 改用带下标的字母 v 表示向量, 这里的
v是 英文单词 vector (向量)的 第一个 字母。 给定 欧几里得空间 R n 中的 k 个 向量 v 1 , v 2 , . .. , v k , 如果存在 不全为零 的常数 α 1 , α 2 , ..., α k 使得
就称向量 v 1 , v 2 , . .. , v k 线性相关 ; 如果满足上述要求的 α 1 , α 2 , ..., α k 不存在,则称 v 1 , v 2 , ..., v k 线性 无 关 。 由此定义可知,给定向量 v 1 , v 2 , ..., v k 线性无关 , 当且仅当只要 上 式成立, 则 其左端 所有 的 系数 α 1 , α 2 , ..., α k 必 定 全为零。
对于 R n 中给定的 k 个 向量 v 1 , v 2 , ..., v k 和 k 个标量 α 1 , α 2 , ..., α k , 形式为 α 1 v 1 + α 2 v 2 +⋯+ α k v k 的向量 被 称为 v 1 , v 2 , ..., v k 的一个 线性组合 。 读者 不难证明,给定向量 v 1 , v 2 , ..., v k 的 所有线性组合全体是 R n 的一个 子空间,称为由 v 1 , v 2 , ..., v k 张成 的向量空间,记为 span { v 1 , v 2 , ..., v k } , 而 集合 { v 1 , v 2 , ..., v k } 则 称为 这个空间的 张成 集 。 如果一个向量空间 可由 有限个向量张成,则说它是 有限维 的,否则称为 无限维 的 (例 如 , 所有多项式组成 的向量空间就是 无限维 的) 。 线性代数研究有限维向量空间,而把无限维向量空间 留给 泛函分析 去探讨 。
从上 两 段中的 定义 , 易得 下面 五 个有用的 简单 事实:
(1)若一组向量包含零向量,则它们必定线性相关 ;
(2)若一组向量线性无关,则去掉其中任意一个 向量, 所剩向量也线性无关 ;
(3)若一组向量线性相关,则加进任意一个向量后也线性相关 ;
(4)若一个向量是其他几个向量的线性组合,则所有这些向量线性相关 ;
(5)在一个向量空间的张成集中,如果某个向量是 集内 其他向量的线性组合,那么该张成集去掉此向量后 , 剩余向量 依然张成同一个向量空间。
为了诠释上述一般定义,下面给出一个 最有 代表性 的例子 。 我们取 R n 中 n 个 “ 单位坐标向量 ” ,用 带下标的 字母 e 表示 ,以示特别 :
其中 第 i 个 向量 e i 的第 i 个 分量为 1 ,其余分量 均 为 0 。 显而易见, 这组向量 是线性无关的。更进一步, R n 中的 任意 向量 v = ( α 1 , α 2 , ..., α n ) 都可 表示 为 α 1 e 1 + ⋯ + α n e n 。也就是说, R n 中的所有向量都是单位坐标向量 e 1 , e 2 , … , e n 的 线性组合。
这样说来, R n 的单位坐标向量 e 1 , e 2 , … , e n 满足两个重要性质:( i )它们是线性无关的;( ii )它们所有的线性组合 填满了 R n ,即 e 1 , e 2 , … , e n 张 成 R n 。 由此 我们说 { e 1 , e 2 , … , e n } 是 R n 的一个基底, 此外, 这个基底中的向量相互正交 , 且长度 均为 1 。 它是 R n 最 典雅的基底, 被称为 n 维欧几里得空间 R n 的 典范基 。
基于 上面 对典范基的具体讨论,我们可以 将基底概念 推广至 R n 的任意子空间 , 并 定义 空间 的 维数。 假定 M 为 n 维欧几里得空间 R n 的 一个 非空 子空间。如果在 M 中存在 k 个 线性无关的 向量 v 1 , v 2 , . .. , v k ,且 M 中的任一向量 v 都是 v 1 , v 2 , ..., v k 的线性组合, 则称 { v 1 , v 2 , ..., v k } 为 M 的一个 基底 ,并将正整数 k 叫做 M 的 维数 。 简言之, 向量 空间的 基底 是张成 该 空间的线性无关向量组, 维数是 这个 组的 向量个数。然而, 要使维数 的定义合理, 我们必须确保它 仅仅依赖于 M 本身, 而与基底的具体选择无关 。换言之, 若 { u 1 , u 2 , ..., u l } 是 M 的另一个基底,那么 l = k 。 这个 结论 当然 正确 ,下面 对此 作出 证明 。
我们只需 论 证 k ≤l 就 够了,因为互换 这 两个基底 便 推出 l ≤k , 从而 得证 l = k 。 事实上 ,我们可以证明更一般的 命题 :
引理 1 . 若向量空间 M 中的向量 v 1 , v 2 , . .. , v k 线性无关 , 且向量 u 1 , u 2 , ..., u l 张成 M ,则 k ≤l 。
证明 . 由假设可知 u 1 , u 2 , . .. , u l 张成 M ,故 v 1 是 u 1 , u 2 , ..., u l 的线性组合, 因而 存在常数 α 1 , α 2 , ..., α l ,使得 v 1 = α 1 u 1 + ⋯ + α l u l 。将 该式 改写成 线性相关 的形式
因为 v 1 不是零向量 ( 否则与 v 1 , v 2 , ..., v k 线性无关矛盾 ) , 故 α 1 , α 2 , . .. , α l 中至少有一个是非零数 。 令 α r 为它们当中最后一个非零数,则
因此由上面列出的 事实 ( 5 )知,用 v 1 取代 M 的张成 集 { u 1 , u 2 , ..., u l } 中 的 uᵣ
,所得的 新 向量集 (向量个数还是 l ) 依然张成 M 。 这就完成了证明的第一步。
按照与上面同样的方法 进行归纳 , 经过 s - 1 次替换 ( s = 2, … , k ) ,依次用 v 1 , v 2 , . .. , v s- 1 取代 张成集中的一个向量 , 得到的新集合依然张成 M 。 所以 v s 是目前的张成集中向量的线性组合 :
其中 ω 是 张成集内 剩余
u的 线性组合,它们的 系数不能全为 0 ,否则与 v 1 , v 2 , . .. , v k 线性无关矛盾 。 所以一定存在 某个迄今留下的uj,它是v1, v2, ..., vs-1, vs和其他
u的线性组合 。 在张成集 内 用 v s 取代 u j 后,新集合张成 M ,且其中的元素个数保持为 l 。
到了最后一步,即 s = k 后, 所有的 v 1 , v 2 , . .. , v k 都逐次取代了张成集 { u 1 , u 2 , ..., u l } 中的一个向量 , 但原先的张成集元素可能还有剩余, 故 得 k ≤l 。 这就完成了这个关键引理的证明。
我们 由 此确认,有限维向量空间的维数仅仅依赖于空间本身,而 与 空间的基底 选取 无关。这也是人们将 R n 称为 n 维空间的道理所在。 下面再列出 两 个有关 事实 而不加 以 证明,不过爱好证明的读者可以 将它们一一 证出:
( 6 ) k 维向量空间 M 中的 k 个 线性无关向量 构 成
M的一个基底。
( 7 ) k 维向量空间 M 中 , 由 k 个 向量组成的 M 的 张成集 是 M 的一个基底。
为什么矩阵的行秩等于列秩 ?
现在 我们 可以用维数的概念来引进矩阵的秩了。 设 A = ( a ij ) 为一给定的 m 行 n 列矩阵 。将 它 按列划分 写成 A = [ a 1 , a 2, … , a n ] 的“块矩阵”形式,每块 a j 是一个 m 维列向量, 其中 j = 1, 2, … , n 。 任给 R n 中的列向量 x = ( x 1 , …, x n ) T ,矩阵乘法的定义给出
故 值 空间 R ( A ) 为 A 的列向量 的 所有线性组合全体,用数学表达式就是
我们将矩阵 A 的 列秩 定义 为值空间 R ( A ) 的维数。 由于矩阵的 值空间 由列张成,它也被称为矩阵的 列空间 ,与下一段定义的 行空间 相对应。
另一方面,我们把 A 从上到下 的 m 个 n 维 行向量 记成 b 1 , b 2 ,. .. , b m 。 由 A 的行向量的所有线性组合组成的向量空间 span { b 1 , b 2 ,..., b m } , 称为 A 的 行空间 。类似地, 矩阵 A 的 行 秩 定义为它的行空间的维数。 注意到如果运用矩阵转置的运算,那么 A 的行空间就是 A T 的列空间 R ( A T ) ,因而 矩阵 的 行秩不外乎 就是其转置矩阵的列秩。
那么,一个矩阵的行秩等于它的列秩吗? 要回答这个问题,我们 要用到 R n 中 的内积运算 所 引导出的 向量的正交概念。 我们 在之前 提到 过, R n 的 一个子集 S 在 R n 中的正交补 S ⊥ 是 R n 的子空间。现在取 S 为 R n 的任一子空间 M ,则如同笔者在文章《》中所 论证的, R n 中的任一向量 x 都是 M 中唯一的向量 y 和 M ⊥ 中唯一 的 向量 z 之和,用空间分解的术语表达,就是:欧几里得空间 R n 是子空间 M 和它的正交补 M ⊥ 的 直和 ,记成 R n = M ⊕ M ⊥ 。 在此正交分解下, 正交投影 P M 将 x∈ R n 映射到唯一的 y∈M , 是在数学中非常得宠的一类线性算子。 在笔者另一篇文章《》中,它扮演了成功的角色。
在维数计算中, 正交分解 R n = M ⊕ M ⊥ 的一大 优势在于, R n 的维数等于 M 的维数与M⊥ 的维数之和, 一个直观的例子是, 三维 xyz - 坐标空间 可以看作 二维 xy - 坐标平面与 同它垂直的 一维 z - 坐标轴的正交和。 所以 若 M 的维数为 k ,则M⊥ 的维数必定是 n – k 。 这个简单的算术关系将助我们一臂之力 , 证明本文的结论。
假设给定 m 行 n 列矩阵 A 的列秩为 r ( r 取自 rank 的首字母 ), 则 R ( A ) 是 R m 的 一个 r 维 子空间。 同理, 设 A 的行秩为 r ' , 则 R ( A T ) 是 R n 的 r ' 维 子空间。 为了证明 r = r ' ,我们还需要一个 形式优美、易于证明 的等式:
引理 2 . R(
AT ) ⊥ =N(
A) 。
证明 . 设 x∈ R(
AT ) ⊥ ,则与AT 的 值空间 中的所有向量都正交,即对所有的 y∈ R m 都有T
AT y =0 ,或等价地,
yT
Ax=0 。既然 y 是任意的,令 y = Ax ,便有 (
Ax) T
Ax=0 ,故 Ax = 0 ,即∈N(
A) 。
反之,若
∈N(A) ,则T
AT
y
yT
Ax=0 对所有的
y∈ R m 都满足,故 x 与
AT 的 值空间 中的所有向量都正交,即∈ R(
AT ) ⊥ 。所以 R(
AT ) ⊥ =N(
A) 。
数学运算经常让我们感到愉悦,比如不少操作连续做两遍等同于“ 回到原地 ”,这样的例子包括矩阵转置、矩阵求逆和子空间的正交补。 根据 上述引理等式,再利用“有限维子空间正交补的正交补 就 等于 原空间” 这一“二次不变性”,我们获得另一个有用的等式
通过 上式及欧几里得空间的正交分解,我们分别有 R n 和 R m 的如下分解:
我们 现在断言: A 将 R n 的子空间 R (
AT ) 一一对应地映到 R ( A ) 上面,即线性算子 A: R (
AT ) → R (
A) 既是 单 射 又是 满 射 。 满射是显然的,因为根据上面的左边直和分解, A 将 N(A) 映到 {0} ,故将 R ( Aᵀ
) 映成整个 R ( A ) 。再证 A 是 单射。 假设 = ,其中 , y ∈ R (
AT ) = N(
A) ⊥ ,则 ( − ) = − = 0 ,故 − ∈ () 。因为 N(
A) ⊥ 是 向量 空间, − ∈ N(
A) ⊥ 。 既然 () ∩ N (
A) ⊥ = { 0 } ,向量 − = 0 ,即 = 。这证明 了 A 限制在子空间 R (
AT ) 上 是一对一的。
两个有限维向量空间 M 和 N ,只要在它们之间建立了一个既单射又满射的线性算 子 T :
M
N,那么这两个空间将共享幸福(当然 也有 可能共 坠深渊)。比如说,如果 v 1 , v 2 , . .. , v k 在 M 中 线性无关 ,那么 T v 1 , Tv 2 , ..., T v k 在 N 中线性无关,反之亦然。 进而推出 : { v 1 , v 2 , ..., v k } 是 M 的 张成集 当且仅当 { T v 1 , Tv 2 , ..., T v k } 是 N 的 张成集 ; { v 1 , v 2 , ..., v k } 是 M 的基底当且仅当 { T v 1 , Tv 2 , ..., T v k } 是 N 的基底。 单射加上满射称为 双射 , 向量空间之间 的 双射 线性 算子 又称为 线性 同构 , 简称 同构。 这是最理想的情形了 ,因为在同构之下,两个向量空间具有 一模 一样的代数结构,特别地,它们有相同的维数。 一个著名的同构例 子是:向量空间 R n 与所有次数低于 n 的实系数多项式全体同构。
如上的讨论 顺便 回答 了文章标题 提出的问题:
定理 . 矩阵的行秩等于列秩 。
定义 . 矩阵的行秩或列秩称为矩阵的 秩 。
通过行列式学过矩阵 秩 的读者自然会问最后一个问题:你们定义的 秩 等于我们的 教科书中 定义的 秩 吗? 回答是,是的,它们是同一个 整 数。 但在这里,我们不打算细致讨论行列式与矩阵 秩 的关系,因为这些关系 相当地繁琐,这里就不 赘述 了 。但是,只要考虑可逆 矩 阵 A 这一 特殊 但 并 不太失一般性的 情形, 还是 能洞察 到 用“最大非零子式阶数”和用“线性无关张成集向量个数”这两种方法定义矩阵 秩 的等价性。
可逆矩阵 A 定义了双射 线性算子 A : R n → R n 。这时 A 的所有列向量一定是线性无关的 ,否则 A 就会将非零向量映成零向量,与其单射性 条件 矛盾 。而这些列向量同时也张成了 A 的 值空间 R n (因为 A 是满射) ,因此它们组成了 Rⁿ
的一个基底,故 A 的 秩 等于 n 。另一方面,根据行列式 的性质 ,行列式保持矩阵的乘法,即 两个同阶方阵 乘积的行列式等于这两个方阵行列式之积。可逆矩阵 A 意味着它的逆矩阵 A -1 满足 等式 AA -1 = I , 其中 I 为 同样阶数的 单位矩阵。这样, 由 等式
推出 det
A≠0 。因为 det
A是 A 的 最大阶数的 非零子式,根据同济大学《线性代数》中的定义, A 的 秩 等于 n 。
尾声
笔者写作此文的一个动机 , 来自李天岩教授在《回首来时路》(原载台湾《数学传播》杂志, 2011 年转载于《数学文化》杂志)中的一段话:
“我经常举的一个例子是,我对一个矩阵的‘行秩’和‘列秩’为什么会相等的好奇。其实在任何基本的线性代数书里,我们都可以找到它们为什么相等的证明。但是从那些逻辑推理的外表,我实在看不出它们为什么会巧合地相等。在我真正了解到它们为什么会一样的过程中,这个好奇却帮我了解了许多广义逆矩阵的几何意义。”
今年是笔者之一的博士论文导师 李天岩教授逝世五周年及八十周年 诞辰 。 我们撰写这篇科普文章 , 不仅试图以广义逆算子的思想解释为何 “ 行秩等于列秩 ” , 也是 为了纪念他追求数学思想、授业解惑带徒的灿烂 一 生。
完稿于 2025年10月27日星期 一
往期推荐阅读
1、
2、
3、
4、
5、
版权说明:本文经「返朴」微信公众号授权转载推送。欢迎个人转发,任何形式的媒体或机构未经授权,不得转载和摘编。转载授权请在「返朴」微信公众号内联系后台。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.