RDA冗余分析结果解读
一、RDA冗余分析概述
冗余分析(Redundancy Analysis, RDA)是一种约束排序方法,广泛应用于生态学、环境科学和群落数据分析中。RDA是主成分分析(PCA)的扩展,其核心思想是在排序过程中引入解释变量(X变量)的约束,使得排序轴不仅反映响应变量(Y变量)的最大变异,而且能够最大限度地被解释变量所约束。换言之,RDA旨在提取Y变量变异中能够被X变量线性解释的部分,并通过排序图直观展示X变量与Y变量之间的关系结构。
RDA分析的数学原理基于响应变量矩阵对解释变量矩阵的多元回归,然后对拟合值矩阵进行特征值分解(类似于PCA),提取约束排序轴。每个排序轴对应一个特征值,特征值越大表示该轴解释的变异越多。RDA分析的结果通常包括:置换检验(评价模型整体显著性)、方差分解(约束方差与非约束方差的比例)、特征值与解释方差(各轴的重要性)、X变量重要性排序(哪些解释变量是主要驱动因子)以及双序图(biplot)等。本研究使用SPSSAU软件对36个样本的5个解释变量(x1~x5)和6个响应变量(y1~y6)进行RDA冗余分析,探讨环境因子对群落或响应指标的解释能力。
在SPSSAU【进阶方法】模块选择【RDA冗余分析】,将变量拖拽至右侧对应分析框,操作如下图:
二、样本信息与数据完整性
表1展示了样本的缺失情况。本次RDA分析共纳入36个有效样本,所有样本在全部解释变量和响应变量上均无缺失值,无样本被排除。完整的数据集保证了RDA分析结果的可靠性。
三、置换检验结果
表2展示了RDA模型的置换检验结果。置换检验是RDA分析中评价模型整体显著性的非参数方法,其原假设H0为:X变量对Y变量变异的解释能力不显著,即X与Y之间不存在线性关系。通过200次随机置换,计算F统计量及其对应的p值。结果显示,模型(约束轴)的自由度为5,约束方差为5.179;残差(非约束轴)的自由度为30,非约束方差为0.821。F统计量=(5.179/5)/(0.821/30)=37.826,p=0.000<0.001。p值远小于0.05的显著性水平,因此拒绝原假设,说明X变量(x1~x5)对Y变量(y1~y6)的变异具有极其显著的解释能力,RDA模型整体有效。F=37.826是一个很大的F值,表明约束方差远大于残差方差,模型的约束效果非常强。
四、方差分解结果
表3展示了RDA分析的方差分解情况。总方差为6.000,代表Y变量变异的总量。约束方差为5.179,表示能够被X变量线性解释的Y变异部分;非约束方差为0.821,表示不能被X变量解释的残余变异部分(可能由随机因素或未测量变量引起)。约束方差比例为86.310%,即X变量能够解释Y变量总变异的86.31%,仅有13.69%的变异无法被当前模型中的X变量所解释。这一极高的约束方差比例表明,本研究选取的5个解释变量(x1~x5)对6个响应变量(y1~y6)具有非常强的解释能力,模型拟合度极好。在生态学研究中,约束方差比例超过50%即认为模型解释力较强,本研究达到86.31%,说明X变量是驱动Y变量变化的主要因素。
五、特征值与解释方差
表4展示了RDA各排序轴的特征值及其解释方差情况。RDA1的特征值最大(2.463),单独解释了Y变量总变异的41.043%,是最重要的排序轴。RDA2的特征值为1.504,解释了25.075%的变异。RDA1和RDA2的累积解释方差达到66.118%,说明前两个排序轴已经能够捕获约束方差中的大部分信息。RDA3的特征值为0.687,解释了11.458%的变异,前三轴的累积解释方差为77.576%。在实际分析中,通常重点关注前两个排序轴(RDA1和RDA2),因为它们的累积解释方差已超过66%,足以反映X变量与Y变量之间关系的主要结构。特征值的递减趋势(2.463>1.504>0.687)表明数据具有较好的低维结构,适合通过二维排序图进行可视化展示。
六、解释变量重要性分析
表5展示了各解释变量(X变量)单独能够解释Y变量总变异的百分比,以及各X变量与RDA排序轴的相关系数。解释方差指标是衡量X变量重要性的核心指标,其计算公式为:单个X变量通过回归能预测的所有Y变量方差÷Y变量总方差×100%。
从解释方差来看,x1的解释方差最大,为30.175%,说明x1是驱动Y变量变化的最重要解释变量,单独就能解释Y变异的近三分之一。x4的解释方差为16.583%,排名第二;x3为15.057%,排名第三;x2为12.397%,排名第四;x5的解释方差最小,仅为8.352%。五个X变量的解释方差之和为82.564%,与约束方差比例86.310%接近但不完全相等,这是因为各变量之间存在一定的共解释部分。
从X变量与RDA轴的相关系数来看,x1与RDA2的相关系数最高(0.674),表明x1主要在RDA2轴上发挥作用;x2与RDA3的相关系数最高(0.789),表明x2主要在RDA3轴上发挥作用;x4与RDA1的相关系数较高(-0.585),表明x4主要在RDA1轴上发挥作用。不同X变量在不同排序轴上的载荷差异,反映了各解释变量对Y变量变异解释的维度结构。
七、解释变量与响应变量相关性
表6展示了X变量与Y变量之间的Pearson相关系数矩阵,有助于识别哪些X变量与哪些Y变量之间存在较强的线性关系。绝对值较大的相关系数(如>0.5或<-0.5)表示强相关关系。
从表中可以看出,x1与y1的相关系数最高(r=0.905),与y2的相关系数也较高(r=0.818),表明x1与y1、y2之间存在极强的正相关关系,这与x1解释方差最大(30.175%)的结论一致。x2与y3的相关系数较高(r=0.600),x3与y4(r=0.678)和y5(r=0.468)呈正相关,x4与y5(r=0.676)和y6(r=0.617)呈正相关,x5与y6呈正相关(r=0.596)。值得注意的是,x1与y3之间存在负相关关系(r=-0.356),说明x1的增加可能伴随y3的降低。总体来看,不同的X变量对不同的Y变量具有选择性解释效应,这种差异化的相关结构在RDA双序图中可以得到直观展示。
八、RDA双序图解读
图1 RDA双序图(Biplot)
图1为RDA双序图(Biplot),是RDA分析最核心的可视化结果。双序图同时展示了样本点、响应变量(Y变量)箭头和解释变量(X变量)箭头在排序空间中的位置,通过样点位置、箭头长度和方向可以直观解读以下信息:
第一,样点之间的距离反映相似性。任意两个样点距离越近,说明这两个样点在响应变量上的特征越相似;反之,距离越远则差异越大。从图中可以观察到,部分样点在排序空间中聚集形成若干群组,而另一些样点则相对分散,反映了样本之间的异质性。
第二,箭头长度反映变量重要性。无论是X变量还是Y变量,箭头越长表示该变量在排序空间中的变异越大,即该变量的重要性越高。从图中可以比较各变量箭头的相对长度,识别对群落或响应指标影响最大的关键因子。
第三,箭头之间的夹角反映相关关系。两个变量箭头之间的夹角越小(接近0度),说明二者之间的正相关关系越强;夹角接近90度(垂直)说明二者几乎无线性关系;夹角接近180度说明二者呈强负相关关系。例如,如果x1箭头与y1箭头方向接近一致,说明x1与y1呈正相关,这与相关系数r=0.905的结论一致。
第四,样点与变量箭头的关系。样点离某变量箭头越近(或越靠近箭头延伸方向),意味着该样点在该变量上的取值越高。通过观察样点与变量箭头的空间关系,可以推断哪些样本受到哪些环境因子的影响较大。综合以上信息,RDA双序图能够一图展示'谁和谁相似'、'什么因素重要'、'谁受什么影响'等关键信息。
九、样本得分与变量得分
表7展示了Y变量在各RDA排序轴上的得分。Y变量得分反映了各响应变量在排序空间中的位置,得分的具体数值本身不具有独立的分析意义,但经过缩放处理后展示在RDA双序图中。在双序图中位置相近的Y变量具有较高的相关性。从表中可以看出,y1和y2在RDA1轴上的得分均为负值且接近(-0.418和-0.484),在RDA2轴上的得分均为正值,说明y1和y2在排序空间中的位置相近,具有较高的相关性,这与Pearson相关分析的结果一致。y4和y5在RDA1和RDA2轴上的得分也较为接近,提示二者之间也存在一定的相关性。
表8展示了X变量在各RDA排序轴上的得分。X变量得分同样经过缩放处理后展示在双序图中。x1在RDA1轴上的得分为-1.013,在RDA2轴上为0.827,说明x1在双序图中主要沿RDA1和RDA2方向展开,这与x1解释方差最大(30.175%)的结论一致。x4在RDA1轴上的得分为-0.918,也主要沿RDA1方向分布。x2在RDA3轴上的得分最高(0.654),说明x2的信息主要体现在第三排序轴上。在双序图中,位置相近的X变量具有较高的相关性,如x1和x4在RDA1轴上的得分均较大(负值),说明二者可能存在一定的相关性。
十、结论
本研究采用RDA冗余分析方法,对36个样本的5个解释变量(x1~x5)和6个响应变量(y1~y6)之间的关系进行了约束排序分析。置换检验结果显示模型整体极其显著(F=37.826,p<0.001),表明X变量对Y变量的变异具有显著的解释能力。方差分解结果显示,约束方差比例高达86.310%,即X变量能够解释Y变量总变异的86.31%,模型拟合度极好。前两个RDA轴的累积解释方差为66.118%(RDA1=41.043%,RDA2=25.075%),足以反映X-Y关系的主要结构。
在解释变量重要性方面,x1的解释方差最大(30.175%),是最重要的驱动因子,其次为x4(16.583%)、x3(15.057%)、x2(12.397%)和x5(8.352%)。相关分析和双序图共同揭示了X变量与Y变量之间的差异化相关结构,如x1与y1(r=0.905)和y2(r=0.818)呈极强正相关,x3与y4(r=0.678)呈强正相关,x4与y5(r=0.676)和y6(r=0.617)呈强正相关。综上所述,本研究选取的5个解释变量对响应变量具有极强的解释能力,其中x1是最主要的驱动因子,RDA双序图直观展示了样本、X变量和Y变量之间的关系结构。