实证分析,就是以实际观察、实验或者调查得到的数据和事实为依据,用系统化的办法来检验假设、发现规律的一种研究范式。 简单地说,就是让数据说话,用证据回答问题。它不同于完全依靠逻辑推演的规范分析,也不是纯粹的理论思辨。本文从定义、核心要素、主要类型、完整的操作步骤四个方面来帮助读者建立起实证研究的完整框架,由“知道概念”到“会动手做”。
在开始深入之前,请先通过下表快速建立对不同分析类型的认知框架。可以避免最常见的用错方法、问错问题。
1. 实证分析的核心要素
开展一项严谨的实证研究,必须同时具备以下四个核心要素,缺一不可:
1.1 明确的研究问题与假设
实证分析不是盲目地“跑数据”,而是从具体问题出发。例如,“教育年限如何影响收入?”是一个可以操作的问题。进一步需要把问题转化为可以检验的假设,比如“控制其他因素之后,教育年限每增加一年,个人年收入平均增加5%。”
1.2 可观测、可测量的数据来源
数据必须是真实的、可以获取的,并且能够以某种方式被测量或者记录下来。可以是国家统计局年鉴中的数据,可以是临床试验得到的数据,可以是问卷调查回收的样本数据。
1.3 系统化的分析方法
从描述性统计到复杂的计量模型,每一个选择都要有理论依据。分析方法不是随便选择的,是由研究问题、数据特点和理论框架一起决定的。
1.4 可重复与可验证的结论
这是实证分析与个人意见的不同之处。一篇好的实证研究,其数据获取、处理步骤、分析方法都要被详细记录下来,使其他研究者可以复现结果,从而验证结论的可靠性。
2. 实证分析的主要类型
实证分析不是只有一种模式。按照研究目的、数据来源以及控制变量的能力,可以分为三种类型。了解它们各自的特点,可以帮助你选择最合适的研究设计。
2.1 实验研究
实验研究是通过人为干预、控制环境来检验因果关系的。内部效度(因果推断的可靠性)最高。
- 随机对照实验(RCT,Randomized Controlled Trial):将参与者随机分配到实验组和对照组,是因果推断的黄金标准。在医学上常用于新药疗效的测试,在社会科学中也用于一些教育干预项目的评估。
- 准实验设计:当不能进行完全随机分组的时候,用自然形成或者人为划分的组别,比如双重差分法(DID)或者断点回归设计(RDD)。常用来进行政策评估。
2.2 观察研究
观察研究是在自然情境中收集数据,不对变量进行人为干预。外部效度(结果推广到现实世界的能力)较高,但是要注意混杂因素和内生性问题。
- 横截面研究:在同一时间点上对多个个体(个人、企业、国家等)进行观测。例如分析2023年某省各县市GDP和教育投入的关系。
- 时间序列研究:对同一个体或者多个个体在不同的时间点上进行重复观测。例如分析中国近40年GDP增长率的变动趋势。
- 面板数据研究:将横截面和时间序列结合起来,对多个个体进行追踪,在多个时间点上进行观测。例如分析全国各省(横截面)2010-2020年(时间序列)居民收入和消费数据。面板数据可以较好地控制个体差异,在实证研究中是很有力的手段。
2.3 案例研究
案例研究集中于一个或少数几个典型个案,做深入、多角度、长时间的分析。它不追求统计意义上的普遍性,而是挖掘复杂现象背后的深层机制以及特殊情境。
- 单案例研究:对一个典型案例进行详细的分析,比如“华为的国际化战略研究”。
- 多案例比较:选择2到4个不同的案例进行比较,找出它们的共性和差异,从而提高研究结论的可靠性。
3. 开展实证分析的完整步骤
实证研究有明确的程序。按照这个流程可以少走弯路,防止思路断片或者跑偏。
第一步:提出可检验的研究问题
好的研究问题应该具体、可行、有研究价值。不要问“教育重要吗?”,而应该问“在控制了家庭背景、个体能力之后,高等教育学历对个人月收入的影响有多大?” 该问题清楚地指出了自变量(高等教育学历)、因变量(月收入)以及重要的控制变量(家庭背景、个体能力),为后面模型的设定指明了方向。
第二步:文献综述与理论框架搭建
阅读本领域经典文献,了解前人已经做了什么,没有解决的问题(研究空白),以及现有的理论对于变量之间关系的解释。以教育和收入的关系为例,可以参考人力资本理论(教育回报是投资行为)、信号理论(教育是向雇主发出能力的信号)。理论框架可以建立核心变量之间的逻辑关系。
第三步:形成研究假设
根据理论提出可以被检验的假设。假设必须是可以被证伪的。例如:
- 原假设(H0):接受高等教育对月收入没有显著影响。
- 备择假设(H1):接受高等教育对月收入有显著正向影响。
第四步:研究设计与数据收集方案
这一步决定了研究是否能回答你的问题。
- 确定研究设计类型:根据你的问题,选择实验、观察还是案例研究。评价因果推断的要求是否很高。
- 数据收集方案:确定数据来源(一手数据/二手数据)、样本量、变量定义及测量方法。
数据收集与数据来源
数据是实证分析的血液。按照来源可以分为:
- 一手数据:通过调查问卷、实验、访谈、观察等方式直接获得,可以控制变量的定义和测量方式,但是成本高、周期长。例如你设计了一份包含“每周学习时长”和“期末考试成绩”的问卷,向全校学生发放。
- 二手数据:从公开数据库、统计年鉴、文献数据等渠道获得,成本低、样本量大,但是变量定义和测量方式由数据提供者决定,可能存在测量误差或者遗漏变量的问题。使用“中国家庭追踪调查(CFPS)”数据或者“2023年某省统计年鉴”。
- 数据质量评价:不管是什么来源的数据,都要对数据的信度(多次测量结果是否一致)、效度(测量是否准确地反映了要测量的概念)和代表性(样本能否代表总体)进行评价。
4. 实证分析常用方法
选择方法的时候要记住,是从研究问题出发来选择方法,而不是反过来。
4.1 描述性统计与可视化
这是所有分析的第一步。用均值、标准差、最小值、最大值、相关系数等来了解数据的基本特征及分布。可视化工具(散点图、直方图、箱线图)可以直观地看出趋势、异常值和相关性。画出教育年限和年收入的散点图,点出一簇正向倾斜的点,就可能表示正相关关系。
4.2 回归分析
回归分析是实证分析中最重要的定量方法。
- 线性回归:用来分析一个或者多个自变量对连续型因变量的影响。收入(连续变量)=β0+β1×教育年限+β2×工作经验+ε。注意:β1 表示在其他条件不变的情况下,教育年限每增加一年,收入平均增加 β1 个单位。这是“其他条件不变”的假设,在观察性研究中很难做到完全满足。
- 逻辑回归:因变量为二分类变量(是否考上研究生=是/否)时使用。
- 多元回归:加入多个控制变量来隔离核心自变量对因变量的净效应。在教育年限对收入的模型中加入父母教育水平、城市规模等控制变量,目的是尽可能控制住那些同时影响教育选择和收入的因素。
4.3 因果推断方法
当研究目的是回答“为什么”的时候,单纯的回归分析不能建立可靠的因果关系,因为存在内生性问题(自变量和误差项相关)。以下方法专门用于处理内生性:
- 工具变量(IV,Instrumental Variable):当自变量存在内生性的时候,寻找一个工具变量,它和自变量高度相关,但是只通过自变量影响因变量。以社会学研究生为例,她用Stata分析“教育年限对收入的影响”时,发现直接用OLS回归结果可能是偏误的,因为“能力”(智商、学习动机等)会同时影响教育选择(高能力者更容易获得更高的学历)和收入(高能力者收入更高),造成遗漏变量偏误。她决定用父母教育水平来作为工具变量。因为父母教育水平影响子女教育选择(相关性),但是不能通过“能力”以外的其他途径直接影响子女收入(排他性),所以得到了更可靠的教育回报率估计。
- 双重差分(DID,Difference-in-Differences):常用于政策效果评价。比较处理组(受政策影响)和对照组(不受政策影响)在政策实施前后的变化差值。以最低工资上调对就业的影响为例,可以将某城市设为处理组,未上调的城市设为对照组,比较政策前后两地就业的变化。
- 断点回归(RDD,Regression Discontinuity Design):利用一个“断点”来识别因果。当学生的高考分数达到某个分数线(一本线)以上时,就可以得到更好的大学教育资源。研究者可以比较刚过线(以上)和刚没过线(以下)的两批学生未来收入,来估计“上一本大学”对收入的因果效应。
4.4 质性分析方法
当数据为文本、访谈记录、观察笔记等时,要用质性分析的方法。
- 主题分析:从数据中归纳出核心主题和模式。
- 内容分析:系统地对文本内容进行编码和量化。
- 扎根理论:从数据中自下而上地构建理论,而不是检验已有的理论。
结果解释与假设检验
分析完数据之后,对结果进行解释就显得十分重要。这是把“会做统计”和“懂研究”区分开来的分界线。
- 统计显著性与实际显著性:p值小于0.05并不代表发现了一个“重要”的发现。p值说的是“如果原假设为真,观察到当前或更极端结果的概率”。它不衡量效应的大小。实际显著性(效应量)告诉你这个发现有多大实际意义。回归系数为0.001,p值小于0.001,统计上显著,但是经济上几乎没有意义。
- 效应量与置信区间:效应量(回归系数β)表示自变量每变化一个单位,因变量相应变化多少。置信区间给出了这个效应量的一个可能范围,通常为95%置信水平。置信区间窄,估计就比较精确;置信区间宽,估计误差就大。
- 稳健性检验与敏感性分析:这是检验结论是否可靠的关键步骤。例如:
- 更换不同的控制变量组合,看核心系数是否变化巨大。
- 更换样本(剔除极端值、用子样本)。
- 更换估计方法(用IV代替OLS)。
- 如果核心结论在各种合理的设定下都保持稳定,那么结论就更可信。
- 常见误区:只报告一个“最好看”的结果,而隐瞒其他分析结果,这就是p-hacking。
5. 实证分析的应用场景
实证分析几乎渗透到所有的研究领域中。
6. 开展实证分析的常见误区与注意事项
以下是实证分析中常见的“雷区”,了解它们可以帮助你避免重蹈覆辙。
常见误区与风险雷达图
❌ 混淆相关与因果
这是最典型、最危险的一种错误。相关性不等于因果性。一个经典的例子就是冰淇淋销量和溺水率正相关,但是背后的原因是温度这个混杂因素,即夏天天气炎热,人们吃冰淇淋的同时也会去游泳,从而导致溺水率上升。研究中忽略混杂因素,把相关关系直接当作因果关系来解释,结论就会完全偏离真相。
❌ 数据挖掘与p-hacking
指研究者为了得到一个显著的p值,不断地改变模型的设定、变量的组合、样本的切割,直到得到一个好看的结果。本质上就是用数据来撒谎,造成发表偏倚(只有显著的结果才会被发表)。应对方法:在研究开始之前预注册你的分析计划,或者坚持做稳健性检验。
❌ 样本选择偏差与内生性问题
- 样本选择偏差:样本不能代表总体,分析结果就会有偏差。只分析985高校毕业生收入不能代表全国所有大学毕业生收入水平。
- 内生性问题:如前所述,这是观察性研究中因果推断的最大障碍。常见的原因有遗漏变量、测量误差、反向因果(收入高的人更愿意投资教育)。解决内生性要精心设计研究设计和选择合适的方法(IV、DID、RDD)。
❌ 过度依赖单一方法
不要以为只有一种方法可以解决问题。一项好的实证研究一般会用多种方法来交叉验证。先用OLS回归,再用IV回归,最后做稳健性检验。如果所有的方法都指向同一个结论,那么结论的可信度就会大大提高。
❌ 多重共线性与过拟合
- 多重共线性:当自变量之间存在高度的相关性时,回归系数的估计就会变得不稳定,标准误会变大,从而使得p值不显著。
- 过拟合:模型过于复杂,完美地拟合了训练数据中的噪声,但是对新的数据预测能力很差。常用于预测性分析,用正则化(Lasso回归)或者交叉验证来控制。
常见问题
共 3 个问题,点击展开查看答案
-
实证分析关注的是“是什么”,用事实、数据来描述客观现象;规范分析关注的是“应该是什么”,用价值判断、伦理标准来提出主张。实证分析回答事实问题,比如最低工资上涨是否会导致失业,规范分析回答价值问题,比如最低工资应该上涨到多少才公平。
-
不一定。实证分析可以是基于定量数据(统计数字、计量模型)的,也可以是基于定性数据(案例、访谈、观察记录)的。关键在于方法是否依靠系统的实际证据,而不能只看数据的形式。对一个村庄进行深度访谈和主题分析,也属于实证分析。
-
基本步骤为:1)提出研究问题;2)文献回顾和理论建构;3)提出假设;4)收集数据;5)选择分析方法;6)分析数据并检验假设;7)得出结论和讨论。每一步都要认真对待,最后才能得到可信的研究成果。