
扫码添加

添加学术顾问微信
免费获取服务方案
二手数据分析(Secondary Data Analysis)是利用已有的数据集进行研究。它的优势是"省钱省力",但挑战在于"数据不是为你的问题而收集的"。以下是从数据获取到合规使用的完整指南。
二手数据的来源。①政府统计数据:国家统计局、教育部、卫健委等发布的公开数据。适合宏观研究。②国际数据库:World Bank Open Data、OECD Data、WHO Global Health Observatory、IMF Data。适合跨国比较研究。③学术数据集:ICPSR(政治与社会研究校际consortium)、UK Data Archive、GESIS(德国社会科学数据)。④专项调查数据:CGSS(中国综合社会调查)、CFPS(中国家庭追踪调查)、CHARLS(中国健康与养老追踪调查)。⑤企业/平台数据:部分平台开放API(如Twitter API、GitHub API),部分企业发布研究报告。⑥文献中的数据:从已发表论文的表格/图表中提取数据(用于元分析或再分析)。
数据获取的途径与流程。①公开数据:直接下载(通常免费)。注意查看使用协议(License)——有些数据要求引用、有些限制商业使用。②受限数据:需要申请。例如CFPS需要注册账号、签署数据使用协议、说明研究目的。部分数据需要IRB审批。③合作获取:与企业或政府机构合作,签署保密协议后获取数据。④数据请求:给原始数据作者发邮件请求共享(很多期刊要求作者公开数据,所以成功率不低)。
二手数据分析的核心挑战:数据-问题匹配。数据不是为你的问题设计的,所以你需要回答:①这些变量能回答我的研究问题吗?如果不能,即使数据再好也不能用。②测量方式适合吗?例如,你想研究"学习动机",但数据集中只有"每周学习时长"——这是行为指标,不是动机本身。③时间范围够吗?你想研究长期趋势,但数据只覆盖了2年。④样本范围够吗?你想研究全国,但数据只来自一个省份。⑤变量定义一致吗?如果你合并多个数据集,同一个概念在不同数据集中的定义可能不同(如"收入"在A调查中含奖金,在B调查中不含)。
二手数据的清洗与准备。①变量重编码:原始数据的编码方式可能不符合你的分析需要。例如,把"年龄"从连续变量分组为"青年/中年/老年"。②缺失值处理:二手数据的缺失值往往比你自己收集的数据更多。处理方法:列表删除(Listwise Deletion)、均值替代(Mean Imputation)、多重插补(Multiple Imputation,推荐)。③异常值检测:用箱线图、Z-score等方法识别异常值,决定保留、删除或Winsorize。④数据合并(Merging):如果你使用了多个数据集,需要按关键变量(如ID、地区代码)合并。注意一对一、一对多、多对多的匹配关系。⑤变量标准化:如果不同变量的量纲差异大(如"收入"以万元计,"年龄"以年计),需要标准化后再做某些分析。
二手数据分析的伦理规范。①遵守数据使用协议:每个数据集都有使用条款。仔细阅读,遵守署名要求、不重新分发要求、不用于特定用途的禁止条款。②保护隐私:即使数据是"匿名化"的,重新识别(Re-identification)的风险始终存在(特别是小样本+多个数据集交叉时)。不要在论文中披露可能导致个人被识别的信息。③引用数据来源:每个数据集都应该在参考文献中引用(包括数据集的作者/机构、年份、版本号、DOI/URL)。④透明报告:在论文的方法部分详细说明数据来源、获取方式、清洗过程、版本信息。⑤敏感数据的特殊要求:涉及健康、收入、犯罪记录等敏感数据,即使已匿名化,也可能需要额外的伦理审批。
二手数据分析的常见错误。①"数据决定问题"(因为手头有什么数据就研究什么,而不是从研究问题出发);②忽略数据局限性(在讨论中不提数据的测量误差、缺失值问题);③生态谬误(Ecological Fallacy):用聚合数据(如省级平均)推断个体行为;④变量误用(把代理变量当作直接测量);⑤数据版本混乱(用了不同版本的数据集,结果不可复现);⑥引用不规范(使用了数据集但没有在参考文献中恰当引用)。

扫码添加

添加学术顾问微信
免费获取服务方案
二手数据分析(Secondary Data Analysis)是利用已有的数据集进行研究。它的优势是"省钱省力",但挑战在于"数据不是为你的问题而收集的"。以下是从数据获取到合规使用的完整指南。
二手数据的来源。①政府统计数据:国家统计局、教育部、卫健委等发布的公开数据。适合宏观研究。②国际数据库:World Bank Open Data、OECD Data、WHO Global Health Observatory、IMF Data。适合跨国比较研究。③学术数据集:ICPSR(政治与社会研究校际consortium)、UK Data Archive、GESIS(德国社会科学数据)。④专项调查数据:CGSS(中国综合社会调查)、CFPS(中国家庭追踪调查)、CHARLS(中国健康与养老追踪调查)。⑤企业/平台数据:部分平台开放API(如Twitter API、GitHub API),部分企业发布研究报告。⑥文献中的数据:从已发表论文的表格/图表中提取数据(用于元分析或再分析)。
数据获取的途径与流程。①公开数据:直接下载(通常免费)。注意查看使用协议(License)——有些数据要求引用、有些限制商业使用。②受限数据:需要申请。例如CFPS需要注册账号、签署数据使用协议、说明研究目的。部分数据需要IRB审批。③合作获取:与企业或政府机构合作,签署保密协议后获取数据。④数据请求:给原始数据作者发邮件请求共享(很多期刊要求作者公开数据,所以成功率不低)。
二手数据分析的核心挑战:数据-问题匹配。数据不是为你的问题设计的,所以你需要回答:①这些变量能回答我的研究问题吗?如果不能,即使数据再好也不能用。②测量方式适合吗?例如,你想研究"学习动机",但数据集中只有"每周学习时长"——这是行为指标,不是动机本身。③时间范围够吗?你想研究长期趋势,但数据只覆盖了2年。④样本范围够吗?你想研究全国,但数据只来自一个省份。⑤变量定义一致吗?如果你合并多个数据集,同一个概念在不同数据集中的定义可能不同(如"收入"在A调查中含奖金,在B调查中不含)。
二手数据的清洗与准备。①变量重编码:原始数据的编码方式可能不符合你的分析需要。例如,把"年龄"从连续变量分组为"青年/中年/老年"。②缺失值处理:二手数据的缺失值往往比你自己收集的数据更多。处理方法:列表删除(Listwise Deletion)、均值替代(Mean Imputation)、多重插补(Multiple Imputation,推荐)。③异常值检测:用箱线图、Z-score等方法识别异常值,决定保留、删除或Winsorize。④数据合并(Merging):如果你使用了多个数据集,需要按关键变量(如ID、地区代码)合并。注意一对一、一对多、多对多的匹配关系。⑤变量标准化:如果不同变量的量纲差异大(如"收入"以万元计,"年龄"以年计),需要标准化后再做某些分析。
二手数据分析的伦理规范。①遵守数据使用协议:每个数据集都有使用条款。仔细阅读,遵守署名要求、不重新分发要求、不用于特定用途的禁止条款。②保护隐私:即使数据是"匿名化"的,重新识别(Re-identification)的风险始终存在(特别是小样本+多个数据集交叉时)。不要在论文中披露可能导致个人被识别的信息。③引用数据来源:每个数据集都应该在参考文献中引用(包括数据集的作者/机构、年份、版本号、DOI/URL)。④透明报告:在论文的方法部分详细说明数据来源、获取方式、清洗过程、版本信息。⑤敏感数据的特殊要求:涉及健康、收入、犯罪记录等敏感数据,即使已匿名化,也可能需要额外的伦理审批。
二手数据分析的常见错误。①"数据决定问题"(因为手头有什么数据就研究什么,而不是从研究问题出发);②忽略数据局限性(在讨论中不提数据的测量误差、缺失值问题);③生态谬误(Ecological Fallacy):用聚合数据(如省级平均)推断个体行为;④变量误用(把代理变量当作直接测量);⑤数据版本混乱(用了不同版本的数据集,结果不可复现);⑥引用不规范(使用了数据集但没有在参考文献中恰当引用)。