
扫码添加

添加学术顾问微信
免费获取服务方案
数据是论文的根基。审稿人对数据的敏感度远超你的想象——一个数字对不上,就可能引发对整个研究的质疑。以下是从数据收集到投稿前的数据管理全流程规范。
数据收集的原始记录原则。实验过程中记录的一切原始数据,都应该完整保留,不能只保存最终结果。包括:实验参数配置、仪器读数、问卷原始回收、访谈录音/转录文本、传感器日志等。原始记录是证据链的起��——如果审稿人质疑你的某个数字,你需要能追溯到它的源头。
数据清洗的可追溯性。清洗数据不是在Excel里删了几行就完了。每一次清洗操作都应该有记录:删除了哪些样本?理由是什么?填补了哪些缺失值?用了什么方法(均值填补/多重插补/删除变量)?这个记录叫Data Processing Log,是审稿人判断你数据处理是否规范的重要依据。没有记录的数据清洗,在审稿人眼中等于暗箱操作。
数据文件的自描述性。每个数据文件都应该有一个配套的README文件,说明:数据来源、采集时间、样本量、变量定义、编码规则、缺失值标记方式。一个好的README能让陌生人在5分钟内理解你的数据集。这不仅是为审稿人准备的,也是为半年后的你自己准备的——你一定会忘记当时的操作细节。
异常值的透明处理。发现异常值不要急着删除。先判断是数据录入错误(可以修正或删除)还是真实但极端(应该保留并在讨论中说明)。删除数据必须有正当理由并在论文中披露。偷偷删除不好看的数据是学术不端的红线。在论文的方法部分,要明确说明异常值的处理标准和数量。
统计分析的完整报告。投稿前检查:是否报告了所有预注册的假设检验?是否进行了多重比较校正(如Bonferroni、FDR)?是否报告了效应量(Cohen's d、eta squared、R squared等)?是否提供了置信区间?是否说明了统计软件的版本?这些细节是审稿人判断数据质量的核心依据。只报p值不报效应量的时代已经过去了。
数据备份的3-2-1规则。3份副本(原始+清洗+分析)、2种介质(硬盘+云盘)、1份异地(不在同一个物理位置)。具体实现:电脑本地一份、外接硬盘一份、OneDrive/百度网盘一份。每周至少备份一次。论文数据丢失的代价远比你想象的惨重——它可能意味着重新做几个月实验。
代码与脚本的可复现性。如果你的分析使用了Python/R/Matlab脚本,投稿前要做一次从零复现测试:在一个全新的环境中,用你的代码和原始数据,能否完整跑出论文中的所有结果?如果跑不出来,说明代码有依赖问题或数据缺失。推荐使用Jupyter Notebook或R Markdown把代码、结果和解释整合在一起。
数据公开与伦理的平衡。开放数据能提高论文的可信度和引用率,但并非所有数据都能公开。涉及人类被试隐私的数据、商业机密数据、国家安全相关数据都需要保护。在论文中说明数据的可用性和获取方式:完全公开(附DOI链接)、有条件获取(联系作者)、因伦理限制不可公开。不同的可用性级别对应不同的表述方式。
投稿前的数据最终检查。数据是否与论文报告完全一致(逐表核对)?图表中的数据点是否可追溯到原始数据?所有统计结果是否可复现?数据可用性声明是否填写?补充材料中的数据是否完整?确认无误后再提交——数据问题是审稿人最不愿意原谅的错误。

扫码添加

添加学术顾问微信
免费获取服务方案
数据是论文的根基。审稿人对数据的敏感度远超你的想象——一个数字对不上,就可能引发对整个研究的质疑。以下是从数据收集到投稿前的数据管理全流程规范。
数据收集的原始记录原则。实验过程中记录的一切原始数据,都应该完整保留,不能只保存最终结果。包括:实验参数配置、仪器读数、问卷原始回收、访谈录音/转录文本、传感器日志等。原始记录是证据链的起��——如果审稿人质疑你的某个数字,你需要能追溯到它的源头。
数据清洗的可追溯性。清洗数据不是在Excel里删了几行就完了。每一次清洗操作都应该有记录:删除了哪些样本?理由是什么?填补了哪些缺失值?用了什么方法(均值填补/多重插补/删除变量)?这个记录叫Data Processing Log,是审稿人判断你数据处理是否规范的重要依据。没有记录的数据清洗,在审稿人眼中等于暗箱操作。
数据文件的自描述性。每个数据文件都应该有一个配套的README文件,说明:数据来源、采集时间、样本量、变量定义、编码规则、缺失值标记方式。一个好的README能让陌生人在5分钟内理解你的数据集。这不仅是为审稿人准备的,也是为半年后的你自己准备的——你一定会忘记当时的操作细节。
异常值的透明处理。发现异常值不要急着删除。先判断是数据录入错误(可以修正或删除)还是真实但极端(应该保留并在讨论中说明)。删除数据必须有正当理由并在论文中披露。偷偷删除不好看的数据是学术不端的红线。在论文的方法部分,要明确说明异常值的处理标准和数量。
统计分析的完整报告。投稿前检查:是否报告了所有预注册的假设检验?是否进行了多重比较校正(如Bonferroni、FDR)?是否报告了效应量(Cohen's d、eta squared、R squared等)?是否提供了置信区间?是否说明了统计软件的版本?这些细节是审稿人判断数据质量的核心依据。只报p值不报效应量的时代已经过去了。
数据备份的3-2-1规则。3份副本(原始+清洗+分析)、2种介质(硬盘+云盘)、1份异地(不在同一个物理位置)。具体实现:电脑本地一份、外接硬盘一份、OneDrive/百度网盘一份。每周至少备份一次。论文数据丢失的代价远比你想象的惨重——它可能意味着重新做几个月实验。
代码与脚本的可复现性。如果你的分析使用了Python/R/Matlab脚本,投稿前要做一次从零复现测试:在一个全新的环境中,用你的代码和原始数据,能否完整跑出论文中的所有结果?如果跑不出来,说明代码有依赖问题或数据缺失。推荐使用Jupyter Notebook或R Markdown把代码、结果和解释整合在一起。
数据公开与伦理的平衡。开放数据能提高论文的可信度和引用率,但并非所有数据都能公开。涉及人类被试隐私的数据、商业机密数据、国家安全相关数据都需要保护。在论文中说明数据的可用性和获取方式:完全公开(附DOI链接)、有条件获取(联系作者)、因伦理限制不可公开。不同的可用性级别对应不同的表述方式。
投稿前的数据最终检查。数据是否与论文报告完全一致(逐表核对)?图表中的数据点是否可追溯到原始数据?所有统计结果是否可复现?数据可用性声明是否填写?补充材料中的数据是否完整?确认无误后再提交——数据问题是审稿人最不愿意原谅的错误。