临床医护做科研、写论文,很多人的第一反应是赶紧装个SPSS。其实你每天打开制表的Excel,已经能解决常规研究里70%以上的统计分析需求——只是很多功能藏得深,平常没注意。
今天这篇笔记,把Excel能做的统计和图表逐一拆解,每个方法先讲一句生活里能碰到的场景,帮你把底层逻辑搞明白,再对应回临床科研的具体操作。知识点密集,建议先收藏。
一、先把工具叫出来:分析工具库
很多人用了十年Excel,从来没见过“数据分析”按钮。这个默认隐藏的功能,是今天所有操作的核心入口。
加载步骤: 文件 → 选项 → 加载项 → 底部“管理”选“Excel加载项”并点“转到” → 勾选“分析工具库” → 确定。完成后,“数据”选项卡最右侧就会出现“数据分析”,点开就能看到描述统计、t检验、方差分析、回归分析、直方图等全套工具。
二、临床论文最常用的统计,Excel直接跑通
1. 描述统计:患者基线资料怎么报
想搞清楚一件事的整体情况,是所有分析的第一步。比如你记了一个月每天买菜花多少钱,肯定会关心:平均每天花多少、波动大不大、花得最多和最少的是哪天——这就是描述统计要干的事。
临床科研里,论文Table 1需要报告年龄、BMI、病程的均数±标准差,或者偏态数据的中位数和四分位间距。两种实现方式:
经验之谈: 每次分析前先跑一遍描述统计,扫一眼最大值和最小值,能瞬间揪出异常录入——比如空腹血糖赫然显示45.6mmol/L,那多半是小数点打错了。
2. 独立样本t检验:两组之间比差异
想知道两个菜市场的鸡蛋价格是不是真有差别,各问价10天,比一比平均价。如果发现价差挺大,这个差距是真实存在的,还是仅仅因为每天价格正常波动的偶然现象?独立样本t检验就是用来判断这个的。
对应到临床研究,比较干预组和对照组的住院天数、某生化指标是否有差异,用的就是这一套。
3. 非参数检验:数据不正态时的替代方案
想比较两个鱼摊卖的鲫鱼哪个更大,但鱼大小参差不齐,数据根本不是正态分布。这时候直接比均值容易被极端值带偏,就需要换一种不依赖数据分布的检验方法——Mann-Whitney U检验,它比的是两组数据的“排位”,而不是具体数值。
临床中,小样本或偏态数据(比如住院费用,少数人花了几十万拉高均值)就该用它,审稿人现在很注意这一点。
Excel没有内置按钮,但可以用公式构造。实用做法:直接搜索“Excel Mann-Whitney U template”,下载现成模板,把两组数据分别粘贴进去,自动输出U值和P值。不用从头手写公式。
4. 单因素方差分析:三组及以上比高下
想知道三个品牌的节能灯泡寿命是不是真有区别,每样抽10个测寿命。方差分析能告诉你,这三个牌子的平均寿命之间,至少有一组和别家不同。
临床研究里,对照组、药物A组、药物B组的疗效比较,就用“数据分析” → “方差分析:单因素”。结果给出组间平方和、组内平方和、F值和P值。
注意事项: 方差分析显著只说明至少有一组不同,具体谁和谁不同,Excel不会自动告诉你。简单方案是用Bonferroni法手算调整后的检验水准来判断。非参数的多组比较(Kruskal-Wallis),Excel没有内置,可以用网上现成公式模板或配合在线工具完成。
5. 卡方检验:看两个分类有没有关联
小区想了解性别和养宠物有没有关系,统计出男养/男不养、女养/女不养的人数,形成一个表格。卡方检验就是判断这两个分类变量是否独立——性别不同,养宠物的倾向是否真的有差异。
临床中比较两组的有效率、并发症发生率,都是这类问题。
操作: 用函数 =CHISQ.TEST(实际频数区域, 期望频数区域),直接返回P值。
切记: 先看一眼每个格子的理论频数,如果有格子小于5,要用Fisher确切概率法。Excel做不了这个,需要其他工具,论文里注明用了什么软件就行。
6. 相关分析:两个连续变量的关系
记录每天最高气温和冰淇淋销量,想看看二者有没有关系。算一个相关系数,靠近1说明越热卖得越好,靠近-1说明越热反而越没人买,靠近0说明没啥关系。
临床研究中BMI和胰岛素抵抗指数的相关性,同理。
Pearson相关:=CORREL(区域1,区域2),或通过“数据分析”→“相关系数”批量算。
Spearman秩相关: 想看两个东西的“排名”有没有关系,比如“每天看电视时长排名”和“视力测试分数排名”。做法是先用 RANK.AVG 把两个变量分别排秩,再对新生成的秩次做Pearson相关,逻辑不复杂。
7. 线性回归:用一个变量预测另一个
收集朋友家房子的面积和成交总价,你想知道:面积每多一平米,总价大概涨多少?以及用面积来估计房价,这个估算有多靠谱?这就是回归分析。
临床中分析某指标对另一指标的预测价值,Excel的回归功能相当能打。
操作: “数据分析” → “回归”,指定因变量Y和自变量X区域。输出结果包含回归系数、R²、调整R²、整个模型的P值、每个自变量系数的P值和95%置信区间。一篇回顾性研究的多因素线性回归,Excel跑出来的结果完全能写进论文。
注意: 自变量在表格中必须连续排列,数据整理时把要纳入的列提前挪到一起。
边界: Logistic回归、Cox回归做不了,遇到二分类结局或生存资料的预测模型,大大方方换SPSS或R。
三、作图:Excel是被严重低估的论文图表工具
很多人觉得Excel图表土,其实是默认配色拖后腿。稍加调整,满足期刊要求绰绰有余。
1. 柱状图加误差线
比较两个班的数学平均分,柱状图能看出谁高谁低,但只比均值不够。加上误差线标注标准差,还能看出哪个班成绩更整齐、更集中,信息量大增。
2. 箱线图
一个年级八个班的期末语文成绩,每个班的分数分布情况如果用箱线图展示,中位数、四分位范围、最高最低非异常值、异常值点全都一目了然。特别适合呈偏态分布的数据。
临床中住院费用、住院天数这类偏态数据,用它非常合适。Excel 2016及以上版本,插入 → 统计图表 → 箱线图,自动生成。一张图并排放多组箱子,组间差异一目了然,近年来越来越多期刊偏好箱线图。
3. 散点图与趋势线
把每个人的课外学习时间作为横坐标,期末总分作为纵坐标画散点图,再加一条趋势线。点越靠近线,说明用学习时间解释分数越靠谱;R²值越高,这个解释力越强。
临床中做相关分析时顺手出张散点图,右键添加趋势线 → 勾选“显示公式”和“显示R平方值”,把R²和回归方程直接标在图上,看图说话,直观且有说服力。
4. 生存曲线
实话实说,Excel没有Kaplan-Meier估计和log-rank检验功能。手动计算累积生存率再用折线图模拟阶梯曲线,费时费力还容易出错,不推荐。遇到生存资料,用SPSS、Prism或R,时间比软件贵。
5. 森林图与漏斗图
散点图加误差线可以模拟Meta分析的森林图(OR和CI),步骤繁琐,偶尔应急可行。系统做Meta分析还是交给专业软件。
四、几个能帮你少加班的工作习惯
数据录入规范: 一行一个研究对象,一列一个变量,首行变量名用英文或简写,别带空格和特殊符号,后续引用时省去无数麻烦。
函数组合技:=COUNTIF 快速统计分类频数,=AVERAGEIF 和 =STDEV.S 组合能按亚组直接输出描述统计量,省去反复筛选的步骤。
分析前先备份: 在副本里做计算,原始数据保持不动,防止误操作覆盖。
图表模板化: 调好第一个图后右键保存为模板,后面批量套用,整篇论文的图表风格保持统一,省时又规范。
Excel在临床科研里的定位很清楚:覆盖常规统计和作图需求,轻量化、零门槛,随开随用。把它跑得动的分析在Excel里高效完成,遇到确实做不了的再分流给专业工具,心里有数就不慌。关键是知道哪一步该停、哪一步可以推进——这份判断力,比死磕某个软件更重要。