POPGENE遗传多样性分析实战:从数据格式到结果解读 📅 发布时间:2026/9/20 13:43:40 👁 浏览次数: 简介POPGENE是一款基于Windows的免费物种遗传分析软件这份图文版中文使用教程正是为它而写的适合从事群体遗传学、分子生态学研究的科研人员和研究生快速上手。内容依托软件实际界面展开系统介绍了POPGENE的窗口构成、八大菜单功能并围绕Haploid Data Analysis与Diploid Data Analysis两大对话框逐一讲解了基因频率、等位基因数、多态性位点、基因多样性、Shannon信息指数、Hardy-Weinberg检验、F统计量、基因流、遗传距离、UPGMA树形图及中性检验等常用分析模块的操作要点还说明了数据文件表头与记录格式的编写方法。资源以1份PDF文档呈现体积仅1.03MB方便随时翻阅目前已有344人学习。对于需要完成遗传参数计算、种群结构评估和亲缘关系分析的学者而言这份中文教程能节省大量摸索英文软件界面的时间是一款实用性强、可读性好的入门参考。 手头这份《POPGENE中文使用教程参照.pdf》是我近几年见过流传最广、也最劝退新手的一份遗传学分析资料。POPGENE 是老牌的种群遗传多样性分析软件很多实验室至今还在用它算遗传参数可它的英文界面、老版本兼容性和严格的数据格式让不少人一打开就懵。很多人下载完教程 PDF真正卡住的往往不是软件装不上而是数据格式到底该怎么排、分析结果里哪一列才是自己论文要的那个数字。这篇稿子就围绕这份 PDF 的核心内容把从软件安装、数据整理到结果解读的完整流程重新拉一遍特别适合正在做微卫星、SSR、RAPD、AFLP 等分子标记的硕士生和研究人员参考。1. 项目概述与整体思路1.1 POPGENE 是什么解决什么问题POPGENE 是加拿大阿尔伯塔大学团队在上世纪九十年代后期发布的一款免费种群遗传学分析软件它最早主要为等位酶、RAPD、AFLP 和微卫星标记设计后来被许多农林和生态方向的课题组沿用至今。它的核心能力可以分成三块一是计算基础遗传多样性参数比如每个位点的等位基因数、期望杂合度、多态位点比例二是做群体遗传结构检验比如哈代-温伯格平衡、群体分化指数和基因流三是输出遗传距离矩阵方便后续做聚类图。用一句通俗的话说把基因型数据丢进去它能帮你回答“这一个物种的群体是不是分化了”“哪些地理群体更接近”“遗传多样性是高是低”这类问题。1.2 为什么一本老教程还能被反复“参照”很多学校实验室的公共电脑上还装着 POPGENE 1.31/1.32因为审稿人和老一代老师认这套软件的输出格式。于是网上流传的各种中文 PDF 就成了一种“操作手册”但这类 PDF 大多来自不同年份的转载或翻译菜单名称、数据示例、输出结果表经常对不上号。更麻烦的是软件本身不更新和 Windows 10、11 的兼容性问题越来越多按 PDF 里的说明点击却弹不出窗口的情况很常见。所以我更愿意把这本 PDF 当成“关键词对照表”来用真正的操作细节还是需要一遍一遍跑示例数据。这篇稿子就从这份 PDF 出发把那些容易踩坑的地方全部补齐。2. 软件准备与数据整理2.1 版本选择与运行环境我建议直接使用 POPGENE 1.31 或 1.32 的 Windows 版本32 位绿色软件。下载后放到一个纯英文路径下比如 D:\popgene文件夹名不要带中文和空格。如果你的电脑是 Win10 或 Win11右键主程序图标进入“属性 - 兼容性”勾选“以兼容模式运行”下拉选择 Windows XP Service Pack 3再勾选“以管理员身份运行”可以解决大部分启动不了的问题。高分屏下字体偏小的话在兼容性设置里点击“更改高 DPI 设置”勾选替代高 DPI 缩放行为让 Windows 来缩放界面会清楚一些。老软件别放 C 盘 Program Files 里权限和虚拟化设置容易干扰它读写文件。2.2 一个能直接抄的数据格式模板POPGENE 对数据文件极其严格多数人都是在这一步被劝退的。我平时用的模板是这样的第一行是说明文字第二行依次写“群体数、每个群体的个体数、位点数”第三行开始是第一个群体的群体名然后每个样本占一行每个样本先写个体编号再按位点顺序写等位基因。共显性标记比如 SSR、SNP每个位点要用两列例如某个位点的两个等位基因是 101 和 101就写“101 101”显性标记RAPD、AFLP每个位点只有一列写 1 或 0分别代表有带和无带。缺失的等位基因用 0 占位不要留空也不要用“NA”。我实际常用的模板如下可以直接复制改数据My SSR data for POPGENE 3 6 4 PopA A01 101 101 203 207 152 152 88 88 A02 101 103 203 203 150 152 88 90 A03 101 101 207 207 152 154 88 88 A04 101 101 203 203 152 152 88 88 A05 101 103 207 207 150 152 88 88 A06 101 103 203 207 152 152 88 88 PopB B01 101 101 203 203 150 150 88 88 ... PopC C01 101 101 203 207 152 152 88 88 ...上面这个例子声明了 3 个群体、每个群体 6 个个体的前一部分、共 4 个位点所以每条数据行里就应该包含 8 个数字四个位点乘以两个等位基因。如果你的数据文件是从 Excel 直接粘贴生成的一定要检查是不是把 tab 或者逗号带进去了POPGENE 通常只认空格分隔。2.3 从 Excel 整理数据时最容易出的问题我自己习惯先在 Excel 里把不同群体的数据分成不同的区块因为每个群体的个体数一致时第二行的数字才不容易填错。整理完成以后另存为文本文件再用记事本打开把所有连续空格替换成单个空格如果 Excel 保存的是制表符分隔用记事本里的“编辑 - 替换”把 tab 替换成空格这一步能减少非常多的解析错误。文件名和路径全部用英文和数字不要出现中文。很多新手把群体名写成“北京群体”“四川群体”结果程序读出来乱码不说第二行的个体数还会对不上数据根本跑不出来。再强调一遍缺失值写 0不要写 NA 或留空如果某个位点两个等位基因都缺失就写“0 0”。3. POPGENE 实操全流程3.1 打开数据文件后首先检查什么双击 POPGENE 主程序后先别急着点统计菜单。大部分版本在菜单栏提供 File、Data、Statistics 这样的入口你需要在 File 菜单里打开或新建项目然后指定刚才准备好的 txt 文件作为输入数据。数据加载正常时菜单栏里的 Statistics 应该从灰色变为可用状态如果还是灰色基本可以断定是数据格式没读进去。这时候回到 POPGENE 自带的示例数据对照它原样的文件头逐行检查第二行的三个数字是否与实际数据行列数一致尤其是“每个群体的个体数”这一项。不同群体个体数不一样时POPGENE 老版本很难处理宁可补上缺失个体行再用 0 填充缺失位点也不要把个体数写成不整齐的数字。3.2 参数设置共显性数据和显性数据绝对不能混用数据读入后进入 Data 或 Options 相关菜单确认分析类型是 Codominant 还是 Dominant。用 SSR、微卫星、SNP 的结果选 codominant用 RAPD、AFLP 这类显性标记选 dominant。这个选项会直接影响后面一大堆计算逻辑因为显性带型数据无法区分杂合子很多参数只能按频率近似估计。如果在分析前不确认可能最后得到的 Ho、He 完全是错的但程序不会报错这一点很“阴险”。另外如果你研究材料是多倍体或者单倍体也要在相应选项里设置POPGENE 默认多数是三倍体或二倍体的格式需要改成与你实验设计一致的模式。3.3 核心分析流程与结果保存我通常按固定顺序操作先算遗传多样性再检验哈代-温伯格平衡最后算遗传距离。遗传多样性一般通过 Statistics 菜单里的 Summary Statistics 输出勾选所有位点和所有群体可以得到 Na、Ne、I、Ho、He、Fis 等参数。Hardy-Weinberg 检验在 Statistics 菜单里单独进入选择全部位点后输出到结果窗口里面包含卡方值和 P 值。遗传距离则在 Statistics 菜单里的 Genetic Distance 子菜单选择常用的是 Nei 1972 或 Nei 1978程序会输出遗传距离矩阵和遗传相似度矩阵。结果窗口的内容可以直接复制也可以保存成文本保存时注意输出路径同样不要有中文。要是想继续画聚类图把遗传距离矩阵复制出来用 MEGA 或 R 画 UPGMA 树POPGENE 自带的作图模块出图太古老放到论文里不好看。3.4 用 R 快速从距离矩阵画 UPGMA 树如果在 3.3 里把遗传距离矩阵保存成了文本文件 distance.txt那么用 R 画 UPGMA 树其实很简单。打开 R 或 RStudio执行下面几行d - as.dist(read.table(distance.txt)) hc - hclust(d, method average) plot(hc, hang -1, main UPGMA tree)这里的 method average 就是 UPGMA 算法hclust 的横坐标默认是群体编号你可以把行名改成实际群体名。画完以后用 ggtree、ape 包再美化也行。这一步虽然不是 POPGENE 必须做的却是论文出图常用流程很多 PDF 教程没细讲我在旁边补一句。4. 核心结果参数解读4.1 遗传多样性参数速查表拿到 POPGENE 输出后新手最容易做的一件事是把整个结果窗口截图丢进论文截图里其实充斥着无关信息。我建议只从输出里摘下面这几个关键值按群体整理成表格缩写全称/含义论文里怎么写Na观测等位基因数反映位点上的等位基因丰富度The observed number of alleles (Na) ranged from...Ne有效等位基因数根据等位基因频率换算Effective number of alleles (Ne) was...IShannon 多样性指数综合了丰富度和均匀度Shannons information index (I)...Ho观测杂合度某个位点上实际杂合个体比例Observed heterozygosity (Ho)...He期望杂合度/Nei 基因多样性Expected heterozygosity (He)...Fis群体内近交系数The fixation index (Fis) was negative/positive...PPL多态位点比例Percentage of polymorphic loci (PPL)...表格里的 Na、Ne 都先按位点算再对群体做平均He 比 Ho 更常用做多样性水平的标准指标因为 He 受样本量影响更小。PPL 要注意你采用的判定标准通常用 0.95 或 0.99 多态标准不同标准算出来的数值不同。4.2 Fst、Nm 与群体分化判断POPGENE 的群体分化分析里最常被引用的两个数字是 Fst或者 Gst和基因流 Nm。Fst 越大说明群体间分化越明显。经验上可以粗略用 Wright 的划分Fst 在 0 到 0.05 之间表示分化很弱0.05 到 0.15 是中等分化0.15 到 0.25 分化较大超过 0.25 分化很大。当然这只是经验值物种差异、标记类型都会影响判断。基因流 Nm 则由 Fst/Gst 估算而来一般 Nm 大于 1 表示基因流足以抵抗遗传漂变群体间难以因为随机漂变产生明显分化Nm 小于 1 时漂变占上风群体更容易各自分化。写论文时不要只丢一个 Fst 值要把位点数量、样本量和计算方法写清楚这样才经得起推敲。4.3 Hardy-Weinberg 检验和 Fis 要配合着看很多人看到 P 0.05 就赶紧写“偏离哈代-温伯格平衡”但这只是一个统计结论生物学原因需要结合 Fis 一起解释。微卫星数据里出现显著偏离最常见的原因不是自然选择而是无效等位基因或基因分型误差。无效等位基因会导致明显纯合过剩Fis 变成显著正值如果 Fis 是显著负值说明杂合子偏多可能是种群存在选择压力或者样本混了不同亚种群。我在写文章时通常先检查数据质量重复样品的基因型是否一致、缺失率是否过高然后再决定把这个偏离归因给近交、群体结构化还是技术误差。5. 常见问题与排查技巧实录5.1 数据读不进去先做一张排错表每次有学弟学妹带着“文件打不开”来找我我都让他们先把这些情况对一遍现象可能原因解决办法打开后只显示标题行后面没有数据第二行的三个数字和实际行列数对不上数一遍群体数、每个群体个体数、位点数提示数据行数不足或读取错误群体之间保留空行导致程序误以为数据结束删除所有空行报错说 missing value缺失值写了 NA、空格或者点号全部替换成 0两个等位基因缺失写“0 0”结果里位点数量感觉少了一半共显性数据每个位点只给了一列改成每个位点两列打开文件是乱码群体名或路径带中文全部改成英文数字文件另存为 ANSI 编码5.2 老软件在 Win10/11 下打不开的完整处理顺序如果你双击 POPGENE 后界面闪一下就没反应先不要重新下载。按这个顺序试右键主程序 - 属性 - 兼容性 - 勾选以兼容模式运行并选择 Windows XP SP3再勾选“以管理员身份运行”接着把整个程序文件夹移动到 D 盘根目录或纯英文目录最后关闭杀毒软件对老版绿色软件的限制或把它加入信任区。如果还想根治界面中文乱码可以在 Windows 的区域设置里勾选“Beta 版: 使用 Unicode UTF-8 提供全球语言支持”但这会影响其他软件不太建议开。多数情况兼容模式就够了。5.3 结果截图抵御审稿人的小技巧POPGENE 自带结果窗口的字体和边框都比较原始直接截图放进论文里确实不好看。我的做法是不截图直接选中结果文字复制到 Excel然后只保留需要的参数列做成规范的三线表。遗传距离矩阵同理复制到 Excel 再转置。这样做一方面避免截图模糊另一方面也方便后续做聚类图或者算其他统计。如果必须使用 POPGENE 自带的图建议把窗口背景设为白色并拉大窗口再导出至少别把灰色工具条截进去。6. 做 POPGENE 分析的一点个人建议6.1 先把自带示例数据跑通一遍这是我能给的最直接建议。网上下载的 POPGENE 压缩包里通常会带一个示例数据文件打开软件后先打开这个示例把所有菜单点一遍看生成的输出长什么样。等熟悉了每个参数对应的结果位置再把自己的数据替换进去。我当时花了整整一个下午卡在数据格式上后来把示例文件里的数字一个个替换成自己的数据才意识到第二行那个“每个群体个体数”必须严格一致。这个小动作能省下你和导师反复沟通的很多时间。6.2 把数据整理模板固化下来一劳永逸既然格式这么容易错我建议你做一个固定 Excel 模板。第一列写个体编号后面每个位点占两列分别是等位基因 1 和等位基因 2不同群体之间用颜色区分。每次拿到新的测序结果只要把位点名和基因型填充进去再通过一个简单的“文本拼接”公式把行生成好另存成 POPGENE 需要的空格分隔 txt。这样不但省时间还降低了漏列、错行的概率。我用这个办法帮实验室处理过十多个物种的数据再没有因为文件格式被卡过。本文还有配套的精品资源点击获取