TCGA癌症名称对照表:生物信息学数据分析必备工具

TCGA癌症名称对照表:生物信息学数据分析必备工具

1. 项目概述:为什么需要一份清晰的TCGA癌症名称对照表?

如果你正在或即将踏入癌症基因组学的研究领域,尤其是要处理TCGA(The Cancer Genome Atlas)的数据,那么你大概率会遇到一个看似简单却极其磨人的问题:这些癌症的英文全称、缩写和中文名称,怎么就对不上号呢?我刚开始接触TCGA数据时,就曾被这个问题困扰过。下载的数据集文件夹名是“BRCA”,文献里一会儿叫“Breast invasive carcinoma”,中文资料又可能写作“乳腺浸润性癌”。更头疼的是,TCGA官方项目涵盖了超过30种癌症类型,每种都有其特定的命名逻辑和简写规则,没有一个统一的“字典”,在阅读文献、撰写报告、甚至和同行交流时,都容易产生混淆和误解。

这个项目,就是基于我多年处理TCGA数据的经验,整理的一份详尽、准确、可直接查阅的TCGA癌症名称对照表。它不仅仅是一个简单的列表,更是一把帮你快速理解TCGA研究体系的钥匙。通过这份对照表,你可以:

  • 高效查阅:在分析数据时,快速将文件夹缩写(如LUAD)与癌症全称(Lung adenocarcinoma)及其中文名(肺腺癌)对应起来。
  • 准确沟通:在论文写作或项目讨论中,使用规范、统一的术语,避免因名称不一致导致的歧义。
  • 理解分类:透过名称了解TCGA对癌症的组织学分类,例如区分“腺癌”(Adenocarcinoma)和“鳞状细胞癌”(Squamous Cell Carcinoma)。
  • 快速入门:对于新手,这是梳理TCGA庞大癌症类型体系的最佳起点。

无论你是生物信息学分析师、临床科研人员,还是医学领域的学生,这份凝结了实操经验的对照表,都能成为你案头常备的实用工具,节省大量查阅和核对的时间。

2. TCGA癌症命名体系深度解析

TCGA的命名并非随意为之,其背后有一套基于医学分类学和组织病理学的严谨逻辑。理解这套逻辑,不仅能帮你记住名称,更能深化你对这些癌症本质的认识。

2.1 命名构成的三要素

一个完整的TCGA癌症类型标识,通常由三个核心要素构成,这也是我们对照表的三个核心列:

  1. TCGA项目代码/简写 (Abbreviation):这是TCGA数据中最常用、最核心的标识符。通常是2-4个字母的缩写,用于数据集的文件夹命名、文件前缀等。例如BRCA(乳腺癌)、LUAD(肺腺癌)。其构成规则主要有:

    • 器官/组织+类型:最常见的方式。如LUAD=Lung(肺) +Adenocarcinoma(腺癌);LUSC=Lung(肺) +Squamous Cell Carcinoma(鳞状细胞癌)。
    • 纯器官缩写:主要用于该器官最具代表性或唯一研究的癌种。如GBM(Glioblastoma multiforme, 多形性胶质母细胞瘤),特指脑部的这种高度恶性胶质瘤。
    • 特殊缩写:部分采用疾病英文名的首字母组合。如AML(Acute Myeloid Leukemia, 急性髓系白血病)。
  2. 英文全称 (Full Name):指该癌症在医学文献中的标准英文名称。它精确描述了癌症的起源组织和病理学类型。例如,“Breast invasive carcinoma”强调了“浸润性”这一关键临床病理特征。全称是理解疾病本质的关键。

  3. 中文名称 (Chinese Name):对应于英文全称的规范中文医学译名。这是与国内临床医生、科研同行沟通的桥梁。翻译通常遵循“器官+病理类型”的原则,如“肺腺癌”、“肝细胞癌”。准确性至关重要,一个错误的翻译可能导致完全不同的疾病理解。

2.2 从命名看癌症分类学

TCGA的命名直接反映了癌症的分类层次,主要从两个维度:

  • 解剖部位维度:即癌症发生的器官或组织。这是最顶层的分类。例如,所有Lung(肺)开头的项目(LUAD, LUSC)都归于呼吸系统肿瘤。这能帮助我们从宏观上把握TCGA覆盖的癌种范围。
  • 组织病理学维度:即癌细胞在显微镜下的形态和结构。这是区分同一器官不同癌症类型的核心。例如在肺部:
    • Adenocarcinoma(腺癌):癌细胞呈腺样结构,常与吸烟相关但非吸烟者也可发生,多位于肺外周。
    • Squamous Cell Carcinoma(鳞状细胞癌):癌细胞有角化珠或细胞间桥,与吸烟关系极为密切,多位于中央气道。
    • 这两种类型的发病机制、驱动基因、治疗策略和预后都有显著差异。因此,TCGA将其作为两个独立项目(LUAD和LUSC)进行研究,这份对照表清晰地展示了这种重要的区分。

注意:中文命名有时会省略或简化部分病理描述词。例如“Breast invasive carcinoma”严格应译为“乳腺浸润性癌”,但国内部分语境下可能简化为“乳腺癌”。在严肃的科研写作中,建议使用完整、准确的译名。

2.3 容易混淆的命名案例与辨析

在实际使用中,有几组名称特别容易混淆,需要格外留意:

  • LAML vs AML:在TCGA中,LAML特指“Acute Myeloid Leukemia”(急性髓系白血病)。而AML这个缩写虽然在通用医学领域等同于急性髓系白血病,但在TCGA的特定上下文中,它就是LAML项目的代码。这提醒我们,在TCGA体系内,必须使用其官方项目代码。
  • COAD vs READ:两者都是结直肠癌,但COAD(Colon adenocarcinoma) 指结肠腺癌,READ(Rectum adenocarcinoma) 指直肠腺癌。虽然解剖位置毗邻,且常合称为结直肠癌(CRC),但TCGA将其分开研究,提示二者在分子特征上可能存在差异。
  • KICH, KIRC, KIRP:这是一组肾脏肿瘤的经典案例,完美展示了病理分类。
    • KICH: Kidney Chromophobe(肾嫌色细胞癌)
    • KIRC: Kidney renal clear cell carcinoma(肾透明细胞癌)
    • KIRP: Kidney renal papillary cell carcinoma(肾乳头状细胞癌) 它们的缩写巧妙地包含了器官(KI)和关键病理特征(CH, RC, RP),是学习TCGA命名逻辑的绝佳范例。

理解这些命名背后的逻辑,能让你在看到缩写时,不仅仅是在查一个“代号”,而是在脑海中快速关联起其解剖位置、病理特征和临床意义。

3. 核心工具:TCGA癌症名称完整对照表

以下是我根据TCGA官方项目列表、多篇核心论文以及国内医学命名规范,反复校对整理出的对照表。表中不仅列出了三项核心信息,还补充了样本量(Cases)这一关键数据维度,并添加了简要注释,帮助你在使用时获得更多上下文信息。

TCGA简写英文全称中文名称样本量(约)注释与说明
ACCAdrenocortical carcinoma肾上腺皮质癌90罕见的内分泌系统恶性肿瘤。
BLCABladder Urothelial Carcinoma膀胱尿路上皮癌430最常见的膀胱癌类型,曾称移行细胞癌。
BRCABreast invasive carcinoma乳腺浸润性癌1100TCGA旗舰项目之一,包含主要分子分型(Luminal, Her2, Basal-like)。
CESCCervical squamous cell carcinoma and endocervical adenocarcinoma宫颈鳞癌和宫颈腺癌310包含两种主要病理类型,人乳头瘤病毒(HPV)感染是主要风险因素。
CHOLCholangiocarcinoma胆管癌45起源于胆管上皮的癌症,根据部位分肝内和肝外型。
COADColon adenocarcinoma结肠腺癌460常与READ合并分析为结直肠癌(CRC),但TCGA分开。
DLBCLymphoid Neoplasm Diffuse Large B-cell Lymphoma弥漫性大B细胞淋巴瘤50最常见的非霍奇金淋巴瘤类型。
ESCAEsophageal carcinoma食管癌200主要包含食管腺癌(EAC)和食管鳞癌(ESCC),两者病因和地理分布差异大。
GBMGlioblastoma multiforme多形性胶质母细胞瘤600最常见且最具侵袭性的原发性脑肿瘤,TCGA早期重点项目。
HNSCHead and Neck squamous cell carcinoma头颈部鳞状细胞癌530包括口腔、咽、喉等部位的鳞癌,与吸烟、饮酒、HPV感染相关。
KICHKidney Chromophobe肾嫌色细胞癌70三种主要肾细胞癌中预后最好的一种。
KIRCKidney renal clear cell carcinoma肾透明细胞癌540最常见的肾细胞癌类型,占75%-80%。
KIRPKidney renal papillary cell carcinoma肾乳头状细胞癌290第二种常见的肾细胞癌类型。
LAMLAcute Myeloid Leukemia急性髓系白血病200TCGA中血液系统肿瘤的代表,使用LAML而非通用缩写AML
LGGBrain Lower Grade Glioma脑低级别胶质瘤530包含星形细胞瘤、少突胶质细胞瘤等,区别于高级别的GBM。
LIHCLiver hepatocellular carcinoma肝细胞癌380最常见的原发性肝癌,常与乙肝/丙肝病毒感染和肝硬化相关。
LUADLung adenocarcinoma肺腺癌520目前最常见的肺癌类型,非吸烟者比例相对较高。
LUSCLung squamous cell carcinoma肺鳞状细胞癌500与吸烟高度相关,中央型肺癌多见。
MESOMesothelioma间皮瘤85多发生于胸膜,与石棉暴露密切相关。
OVOvarian serous cystadenocarcinoma卵巢浆液性囊腺癌610最常见的卵巢上皮性癌,高级别浆液性癌是研究重点。
PAADPancreatic adenocarcinoma胰腺腺癌180预后极差的“癌王”,以导管腺癌为主。
PCPGPheochromocytoma and Paraganglioma嗜铬细胞瘤和副神经节瘤180起源于肾上腺或肾上腺外嗜铬组织的神经内分泌肿瘤。
PRADProstate adenocarcinoma前列腺腺癌500男性最常见的恶性肿瘤之一。
READRectum adenocarcinoma直肠腺癌170常与COAD合并分析为结直肠癌。
SARCSarcoma肉瘤260来源于间叶组织(骨、软骨、脂肪、肌肉等)的恶性肿瘤,种类繁多。
SKCMSkin Cutaneous Melanoma皮肤黑色素瘤470恶性程度高的皮肤肿瘤,包含原发和转移样本。
STADStomach adenocarcinoma胃腺癌440胃癌的主要病理类型,与幽门螺杆菌感染等相关。
TGCTTesticular Germ Cell Tumors睾丸生殖细胞肿瘤150年轻男性常见的恶性肿瘤,治愈率高。
THCAThyroid carcinoma甲状腺癌510以乳头状癌为主,整体预后良好。
THYMThymoma胸腺瘤120起源于胸腺上皮的肿瘤,常伴发自身免疫性疾病。
UCECUterine Corpus Endometrial Carcinoma子宫体子宫内膜癌560最常见的妇科恶性肿瘤,与雌激素水平相关。
UCSUterine Carcinosarcoma子宫癌肉瘤55罕见的高度恶性子宫肿瘤,含癌和肉瘤两种成分。
UVMUveal Melanoma葡萄膜黑色素瘤80发生于眼睛葡萄膜的黑色素瘤,与皮肤黑色素瘤(SKCM)分子特征不同。

使用心得与注意事项:

  1. 样本量的参考价值:样本量大小直接影响后续分析(如寻找低频突变、进行亚型分型)的统计效力。对于样本量较小的癌种(如CHOL, UCS),在进行分析时需要特别注意结果的可靠性,可能需要采用不同的统计策略或与其他数据集合并。
  2. 版本与更新:TCGA项目本身已经结题,这份列表是其主要癌种的稳定集合。但在使用具体数据时,仍需从GDC Data Portal等官方渠道确认最新的数据版本和样本清单,因为数据清理和更新可能导致可用样本数微调。
  3. “混合”项目的处理:如CESC和ESCA,它们包含了不同的病理亚型。在分析时,需要留意是否需要对亚型进行区分,因为混合分析可能会掩盖亚型特异的信号。

4. 实操应用:如何在数据分析流程中高效使用对照表

整理对照表不是最终目的,将其无缝嵌入到你的数据分析工作流中,才能真正提升效率。以下是我常用的几种实战场景和方法。

4.1 场景一:数据下载与文件管理

当你从GDC Data Portal、UCSC Xena等平台下载TCGA数据时,数据通常按癌症缩写组织在文件夹中。

  • 操作步骤

    1. 使用上方的对照表,将你研究目标对应的英文全称或中文名称,转换为TCGA简写(如,研究“肺腺癌” -> 查找简写为LUAD)。
    2. 在下载界面,直接选择或搜索LUAD项目。
    3. 下载的数据文件可能命名为TCGA-LUAD.htseq_counts.tsv.gz或类似格式。在本地建立项目文件夹时,我强烈建议采用项目简写_中文名的格式,例如LUAD_肺腺癌。这样在文件管理器里一目了然,避免了后续回忆“LUAD到底是哪个癌”的麻烦。
  • 避坑技巧

    注意:TCGA数据有不同“数据层级”(Data Level),如Level 1(原始数据)、Level 3(经过处理的基因表达/突变数据)。对于大多数生物信息学分析,我们直接从Level 3数据开始。下载时务必确认你下载的是所需的数据类型(如基因表达FPKM、体细胞突变MAF文件)和对应的层级。

4.2 场景二:分析脚本与注释文件的通用化编写

在编写数据分析脚本(如R或Python)时,硬编码癌症名称会导致脚本复用性差。利用对照表可以编写更通用的代码。

  • 操作示例(R语言): 假设你需要为多个癌种生成表达量概览图,可以创建一个映射向量或数据框。

    # 创建一个TCGA癌症信息的数据框(部分示例) tcga_cancer_info <- data.frame( Abbreviation = c("BRCA", "LUAD", "LUSC", "COAD"), Full_Name = c("Breast invasive carcinoma", "Lung adenocarcinoma", "Lung squamous cell carcinoma", "Colon adenocarcinoma"), Chinese_Name = c("乳腺浸润性癌", "肺腺癌", "肺鳞癌", "结肠腺癌"), stringsAsFactors = FALSE ) # 定义一个通用绘图函数 generate_summary_plot <- function(cancer_abbr) { # 1. 通过缩写找到中文名,用于图表标题 chinese_name <- tcga_cancer_info$Chinese_Name[tcga_cancer_info$Abbreviation == cancer_abbr] # 2. 动态构建文件路径(假设数据文件以缩写命名) data_file <- paste0("path/to/data/TCGA-", cancer_abbr, ".expression.tsv") # 3. 读取数据并分析... # df <- read.table(data_file, header=TRUE, sep="\t") # 4. 绘制图表,标题包含中文名 # p <- ggplot(...) + ggtitle(paste(chinese_name, "基因表达分布")) print(paste("正在处理:", chinese_name, "(", cancer_abbr, ")")) # 返回或保存图表 } # 批量运行 for (cancer in c("BRCA", "LUAD")) { generate_summary_plot(cancer) }

    这样,当你需要新增一个癌种时,只需在tcga_cancer_info数据框和循环列表中添加对应条目即可,无需修改函数内部逻辑。

4.3 场景三:结果可视化与报告撰写

在生成分析报告、发表论文或制作演示幻灯片时,呈现规范、完整的癌症名称是专业性的体现。

  • 最佳实践

    • 图表中:在图注或轴标签中,建议使用“英文全称(缩写)”的格式,例如 “Lung adenocarcinoma (LUAD)”。如果受众主要是中文读者,可使用“中文名(英文缩写)”,如“肺腺癌(LUAD)”。
    • 正文中:首次提及某个TCGA癌种时,应给出全称并括号注明缩写,后续可使用缩写。例如:“我们分析了来自癌症基因组图谱(TCGA)的肺腺癌(Lung adenocarcinoma, LUAD)和肺鳞状细胞癌(Lung squamous cell carcinoma, LUSC)数据集。”
    • 表格中:可以设立三列:“TCGA项目”、“癌症类型(英文)”、“癌症类型(中文)”,使信息一目了然。
  • 心得分享: 我习惯在论文的“材料与方法”部分或补充材料中,以表格形式列出本研究所用的所有TCGA数据集,包含缩写、全称、样本量。这既是对照表的直接应用,也向审稿人和读者清晰展示了数据来源,增强了研究的可重复性和严谨性。

5. 常见问题与扩展资源

5.1 高频问题速查表

问题可能原因解决方案与建议
在数据库里找不到某个缩写(如“肝癌”找LIVC)?使用了非官方或错误的缩写。TCGA中肝癌的官方缩写是LIHC(Liver Hepatocellular Carcinoma)。回顾对照表,或直接去TCGA官网/GDC门户查询官方项目列表。记忆时联系英文全称。
为什么有的癌症有多个TCGA项目(如LUAD和LUSC)?因为它们是同一器官(肺)下分子特征、病因和预后迥异的不同病理类型。TCGA旨在分别刻画它们的基因组图谱。理解这是基于病理学的精细分类。分析时应根据研究问题决定是单独分析还是合并(如研究泛癌特征时可能合并)。
中文名称不统一,和医院病理报告上的不一样?医学翻译存在习惯差异,且临床病理报告可能使用更具体的亚型名称。以权威教材(如《病理学》)、行业标准或大型数据库(如知网、万方收录的核心期刊常用译法)为准。对于亚型,可在括号内注明英文。
样本量为什么和我下载的实际数据量有出入?对照表中的样本量是TCGA项目收集的大致总数。实际下载时,可能因为部分样本数据不全、质量控制被过滤、或你只下载了特定数据类型(如只下RNA-seq),导致数量减少。以你从数据平台下载后统计的实际样本数为准。对照表的样本量仅用于大致参考和比较不同癌种的规模。
想研究某个癌种,但TCGA里没有?TCGA主要覆盖了常见癌种,并非包罗万象。一些罕见肿瘤、儿童肿瘤或特定亚型可能未被单独列项。可以查看TARGET(儿童肿瘤)、GTEx(正常组织)等补充项目。或考虑使用其他独立研究队列的数据。

5.2 如何获取与验证最新的TCGA信息

尽管TCGA主体项目已结束,但其数据仍在被广泛使用和重分析。确保你信息的时效性和准确性很重要。

  1. 官方源头验证

    • GDC Data Portal (portal.gdc.cancer.gov):这是目前管理和提供TCGA数据的官方门户。在“Repository”页面,你可以浏览所有项目(Projects),这里列出了最权威的项目缩写和全称。
    • TCGA Publications (cancergenome.nih.gov/publications):官网的出版物页面列出了所有主要的标志性论文(Cell, Nature, Cancer Cell等),每篇论文的标题和摘要都规范地使用了癌症全称和缩写,是极佳的参考。
  2. 利用成熟的生物信息学资源

    • R/Bioconductor包:如TCGAbiolinkscuratedTCGAData。这些包的文档和函数帮助中,通常内置了准确的癌症类型映射。
    • UCSC Xena Browser (xenabrowser.net):在数据集的描述中,会明确给出癌症的完整名称。
  3. 建立个人知识库: 建议将本文的对照表保存为本地CSV文件或纳入你的笔记软件(如Notion, Obsidian)。在每次开始一个新的TCGA相关项目时,首先核对和更新这份列表,并记录下你本次分析使用的具体数据版本和样本ID列表。长此以往,你就构建起了自己专属的、带有个性化注释的TCGA元数据知识库,这将成为你科研路上的一大助力。