两类组学资料具有不同时间尺度与测量误差。整合的重点不是把颜色叠在一起,而是建立可解释的因果候选。
先承认两种测量并不同步
转录组测量 RNA 丰度,代谢组测量化合物在取样时的相对或绝对水平。RNA 变化需要经过翻译、蛋白折叠、酶活调节和底物供应,才可能影响代谢物。某个基因先上调、代谢物稍后改变是合理现象;在单一时间点要求两者方向一致,反而会错过动态过程。
样品设计决定能够解释什么。若转录组和代谢组来自不同组织、不同批次或不一致的取样时间,网络上的相关性很容易混入实验差异。整合之前应先统一样品身份、处理条件和时间轴。
网络提供的是邻近关系
把差异基因和差异代谢物映射到通路后,可以观察它们是否聚集在同一反应附近。邻近不证明因果,却比全局相关更容易形成具体假设。例如上游酶基因改变、下游产物同时变化,值得进一步检查酶活与底物;若变化发生在完全不同区室,则需要考虑运输过程。
网络还可以暴露缺失信息。代谢物变化明显但附近没有差异基因,可能说明调控发生在蛋白质层、注释不完整,或测到的是外源与降解过程。缺口不是分析失败,而是下一层实验的入口。
富集分析回答集合问题
Fisher 精确检验常用于判断一组候选基因是否在某条已知通路中过度出现。它比较候选集合与背景集合中的比例,结果受到背景基因定义、通路大小和多重检验校正影响。显著结果说明集合重叠超出随机预期,不等于通路中的每个反应都被激活。
背景集合应与实验可检测范围一致。RNA 测序中没有表达或无法可靠测量的基因,不应无条件放进背景。代谢组的注释覆盖更不均匀,也不能把未鉴定峰值简单当作不存在。
相关网络需要防止共同趋势
多个基因和代谢物可能因为同一发育阶段或环境处理同时变化,产生很高相关,却没有直接作用。时间序列、处理对照和部分相关可以减少误判,但仍需要实验验证。若样本数很少,复杂网络看起来丰富,统计稳定性却可能很低。
网络阈值也会改变图形。阈值过松会形成巨大连通团,过严则只剩少量强关系。合理做法是展示阈值敏感性,并区分数据库已知边、统计关联边和算法预测边。
交换格式让分析可以继续
XGMML 能保存节点、边和属性,适合把网络带到 Cytoscape 继续筛选和绘图;SBML 更关注生化模型中的实体、反应和参数。两者用途不同,不能只因为都能表示网络就互换而不检查语义。
导出时应保留物种、基因编号版本、区室、证据类型和分析日期。只有节点名称而没有属性的网络,很难在几个月后重现。可复现不是多保存一个文件,而是让别人知道每条关系从哪里来、经过什么转换。
从图回到候选实验
整合分析最终应产生有限、可检验的候选。例如选择一个代谢变化明显的支路,确认相邻酶基因、蛋白活性、区室位置和时间顺序,再设计验证。若一次提出几十条同等重要的关系,通常说明筛选标准仍不够清楚。
最有价值的结果不一定是完全一致。有时转录与代谢方向相反,正好提示反馈抑制、底物竞争或运输限制。网络的工作不是消除矛盾,而是把矛盾放到可以解释和验证的位置。
时间序列能够把先后关系带回分析
单一终点只看到处理后的差异,无法判断转录变化发生在代谢物之前还是之后。增加早期、中期和恢复期样本,可以观察候选基因是否先响应、酶活是否随后改变、代谢物是否累积,以及撤除处理后是否回到基线。
时间点并非越密越好。植物昼夜节律会制造周期变化,取样时间若不一致,处理效应可能与昼夜效应重叠。实验设计需要在生物过程的速度、样本数量和测量成本之间平衡。
绝对浓度与相对变化回答不同问题
非靶向代谢组常报告峰面积或相对丰度,适合比较同一平台内的变化;靶向方法通过标准品校准后,更接近绝对浓度。相对信号不能随意跨平台比较,也不能直接进入需要物质量单位的动力学模型。
转录组的标准化同样影响结果。总 RNA 组成大幅变化时,常见归一化假设可能失效。网络整合前应理解每一层资料的单位和参考基线,而不是把所有数值缩放到同一颜色范围就认为可比。
缺失值不是一个统一类别
代谢物缺失可能因为低于检测限、峰值识别失败、样品问题或该化合物真实不存在。不同原因需要不同处理。把所有缺失值填成同一个小数,会人为制造相关关系;直接删除则可能系统性排除低丰度支路。
RNA 测序中的零计数也要结合测序深度与表达背景。资料清理步骤应在网络分析前记录,让后续读者知道某个节点没有颜色究竟代表未测到、未注释还是没有变化。
批次效应可以生成一张非常漂亮的假网络
若病例与对照恰好在不同批次处理,主成分和相关网络可能主要反映仪器漂移、试剂批次或操作日期。随机化样品顺序、加入质量控制样品和记录批次,是组学整合的前提。
批次校正不是删除所有差异。校正模型若把真实生物条件与批次混在一起,也会抹掉目标信号。设计阶段避免完全混杂,通常比事后使用更复杂算法可靠。
蛋白质和酶活能补上中间层
转录本与代谢物之间隔着蛋白质丰度、翻译后修饰和酶活。加入蛋白质组或少量关键酶活测量,可以判断不一致发生在哪一层。即使无法做全蛋白质组,针对候选支路的生化测定也能显著提高解释力。
代谢通量比静态浓度更接近过程速度,但同位素示踪和通量模型需要更严格的实验与假设。浓度不变可能是生成和消耗同时加快,不能简单解释为通路没有响应。
从候选网络到验证实验需要缩小范围
网络整合常会产生数百个候选关系。验证阶段不应平均分配资源,而应优先选择证据来源独立、位置合理、时间顺序成立且能够通过实验操作的关系。一个候选若只由同一批资料中的相关性支持,优先级应低于同时得到遗传、定位或生化证据的候选。
验证也不是只重复一次表达测量。可以改变候选基因、补充底物、测定酶活或观察亚细胞定位,选择真正能区分多个解释的实验。
负结果同样可以改善网络
候选关系未通过验证,不代表整项组学研究失败。它可能说明相关来自共同上游、预测定位错误、处理条件不适用或资料版本不一致。把负结果反馈给网络,可以降低边的置信度并修正下一轮筛选。
数据库如果只收录正结果,会让网络越来越密集,却无法显示哪些关系已经被认真检验。记录实验条件下的不支持证据,有助于避免其他研究者重复走同一条错误路径。
图形展示要避免颜色制造过度确定感
常见网络图用红绿表示上调和下调,但色觉差异、缩放范围和极端值会影响阅读。颜色之外还应提供数值、图例和可筛选属性;不同组学层最好使用形状或分面区分,而不是全部依赖色相。
一张适合论文展示的静态图与一份适合探索的交互网络用途不同。前者需要突出有限结论,后者应允许追溯节点、边和来源。不要让一个为了美观而简化的图成为唯一归档。
整合报告应保留没有进入主图的结果
主图为了可读性通常只展示少量通路和候选,但完整差异表、过滤标准和未匹配对象仍应归档。否则读者无法判断结果是资料本身集中,还是作者只选择了最符合叙事的部分。
补充资料不应成为无说明的数据堆。每份文件需要列名定义、单位、版本和与正文图表的对应关系,让其他研究者能够从结论返回原始分析。若数据不能公开,也应说明限制原因和可提供的汇总层级。分析脚本中的随机种子、软件包版本与过滤参数同样应保存,否则相同数据也可能产生不同网络。读者据此才能判断差异来自生物样本还是分析设置,并在后续数据加入时沿用相同基线。