Aim 1:建立可重复的AD相关hERV表达图谱,并解析其细胞状态特异性 首先需要建立统一的hERV表达定量体系。hERV注释版本目前暂定为待确定,正式分析前需要根据完整hERV/LTR结构、位点分辨率以及与后续长读长分析的兼容性确定一个固定版本,之后所有RNA、ATAC和遗传分析均使用同一套GRCh38坐标,避免不同数据来源之间由于注释差异造成候选位点无法对应。常规gene annotation也需要固定GENCODE版本。 对于短读长snRNA-seq,整体思路可以延续本科研究已经建立的STAR/STARsolo+Stellarscope流程。hERV最大的问题是基因组中大量高度相似拷贝会产生multi-mapping reads,如果直接只保留unique reads会明显降低部分位点的有效信息。因此在比对阶段保留多重比对信息,再利用Stellarscope的EM模型进行位点级重新分配,同时保留常规gene表达矩阵。Stellarscope本身就是针对单细胞低深度和重复序列多重比对问题开发的位点级TE定量方法,其研究还表明TE表达能够为细胞亚型划分提供常规gene之外的信息。 除位点层面外,可以继续保留family/subfamily层面的统计作为整体趋势,但后续机制研究重点放在能够明确定位到具体基因组位置的hERV上。 不同队列分别完成QC、doublet过滤和基于canonical genes的细胞类型注释,再将不同研究中的大类统一为EX、INH、MG、ASC、ODC、OPC、END/PER等可对应类别。整合方法可以用于帮助细胞类型匹配和可视化,但疾病效应统计原则上保留donor作为生物学重复。主差异分析以donor×cell type形成pseudobulk,例如把某个供体全部microglia的hERV counts汇总成一个MG pseudobulk,再比较AD与control;MAST等单细胞模型则作为辅助,用于观察细胞内异质性和与本科结果衔接。这样可以避免将数万个细胞错误地当成数万个独立病例,同时也能直接加入年龄、性别、PMI、RIN、batch等样本级协变量。本科论文已经把pseudobulk或混合模型作为扩大样本后的重要改进方向,因此这一部分实际上是对前期研究的自然延伸。 对于GSE157827、GSE174367和GSE214979,可以进行较标准的AD–NC比较;GSE263468和GSE268599还提供了从低到高的病理阶段,因此除了二分类差异外,更重要的是建立hERV expression~pathology stage的连续或分阶段模型。这样最终能够区分三种情况:某个hERV只在晚期AD突然变化;某个hERV从低病理阶段开始逐步改变;以及某些hERV在中间阶段出现短暂反应、到终末阶段又恢复或反向。后一类现象如果单纯做AD/NC二分类很容易被忽略。 这里还需要进一步解决导师提出的“异质性条件下找特定情况”。对于microglia、astrocyte、oligodendrocyte和神经元等主要细胞类型,不只比较整个cell type的平均hERV,而是在大类内部重新研究cell state。正式分析中优先使用canonical gene和已知AD相关gene signature定义细胞状态,例如homeostatic与inflammatory microglia、DAM-like状态、reactive astrocytes或易损神经元状态,然后再比较这些gene-defined states中的hERV。这样可以回答一个非常重要的问题:AD中的某个hERV升高,究竟是因为同一种细胞状态中的hERV本身发生了改变,还是因为AD增加了一个本来就具有高hERV表达的细胞亚群。 与此同时,对于已经筛出的candidate hERV,还可以在同一cell type内部比较HERV-high和HERV-low细胞的gene expression和markers,从而判断“表达该hERV的细胞处于什么状态”。这类分析在解释hERV与免疫、干扰素、补体、脂质代谢或突触功能的关系时会非常有用,但需要注意它只能说明关联,不应直接表述为hERV导致了该细胞状态。反过来使用hERV表达本身进行聚类、观察是否能够进一步区分细胞亚型,也可以作为探索性分析,但不能再用“这个亚群hERV高”作为独立验证证据,否则会形成循环论证。 每个数据集独立获得AD效应值后,再进行跨队列比较和meta-analysis。最终关心的不只是某个FDR是否小于0.05,而是每个candidate在多个PFC数据集中的effect direction是否一致、效应大小是否接近以及heterogeneity是否很高。对于以前出现过的例如某些HERVK结果与其他研究方向不同的情况,这种策略尤其重要:如果同一个位点或亚家族在4套独立PFC队列中均呈现同方向变化,同时还能在GSE222494、GSE147528等小型独立前额叶队列中复现,那么其可信度远高于某一篇既有研究中的单一结果。GSE237718则作为真正的跨脑区验证,判断这些变化究竟属于较普遍的AD皮层变化,还是前额叶特异改变。 Aim 2:利用长读长解析hERV转录本结构,并将结构信息投射回大规模短读长数据 第二部分解决的问题不是“某个RepeatMasker区间有没有reads”,而是“这些reads实际属于什么RNA分子”。这是本研究与前期工作的一个关键区别。 两个长读长数据集提供21位AD/NC供体,分别来自ONT和PacBio两个独立技术体系。SRP456327的12个BA9/46样本每个使用一个PromethION flow cell,平均每份样本具有很深的长读长覆盖,已经被证明可以识别大量复杂脑RNA isoform。 ENCODE的9个DLPFC样本则使用PacBio Sequel II,可作为不同平台的结构复现。已有研究已经同时使用这两套数据比较AD DLPFC中的长读长剪接事件,因此将它们联合用于hERV transcript structure研究在数据层面是可行的。 具体分析中,将ONT和PacBio reads分别进行适合各平台的质量控制后,比对至GRCh38,并进行transcript reconstruction/collapse和结构QC。这里不需要为了所有gene重新发明完整isoform annotation,而是重点提取与hERV/LTR区域相交的完整长分子。一个长read如果能够从5′LTR连续经过internal region直到3′LTR,或者多个高质量长read支持同一结构,就可以作为“putatively full-length HERV-derived transcript”的重要证据;之所以使用“putatively”而不是直接称为full-length,是因为RNA覆盖完整并不意味着该基因组拷贝一定具有完整、功能性的gag/pol/env开放阅读框,也不能仅凭RNA测序证明其具有病毒颗粒形成能力。 另一类需要重点鉴定的是HERV-gene chimeric transcript。如果hERV/LTR位于转录本5′端,并通过splice junction连接到下游gene exon,可以进一步判断其是否可能作为alternative promoter或new 5′exon;如果gene exon连接到hERV,则可能形成internal exon、3′UTR或terminator。还要单独区分宿主gene readthrough,即RNA本身由上游gene promoter启动,只是在延伸过程中进入hERV区域。在这种情况下,即使hERV区域存在很高RNA coverage,也不能简单解释为hERV自主激活。这正是长读长数据比10x 3′数据更关键的地方,因为10x数据主要捕获转录本3′端,很难可靠识别TSS以及远距离外显子连接关系。前期暑假分析中已经出现过大量alternative promoter、internal/terminator和readthrough候选,这部分可以直接由探索性junction分析升级为长读长分子直接验证。 最终可以把候选大致归为putatively full-length、HERV-gene chimeric、LTR-only/regulatory、host-gene readthrough和uncertain等类别。长读长在这里主要承担“定义结构”的作用,而不是承担最终AD差异统计。两套长读长加起来21位供体已经足够形成一套有意义的脑hERV transcript reference;真正需要大样本回答的是这些结构在什么细胞中表达、是否在AD中改变,因此下一步需要把长读长发现的可靠transcripts加入自定义annotation,再映射回前面的短读长数据。 对于bulk total RNA,可以直接检查candidate transcript的5′LTR、internal、3′LTR覆盖以及HERV-gene junction;对于snRNA-seq,因为单个细胞覆盖低,不要求每个细胞都重新组装完整转录本,而是根据长读长已经定义好的结构,统计支持该转录本的informative reads或UMI,并在donor×cell type层面聚合。这也是解决“位点表达稀疏怎样提高丰度”问题更准确的方式:并不是通过计算让真实RNA abundance升高,而是通过已知转录本结构把5′LTR、internal、3′LTR和特异junction等证据联合起来,提高低丰度转录事件的有效检测灵敏度。相比直接做单细胞表达imputation,这种方法更不容易人为制造重复序列表达信号。 Aim 3:解析hERV表达变化的上游调控因素及其潜在功能 得到具有可靠AD差异和转录结构的candidate之后,第三部分开始回答“为什么这个hERV会变”。 这里不预设所有hERV都遵循同一种机制,而是把每个candidate看作一个需要逐层建立证据的调控事件。第一层是宿主转录背景:结合长读长结构、strand、邻近gene位置、short-read junction以及HERV-gene expression关系,先确定该hERV是否可能主要由host gene transcription解释。如果一个hERV位于高表达gene intron中、同链,并且长读长显示转录从上游gene连续进入hERV,那么其AD变化很可能与宿主gene转录有关;相反,如果hERV位于intergenic region或反义链,并具有独立5′端和完整hERV结构,自主转录解释会更可信。 第二层是局部染色质开放。GSE174367可以在cell type层面重新进行DAR分析,检查candidate hERV本体、5′LTR以及±2kb/±10kb区域是否存在AD相关开放性变化。GSE214979则更有价值,因为10x Multiome在同一细胞核内同时测量RNA和ATAC,能够更直接地分析某类细胞中LTR accessibility与hERV expression的关系。 需要强调的是,RNA↑并不要求ATAC一定↑。如果两者一致,可以支持local chromatin opening参与hERV激活;如果RNA和ATAC不一致,则反而提示宿主gene readthrough、TF regulation、RNA stability或者更复杂的转录后机制可能更重要。这种“不一致”不是失败结果,而是机制分类本身的一部分。 第三层是TF调控。不能仅仅扫描LTR序列发现一个NF-κB或IRF motif就认为该TF调控hERV,而是需要把“结合位点”和“TF本身是否活跃”结合起来。较完整的证据链应当是:candidate的5′LTR附近存在某TF motif,同时该区域在对应AD cell state中变得开放,该TF自身的表达或者chromVAR motif activity也发生改变,并且hERV RNA方向与这一变化相符合。对于microglia和astrocyte,可优先关注NF-κB、IRF、STAT、AP-1、SPI1、C/EBP等与炎症、干扰素和胶质细胞状态相关的TF,但正式分析不限定于预先挑选的TF,而应同时进行motif enrichment,避免只验证既有预期。Morabito等人在AD snATAC中通过chromVAR和TF footprint识别疾病相关TF程序,为这一分析提供了直接的方法学参考。 这几层证据最终可以形成位点级regulatory evidence matrix,而不是强行让所有hERV进入一个机制类别。一个candidate可能主要属于host-gene/readthrough-driven,另一个可能表现为local chromatin opening+TF activation,第三个可能同时受到多个因素影响。最终可以将其概括为宿主转录/嵌合驱动型、局部表观开放驱动型、TF/细胞状态相关型、多因素复杂调控型以及机制未确定型。 导师提到是否最终进行“定量”而不是只做“定性”,这可以放在上述证据框架之后,而不是一开始就把整个课题设计成机器学习预测问题。如果同一批供体中能够获得足够匹配的RNA和ATAC信息,例如GSE214979,可以进一步建立相对简单的多变量模型: hERV expression ~ local accessibility + nearby/host gene expression + TF activity + diagnosis/pathology + covariates 然后比较不同变量加入后模型解释度、效应大小及显著性变化。这样可以回答某个位点更主要受local accessibility解释,还是与host gene或者TF activity关系更强。如果未来获得SEA-AD这种更大规模matched multiome,再考虑构建真正的hERV expression prediction model会更合理;当前proposal中可以把它定义为条件允许时的进一步定量分析,而不是必须完成的核心终点。 功能分析则需要与前面的cell state和regulatory mechanism结合,而不是停留在一张GO图。对于candidate,可以分别通过hERV-gene correlation、HERV-high vs HERV-low DEG以及共表达模块寻找相关gene,再对这些gene进行GO/GSEA。前期本科结果已经提示不同细胞中的hERV与免疫激活、抗病毒反应、突触、髓鞘和细胞通讯等功能相关。 后续可进一步重点考察干扰素、TLR/RIG-I、补体、APOE-TREM2、脂质代谢、吞噬、髓鞘形成、突触功能和神经元应激等AD相关过程。 GO结果本身不作为机制证明。每个重要功能结果还需要经过三个层次的检查:是否已有文献报道类似hERV或相关通路;在独立AD队列中该hERV–gene/module关系能否复现;未来有实验条件时,能否通过RT-qPCR、CRISPR、reporter assay等方式验证。这种设计可以避免把观察性共表达直接写成“hERV导致某通路改变”。 Aim 4:通过跨队列复现和遗传学整合建立高可信AD相关hERV 最终的candidate筛选不会只根据一次差异分析的P值,而是把前面得到的多种独立证据逐渐收敛。最理想的候选应同时具有稳定的AD相关表达变化、明确的cell type/cell state背景、长读长支持的转录本结构、至少一种可信的上游调控机制,以及能够解释的gene/module功能关系。如果还能够在GSE237718颞叶数据中重复,则说明它可能属于较普遍的AD皮层hERV改变;如果只在PFC重复,而在temporal cortex没有相同趋势,则可以进一步研究其脑区特异性,而不是把它直接判为“验证失败”。 遗传分析则作为最后一层独立证据。由于当前假定没有自己的个体基因型,所以这部分不能直接从约100位snRNA供体计算HERV-eQTL,而是首先寻找公开的brain/cortex HERV-eQTL summary statistics,目前标注为待确定。这一步非常重要,因为之前考虑使用的OneK1K单细胞HERV-eQTL来自981位健康人的外周PBMC,虽然该研究证明了大量HERV具有cell-type-specific genetic regulation,但其组织不是脑,而且作者为了研究相对自主的HERV转录,还去除了与gene exon重叠的HERV,因此与当前尤其关注HERV-gene chimeric transcript的目标并不完全一致。 如果能够找到包含SNP、effect allele、HERV expression effect、SE和P值的brain HERV-eQTL summary statistics,就可以与AD GWAS GCST90027158进行真正的summary-level遗传整合。Bellenguez等的AD GWAS两阶段研究包含111,326个临床或proxy AD病例和677,663个对照,并公开了summary statistics。 这里最核心的问题不是“AD病例中hERV是否升高”,而是: 调控某个hERV表达的遗传变异,是否同时与AD风险相关? 如果某个cis SNP能够提高HERV-A表达,而同一等位基因在AD GWAS中也增加AD风险,那么就形成了SNP→HERV expression和SNP→AD risk两条联系。SMR可以利用HERV-eQTL作为exposure、AD GWAS作为outcome,检验遗传预测的HERV表达是否与AD风险相关。直观上,它利用的是同一个SNP在eQTL中的表达效应和在GWAS中的疾病效应,而不是直接拿病例脑中的真实hERV表达进行回归。因此SMR回答的是“遗传调控的表达成分是否与疾病风险相关”,与前面的病例-对照表达分析是完全不同而且相互独立的一层证据。 但一个SMR显著结果仍然不意味着已经证明HERV→AD因果关系。某一基因组区域可能存在两个高度LD的SNP,其中一个真正调控hERV,另一个真正影响AD,而由于二者几乎一起遗传,看起来就像同一个遗传信号。因此还需要HEIDI或更标准的colocalization分析检查HERV-eQTL和AD GWAS信号是否更可能由同一个causal variant驱动,而不是仅仅位于同一个LD block。可以把这个过程理解为: HERV-eQTL显著+AD GWAS显著只是发现同一区域可能有关; SMR显著说明遗传预测HERV表达与疾病风险具有统计关联; HEIDI/colocalization支持共享信号则进一步说明二者更可能来源于同一个遗传调控事件。 如果一个candidate同时满足AD脑中真实表达变化、特定cell state富集、long-read证明其真实转录本结构、LTR开放或TF证据,并且brain HERV-eQTL与AD GWAS又能够共定位,那么它会成为非常强的优先候选。 遗传部分还需要加入附近gene作为竞争解释,因为一个GWAS locus中可能同时存在HERV和gene。如果某个SNP同时调控HERV-A和Gene-B,而Gene-B又是经典AD风险gene,那么不能因为HERV-eQTL和GWAS共定位就立即认为HERV是主要介质。理想情况下需要同时考察三组关系:HERV-eQTL↔AD GWAS、gene-eQTL↔AD GWAS以及HERV-eQTL↔gene-eQTL。2024年的DLPFC rTWAS研究就是在gene和HERV共同进入TWAS之后,再通过conditional analysis和fine-mapping判断HERV信号是否独立于附近canonical gene。 如果未来找到可直接使用的cortex HERV expression weights,也可以在AD GWAS上进一步做类似rTWAS;如果只有普通HERV-eQTL summary,那么SMR+HEIDI+colocalization会更现实。 公开brain gene-eQTL则可以作为这一部分的重要辅助资源。2026年的SingleBrain整合4个脑队列、983位供体和约580万个细胞核,提供主要脑细胞类型的cis-eQTL summary statistics,而且研究本身已经将cell-type-specific eQTL与AD等脑疾病GWAS进行colocalization和MR。 因此,当candidate HERV位于某个gene内部或邻近gene时,可以检查该gene是否在相同cell type中具有AD共定位eQTL信号。 但这里不建议重新采用原先设想的: HERV表达≈β1×gene表达 加 gene表达≈β2×SNP 然后直接用β1×β2推断SNP→HERV。 原因是第一个β只是病例脑中的观察性相关,可以由共同TF、细胞状态、染色质开放或者gene readthrough造成,并不能证明gene表达是HERV表达的因果中介;而两个β还可能来自不同研究、不同表达尺度和不同组织,因此简单相乘无法正确传播不确定性。更合理的做法是将“自己的HERV-gene关系”“公开gene-eQTL”和“真正的HERV-eQTL”作为三条相互独立的证据进行triangulation,而不是人为合成一个不存在的HERV-eQTL效应。 如果最终仍找不到合适的brain HERV-eQTL,遗传部分也并不会阻断整个课题。PBMC HERV-eQTL可以作为辅助信息,例如检查candidate附近是否存在已知HERV-regulatory SNP,或者检验这类SNP在AD GWAS中的信号是否整体富集;也可以检查candidate附近是否落有AD GWAS credible-set variants、这些variants是否位于hERV/LTR开放区域或TF motif中。但这类结果应表述为“遗传风险与candidate调控区域存在重叠或支持”,不能等同于已经证明脑内SNP→HERV→AD。 四、预期结果与研究价值 整个研究最终希望形成一条逐渐收敛的证据链。首先从约100位供体的前额叶主数据中寻找cell type-specific和cell state-specific AD相关hERV;再通过小型独立前额叶数据判断结果是否可重复,通过颞叶数据判断其是否跨脑区共享;之后利用ONT和PacBio长读长明确这些candidate实际对应什么转录结构,并把结构参考投射回大规模short-read snRNA和bulk RNA数据;随后利用snATAC/Multiome、TF motif/activity和host-gene transcription解释其可能的上游调控;最后整合共表达、GO/GSEA以及公开遗传数据,形成高可信候选。 最终最有价值的结果不是“某个hERV在AD中的logFC是多少”,而是能够给出类似这样的完整描述: 某一具体hERV转录本在多个独立PFC队列的AD小胶质细胞中稳定升高,并主要富集于炎症相关MG亚群;ONT和PacBio均支持其为具有明确5′LTR–internal–3′LTR结构的hERV来源转录本;其5′LTR在AD MG中染色质开放增强,同时富集IRF/STAT结合motif并伴随相应TF活性增加;其相关gene module主要涉及抗病毒和先天免疫反应;相同表达变化还能够在temporal cortex独立队列中观察到;若进一步存在brain HERV-eQTL与AD GWAS共享遗传信号,则可以将其作为高可信AD相关hERV优先候选。 这样整个研究的故事就从本科阶段的“AD中哪些hERV发生变化、它们和哪些gene相关”,推进到: AD中哪些hERV真正、稳定地发生变化→变化发生在哪种细胞状态→这些reads究竟组成什么转录本→该转录本为什么改变→它可能影响什么功能→这种变化是否有遗传风险支持。