尧图精选

高通量基因编辑与CRISPR文库筛选:从sgRNA设计到功能基因组解析

🕒 发布时间:2026/10/2 9:50:53 📁 来源:尧图网络
高通量基因编辑是这几年功能基因组学领域绕不开的关键词。我最早接触这个概念时还在做单基因敲除一个gRNA设计完、转染、挑单克隆、验证敲除效率整套流程下来至少两周而且请假一天细胞就死给你看。后来参与了几轮全基因组CRISPR文库筛选才真正体会到“高通量”三个字的重量一个十万级的sgRNA文库从病毒包装到筛选结束再到测序对照两周左右就能拿到覆盖全部基因的候选名单按功能给两万多个基因重新排座次。这种从“手工作坊”到“工业流水线”的跨越改变的不仅是实验速度更是整个提问方式——以前我们问“这个基因敲了会怎样”现在问的是“全基因组里哪些基因决定了这个表型”。这篇文章我想把这类筛选的完整逻辑、设计要点和实操流程梳理一遍适合准备启动全基因组筛选的研究组也对想理解这类数据结果的生信同学有帮助。1. 高通量基因编辑是怎么把“基因敲除”变成“基因筛选”的1.1 从“验证一个基因”到“扫一遍全部基因”传统基因编辑的核心动作是“定点修改”设计一条sgRNA让Cas9在目标位点切开DNA双链通过NHEJ或HDR完成敲除或敲入然后做单克隆化最终验证表型。流程本身不复杂但瓶颈特别明显通量太低。一个基因做一套十来个基因就是至少半年的工作量而且很多基因根本没列入候选只能靠文献和直觉去猜。高通量基因编辑完全换了个思路。它不再追求“编辑结果可验证”而是把基因编辑本身变成一种“标记手段”——用sgRNA序列充当每个细胞的身份条形码。同一个细胞只被一个sgRNA整合这个基因就被破坏后续我们不去观察单个细胞的表型而是看整个细胞群体在特定条件下培养后哪些sgRNA的丰度发生了变化。某个sgRNA消失说明它靶向的基因是细胞在给定条件下活命所必需的某个sgRNA比例大涨说明敲除它反而给了细胞竞争优势比如药物环境下更耐药的细胞带的就是关键靶点。这种策略把问题从“找编辑效率”变成“找丰度差异”实验复杂度和可扩展性就拉开了量级。理论上对着一个细胞系你可以在一套实验里把两万多个蛋白编码基因全部敲一遍然后用测序计数回答“谁重要谁不重要”。1.2 正筛、负筛两种最常用的提问方式高通量筛选的实验逻辑基本分成两大类搞清楚它们的设计差异是入门的第一步。**负筛Negative Selection**针对的是“敲掉哪个基因细胞就活不下去”这类问题。把文库转导进细胞后持续传代那些被必需基因的sgRNA标记的细胞会因为失去关键功能而增殖减慢或直接死亡对应sgRNA的丰度在群体里逐渐下降传代十几天后提取基因组、测序sgRNA丰度显著减少的位点就是候选必需基因。这类筛选对时间要求比较高通常需要让细胞经历足够多代分裂否则差异拉不开。**正筛Positive Selection**的目标正好相反——找出“敲掉哪个基因让细胞获得了生存优势”。典型场景是药物筛选在培养基中加入抑制肿瘤生长的药物大多数带sgRNA的细胞会被杀伤或停止增殖但某些基因被敲除后会让细胞对药物不敏感这些细胞会存活并扩增对应sgRNA在终末样本中被显著富集。同样如果你用FACS分选一个目标细胞亚群比如被激活的关键信号通路那么这群细胞里富集的sgRNA就是该表型的抑制基因。实际项目里正筛和负筛经常搭配使用负筛给出细胞赖以生存的功能依赖正筛给出克服治疗压力的逃逸机制两者互为对照能拼出一张更完整的遗传互作地图。1.3 与RNAi筛选的本质区别很多多年前做过shRNA全基因组筛选的实验室会自然地问这和RNAi筛选有什么区别答案是本质性的。RNAi在mRNA层面做基因沉默但仍可能有残留的蛋白活性而且脱靶效应比较严重加上不稳定、通量不一致导致经典RNAi筛选的重复性和假阳性率都偏高。CRISPR是在基因组层面直接制造永久性的移码突变敲除更彻底同时sgRNA的特异性匹配机制相对清晰设计得当的话脱靶率就低很多。这种“彻底性”带来的另一个好处是能筛到RNAi筛不到的基因有些基因哪怕残留10%的蛋白就足以维持细胞生存RNAi筛不出来CRISPR直接就看到了。反过来说正因为CRISPR的敲除是永久性的必需基因被敲除后细胞直接死亡负筛中这部分信号非常干净这也让CRISPR文库筛选成为现在做功能依赖图谱的标配工具。2. sgRNA文库的设计逻辑每一条导向RNA都在做质量控制高通量筛选的成败一半在文库。如果sgRNA本身设计不合格后面的病毒、细胞、测序做得再精细结果也不会好看。这也是我在前面强调“文库设计是灵魂”的原因——它决定了筛选的灵敏度和最终候选列表的可信度。2.1 sgRNA设计五要素对Cas9系统一条合格的sgRNA至少满足五个条件我在设计每个自定义文库时都会逐条核对位置靶向基因CDS靠近5‘端的序列最好是ATG下游一段距离内。为什么靠前因为移码突变要落在蛋白功能结构域之前才能产生真正意义上的功能丧失。如果sgRNA落在基因末端或者靠近最后一个外显子可能剪切后仍产生一个极短但不影响核心功能的截短蛋白导致假阴性。PAM序列SpCas9识别的PAM是NGGsgRNA设计时必须在靶序列的3’端紧邻PAM否则Cas9无法结合。GC含量通常在40%到80%之间比较稳妥GC太低会导致sgRNA难与目标结合稳定太高则可能形成二级结构影响exon上的可及性。同聚核苷酸尽量避免连续4个T或更多。连续T在U6启动子转录时会被当作转录终止信号sgRNA根本不会被完整转录出来。种子区特异性靠近PAM的10-12个碱基是“种子区”对错配极度敏感设计时要在基因组范围内比对确保种子区没有同源位点降低脱靶。2.2 冗余设计与内置对照为什么一个好基因要配4到6把刀全基因组筛选最怕的噪音来源之一就是sgRNA活性不均一有的sgRNA切割效率很高有的则几乎不工作。单靠一条sgRNA代表一个基因等于把所有赌注押在一条序列上假阴性风险极高。所以主流文库都会为每个基因设计多条sgRNA。常见策略是每个靶基因配4到6条分别覆盖基因的不同区域。这样即使其中一两条不工作剩下的几条仍然能给出有效信号反过来如果6条里大部分都显著排序靠前这个候选基因的置信度就很有说服力。同时一份合格的文库还必须内置几类对照这往往是新手容易忽略的环节非靶向对照sgRNA序列经过实验验证不与任何基因外显子匹配用于估计随机漂移和背景噪声。已知必需基因sgRNA比如编码核糖体蛋白、蛋白酶体亚基的基因它们在任何细胞系里被敲除后细胞都会死亡是一把灵敏度标尺。已知非必需基因sgRNA用于确认筛选窗口没有过于严苛避免出现“全基因组都是必需基因”的荒谬结论。2.3 文库选型与覆盖度计算目前公开的全基因组人源文库有几套很常用GeCKO v2大约19万条sgRNA覆盖2万个基因每条基因配3-4条Brunello约7.7万条每个基因4条对照约1000条TKOv3每个基因5-6条覆盖约18000个基因。选哪套主要看实验目的和细胞规模。选完文库后要做的第一件事是算清楚“起始细胞量”。这里有个基本公式起始细胞数 sgRNA总数 × 目标覆盖度 × 感染系数。所谓目标覆盖度是指培养体系里每个sgRNA至少需要多少个独立整合事件的细胞来代表经验值通常取200到500感染系数的来源是慢病毒转导效率MOI0.3时大约只有26%的细胞被感染相当于每100个起始细胞只有26个真正带上了sgRNA。所以对于一个10万条sgRNA、每sgRNA保底500个细胞的筛选转导时至少需要约5×10^7个细胞的规模才能保证文库完整性。这个计算在实际操作中怎么执行我在下一节会详细展开这里先强调一点覆盖度不足的筛选做出来的结果基本没法解读因为离群sgRNA会被随机漂移淹没真实信号完全提不出来。3. 从质粒到细胞一条需要严格对齐的筛选流水线拿到文库质粒之后真正的“工程化”才刚刚开始。这一段流程环环相扣我按实际操作顺序来拆解并附上我自己实验时的关键参数。3.1 文库扩增第一道最容易翻车的工序文库质粒一般以极微量形式寄出直接拿去包病毒等于把文库全部赌在一次PCR和电转上所以必须先做扩增。但这一步恰好是很多新手翻车的地方文库扩增量太大、代数太多sgRNA多样性会肉眼可见地损失。我的标准做法是文库质粒先用乙醇沉淀浓缩电转化入感受态大肠杆菌效率最好在1×10^9 cfu/µg以上涂布在含氨苄青霉素的LB琼脂平板上。菌落总数要至少超过文库sgRNA数量的1000倍比如10万文库就要求长出约1亿个菌落。之后刮板、摇菌扩增再中提质粒。整个过程要控制在3到4个“电转-刮板”代数以内每多一代慢生长sgRNA的丢失风险就高一分。另外强烈建议用低拷贝复制子载体并定期取少量质粒做测序质检确认sgRNA分布的均匀度没有坍塌。3.2 慢病毒包装与细胞转导MOI和滴度是命门文库质粒最终要靠慢病毒转导进入细胞。包装环节常规做法是在293T细胞里做三质粒共转目的质粒sgRNA文库、psPAX2包装质粒和pMD2.G包膜质粒转染48小时和72小时各收一次上清过滤后直接使用或浓缩。关键控制点是滴度。文库感染的MOI建议控制在0.3到0.5之间而不是越高越好。MOI0.3时按泊松分布大约26%的细胞会被感染其中绝大多数只携带一个病毒整合这样后续表型可以干净地归因给单一sgRNA。如果MOI升高到1以上一个细胞同时整合两三条sgRNA它们靶向的基因扰动混在一起数据就不知所云了。在这道工序里我特别要做一步“空转对照”同一批病毒上清在处理文库前先拿一小份转导一个不含文库的平行细胞用嘌呤霉素筛选确认药物浓度能杀光未转导细胞。嘌呤霉素浓度需要提前在未感染细胞上做“致死曲线”一般取2μg/mL作用72小时能全部杀死为参考但不同细胞系差异很大必须自己标定。3.3 正筛和负筛的培养节奏转导完成、经过嘌呤霉素筛选后的细胞已经是“文库细胞群体”。这时要分出一小部分留作T0样本固定下来的“筛选前状态”是所有后续比较的基准绝对不能省。负筛的节奏比较固定细胞每2至3天传代一次全程保持覆盖度不低于每个sgRNA对应数百个细胞例如10万文库、每sgRNA 500个细胞总细胞数就应稳定在5×10^7量级。传代过程不用加药让细胞自然竞争14到21天或者6到10个群体倍增后收样。正筛则取决于压力条件药物处理可以连续低浓度也可以梯度递增FACS分选则按分选标准单点操作。我做过一轮筛选后发现负筛时间并非越长越好。时间太长随机突变和细胞适应会引入额外噪音时间太短必需基因的损耗还没拉开。最稳的做法是中途在7天、14天各留一个时间点样本测序后观察必需基因sgRNA的动态衰减曲线确认窗口处于对数期。3.4 测序文库构建与读长选择筛选收样后提取基因组DNA以sgRNA整合位点为界做两步PCR扩增。第一步PCR扩出sgRNA整合片段第二步PCR加上Illumina测序用的P5/P7接头和索引序列。这个环节要特别小心PCR循环数总共不超过25个循环否则文库丰度比例会被PCR重放效应拉偏。测序深度方面经验规则是每条sgRNA至少要有几百条reads。假如文库有10万条sgRNA、目标深度500×就需要测大约5000万条reads实际操作中我会把量往上再提50%防止低复杂度样本中重复率高导致有效数据缩水。读长方面单端75到100个碱基就足够读全sgRNA全长加部分恒定骨架标准做法用单端reads即可。4. 测序数据回来之后先做质检再问哪些基因显著很多新手拿到测序数据的一刻就急着跑MAGeCK这是不推荐的。数据分析第一步永远是“确认实验质量”质量不过关就去做差异丰度相当于在流沙上盖房。我给自己定了一条规矩不管拿到多忙的数据前三个分析动作不变——覆盖度检查、T0对照、富集分布。4.1 覆盖度检查先用T0样本给文库“验伤”测序下来的FASTQ文件先比对到sgRNA文库索引统计每个sgRNA的reads计数。第一步是看T0样本筛选起点理想情况下超过90%的sgRNA都有reads且reads分布集中在期望值附近。如果T0就出现大比例sgRNA计数为零问题多半出在前面——文库扩增多样性受损或细胞起始量不足。后面再怎么分析也无法弥补只能重新开始。如果某个特异性基因的四条sgRNA在T0阶段就少了三条那这个基因在后续结果里就算不显著也不能证明它“不重要”因为它根本没有被有效覆盖。4.2 归一化与随机漂移别让“总reads”骗了你文库测序后各样本reads总数通常不同所以必须先归一化再比较。常用的归一化方法有中位数归一化和TMM之类的算法主流分析工具MAGeCK也内置了自己的归一化逻辑。除了技术性归一化更重要的是理解随机漂移哪怕没有表型差异每个sgRNA的丰度也会因为细胞随机死亡、取样误差等因素发生波动。这种漂移在对照组sgRNA里看得最清楚。分析时必须先把非靶向对照sgRNA的丰度波动画出来建立零模型——如果对照sgRNA也出现大范围显著偏离那说明实验条件出了系统性偏差比如部分细胞群出现了生长优势这种情况下先别急着解释结果。4.3 MAGeCK与判断标准MAGeCK是目前用得最多的CRISPR筛选差异丰度分析工具之一核心思路是把每条sgRNA的信号聚合到基因水平用RRA排序算法或MLE负二项回归模型判断基因显著性。我个人习惯同时跑两个模式RRA模式输出FDR和排序适合常规负筛和识别必需基因MLE模式输出每个基因的效应大小(log2FC)和显著性更适合有多个条件、想量化效应强度的情况。筛选结果判断有一条经验法则六个sgRNA里至少有三到四条的丰度变化方向一致且基因级FDR小于0.05才值得进候选列表。只靠一条sgRNA的极强信号点出来的“显著”基因大概率是文库缺陷或off-target特别值得警惕。4.4 数据解释的暗礁拷贝数效应与off-target全基因组筛选中最常见的系统性假阳性源头是染色体拷贝数变化。癌细胞往往带有大量非整倍体或局部拷贝数扩增如果一个区域拷贝数很高标记该区域的sgRNA即便没有真实功能也会在负筛里表现出丰度偏高因为细胞丢失一份拷贝对整体基因剂量影响没那么大。很多分析流程里已经把copy number作为归一化协变量修正但如果你用的是非健康细胞系最好在解读候选列表前先校准一遍染色体臂上的富集信号。Off-target风险虽然比RNAi低但也真实存在。尤其当某个基因显示极强富集但生物学功能与实验体系完全八竿子打不着时我的处理办法是回溯那几条“显著的sgRNA”检查它们在基因组里还有没有其他与PAM相邻的种子区匹配位点必要时做一次Cas9-off-target验证。5. 从筛选到发现肿瘤靶点、耐药机制和合成致死的实战高通量基因编辑的优势是“量大”但真正的价值在于能回答传统方法难以回答的问题。这几年我参与的几个方向最能体现这个技术的方法论优势。5.1 肿瘤靶点发现从“功能依赖”到“可成药命门”在癌细胞系上做全基因组负筛可以直接回答一个临床问题没有了哪些基因这个癌细胞就活不下去。结果通常是找到大量细胞必需基因但真正有价值的候选是那些“癌细胞必需、正常细胞非必需”的基因——它们往往对应着癌细胞特有的代谢通路易损点和信号通路依赖。比较典型的例子是MYC高表达肿瘤对抗凋亡蛋白的依赖以及TP53缺失背景下某些DNA损伤修复基因的必需性。把多个癌细胞系的必需基因图谱放在一起比较还能按“功能依赖特征”对肿瘤分子分型这比单纯看突变位点信息量大得多。5.2 耐药机制筛选给治疗失败的必然性找答案肿瘤耐药筛选是正筛最经典的应用。做法不复杂文库转导后的癌细胞群体持续暴露在治疗药物下那些因基因敲除而天然耐药的细胞逐步富集后续对比T0和终末样本的sgRNA丰度就能锁定驱动耐药的基因通路。早年我们用小干扰RNA做过类似筛选经常筛到一堆ABC转运蛋白——它们确实是耐药原因但对治疗策略帮助有限。CRISPR筛选剔除了大量这种噪声后常会命中药物靶点本身所在的通路比如靶点蛋白的表达调控因子、逃避细胞凋亡的信号分支或者tap-1相关通路。这些结果对联合用药方案的指导价值远高于泛泛的转运蛋白。5.3 合成致死寻找“第二处致命伤”合成致死筛选的逻辑和负筛是亲戚——如果在某个特定遗传背景比如BRCA1突变)之外的普通细胞里敲除某个基因影响不大但在BRCA1缺失的细胞里敲除该基因就直接致死那么这个基因就不再是普通的必需基因而是这个背景下的合成致死靶标。实际操作通常需要两个平行筛选在BRCA1突变的细胞系和同源背景修复正常的对照细胞系里分别做全基因组负筛比较两组必需基因列表的差异交集之外的差异基因就是候选合成致死靶点。PARP抑制剂就是这类逻辑在真实疗法层面的胜利而高通量基因编辑把这个逻辑从“按文献猜”变成了“全基因组扫描”让更多差异致死靶点进入临床前研究。5.4 从单细胞转录组回到单基因因果高通量基因编辑的一个前沿方向是把文库筛选和单细胞测序结合典型代表是Perturb-seq。在这种情况下细胞带的是能调用单细胞转录组的sgRNA每个细胞的基因编辑信息和整个转录组图谱在同一个测序read里被同时读到。这样就不再局限于回答“这个基因影响细胞存活吗”而是能回答“这个基因被敲除后整条转录程序怎么变化”一次实验就能得到全基因组范围的基因调控网络结果。这套系统的成本和技术门槛比传统筛选高得多但产出信息的密度也是几何级上升。对于研究方向还比较不确定的课题组我更建议从常规文库筛选开始跑通全流程后再考虑加单细胞维度。6. 三次真实踩坑记录给准备开工的团队提个醒技术文章写得再顺实际动手时总会遇到文档里没有的幺蛾子。以下三个坑是我自己经历过的每个都赔进去数周时间写出来是想让后来者少走弯路。6.1 文库扩增质量失控多样性一夜崩塌第一次做全基因组筛选时文库扩增环节我贪多求快摇菌扩增的代数放松到了6代电转后菌落也长满了板没觉得有什么问题。之后小样测序一出来直接傻眼地球上接近四分之一的sgRNA计数是零整体分布严重偏斜。后来排查原因文库质粒带的是低拷贝复制起点多次扩增让那些影响宿主菌生长速度的序列被系统性淘汰多样性的损伤是不可逆的。教训就一句话扩增代数控制在3以内扩增后务必做小样NGS验证sgRNA分布至少确认90%以上sgRNA可检出再往下走。6.2 MOI失控造成的多整合噪音另一轮筛选实验里我为了“提高效率”把感染比例提到了MOI≈2结果一个细胞通常带两条以上的sgRNA负筛结果变得很模糊——很多候选基因的多条sgRNA信号互相矛盾整整一个月的数据没法解释。计算模型倒是能处理多整合但我手动把几条基因单独验证时发现它们单独敲除的表型和混合状态完全不同。最后只能重新调整病毒用量把感染比例降回0.3左右重做一遍筛选。业内其实有替代方案比如用双载体系统给每个细胞分配唯一sgRNA组合或在表达载体上引入标记区分单双整合但对常规筛选控制MOI才是最有效的防呆措施。6.3 “假必需基因”的诱捕拷贝效应带来的整段假阳性某次负筛结果里一块染色体臂上的上百个基因全部显示为“显著必需”这在生物学上几乎不可能。查了半天发现是癌细胞系里该染色体臂是高频扩增区我最初未做拷贝数校正导致这些区域天然高标记密度、高测序读数在归一化后直接把正常基因也顶进显著性区间。后来用CNV数据做矫正并改用MLE模型这批量假阳性才被削掉。这个坑在解释公开数据集的时候也必须留意很多没有做拷贝数校正的公开筛选结果区域性的假阳性已经混在原始结果里落到具体基因层面时一定要结合CNV分布来看。6.4 实验记录与批间一致性高通量最容易被低估的软成本最后这个坑不算技术问题但严重性不亚于前面几条。高通量筛选实验周期长、步骤多、交接频繁一旦某个环节的条件在批间发生漂移比如换了一批嘌呤霉素、换了培养基批次甚至细胞代数不同便会在数据里埋下系统性的批次效应。我现在执行的规范是每次转导、每轮筛选都固定记录起始细胞数、传代时间、培养基批次并把T0样本留双份重要的实验一定要在独立的两批细胞中重复然后才提交下游数据分析。实验记录上的一个表格约定比事后追查节省的时间多得多对高通量项目尤其如此。我自己在做过几轮项目后用一张带批间指标的电子表格管理所有时间点样本已经成了新团队的标准操作。最后再分享一个小经验也算是这几年做高通量基因编辑的总结跑通这套流程并不难第一次尝试任何一步都不必追求参数最优关键是保证每一步质量可量、可回溯。文库、病毒、细胞、测序和生信这五个环节任何一环出问题都会让整体结论失去参考意义。但一旦走通你会发现自己参与的科学问题半径被急剧拉大。从最初的一个位点到一个文库再到一整个功能基因组这套技术带给我的感受确实是从手工作坊直接跳进了工业时代的冲击。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →