
一、技術概述在單個細胞的水平之上, 捕獲mRNA, 構建文庫, 并且進行高通量測序, 以此解析細胞基因表達譜, 這一技術被稱作單細胞轉錄組測序, 它突破了傳統bulk測序“細胞群體平均信號”的局限, 能夠區分細胞異質性, 鑒定稀有細胞, 解析細胞分群/分化軌跡, 挖掘標記基因, 在腫瘤、免疫、發育生物學、神經科學、疾病機理等領域有著廣泛應用。將組織或細胞懸液拆分為單個細胞, 此為核心原理中的單細胞分離利用 poly (dT) 探針結合 mRNA 的 polyA 尾, 同時引入細胞條形碼、分子標簽, 這是細胞裂解加 mRNA 捕獲之后進行反轉錄、cDNA 擴增、文庫構建、上機測序基于 UMI 去冗余, 定量單細胞基因表達, 后續做分群、功能解析, 這屬于生信分析。二、實驗的流程是這樣的, 其中濕實驗: 其一, 樣本的制備, 這可是最為關鍵的步驟, 它直接地決定了數據品質其二, 進行建庫以及測序。其三, 標準的生物信息學的分析流程, 也就是干實驗。分成基礎分析, 以及高級分析, 行業當中主流的軟件是, Cell 10× 官方加上 /。一第一步, 進行原始數據質控以及表達矩陣構建, 對于Cell測序數據要進行拆分, 而后將其比對到參考基因組。基于UMI統計信息, 從而生成基因 - 細胞表達矩陣, 其中行代表基因, 列代表細胞。還要開展初步過濾工作, 即去除空油滴以及低質量假細胞。二第二步細胞水平質控QC/過濾不合格細胞指標如下可進行檢測的基因數量, 若數值過低, 出現的情況是細胞破損以及mRNA流失要是數值過高, 則會有多細胞粘連的狀況常規的閾值范圍是200至6000個基因每細胞依據物種以及樣本進行微調。UMI的總數所代表的含義是總轉錄本數, 其與基因數呈現出一致的趨勢。線粒體基因的比例.mt, 比例高意味著細胞凋亡或者破損常規閾值是線粒體基因占比小于10%處于應激狀態的細胞可放寬至15%。需要去除的是雙細胞也就是兩個細胞被同一個油滴捕獲, 有 、 等工具得以剔除。三接著第三步: 先是數據標準化, 再進行降維聚類標準化, 這里面包括全局歸一化、對數轉換, 以此來消除測序深度差異然后是高可變基因篩選, 要挑選出表達變異大的基因, 也就是主導細胞異質性的那部分基因, 用于后續的分析之后是降維PCA, 也就是主成分分析, 進行線性降維, 把噪音去除再有UMAP / t-SNE, 進行非線性降維, 用來可視化細胞分群, 其中UMAP目前是首選, 它能保留全局結構最后是細胞聚類, 依據PCA距離對細胞進行分群, 從而得到0、1、2… 等不一樣的細胞亞群。四第四步: 亞群注釋, 這是核心環節。給聚類得到的未知細胞群定義細胞類型兩種方式結合選取標記基因作分析, 進行差異分析, 比如 t 檢驗等, 以此找出每個亞群里特異性高表達的基因。針對細胞類型注釋, 有手動注釋方式, 也就是結合文獻以及已知的經典基因來判斷, 像免疫細胞、上皮細胞、基質細胞、神經元等還有自動注釋方式, 是參考數據庫, 如 Human Cell Atlas、Mouse Cell Atlas 等來匹配注釋。五第五步常規可視化六第六步功能富集分析針對亞群 基因集做功能解析GO富集, 涉及生物過程BP、細胞組分CC、分子功能MF這幾方面KEGG通路包含信號通路、代謝通路GSEA是基因集富集以判斷通路整體處于激活還是抑制狀態疾病相關有DO等疾病數據庫注釋。七第七步為高級進階分析。根據研究選題選擇性開展細胞軌跡分析也就是擬時序分析, 它能干的是推斷細胞分化或者演化路徑, 主流工具里有PAGA, 它常常被用于發育、干細胞以及腫瘤演進方面。細胞通訊分析呢, 分析的是不同細胞亞群之間配體與受體的互作 , 目的是解析微環境細胞間的信號交流工具包括iTALK等。差異分析是分析組間, 像正常對比疾病、處理對比對照這樣的情況, 看整體或者特定亞群的差異基因。轉錄因子分析則是挖掘關鍵調控TF, 工具也有相應的。依據未剪接與剪接mRNA比例, 可變剪接、RNA速度可預測細胞未來分化方向, 多樣本、多批次數據整合批次校正以及單細胞與空間轉錄組的聯合分析還能被整合分析。四、關乎常見問題以及實驗時需留意的注意事項, 其一為實驗端所出現的問題, 其二是數據分析過程里常見的諸多坑, 五、存在應用場景的舉例情況, 于腫瘤研究方面, 要解析腫瘤微環境以及腫瘤干細胞, 還有浸潤免疫細胞的亞型以及耐藥細胞群, 在免疫研究領域, 需關注免疫細胞的分群, 以及活化或者耗竭狀態, 還有免疫應答機制, 對于發育生物學而言, 涉及胚胎發育以及器官發育, 還有細胞分化軌跡, 在疾病機制層面, 要進行篩選疾病特異性細胞亞群, 以及致病關鍵基因與通路的工作, 于藥物研發范疇, 是定位藥物作用的細胞, 并且解析藥物響應或者耐藥機制。六、有常用工具的匯總情況。