顯示具有 BioTech生物科技 標籤的文章。 顯示所有文章
顯示具有 BioTech生物科技 標籤的文章。 顯示所有文章

2020年6月19日 星期五

Bioconductor與R的版本對應

每個特定版本的Bioconductor,設計會對應到特定版本的R。例如:
  • Bioconductor -3.11配R-4.0
  • Bioconductor -3.10, 3.9配R-3.6
  • Bioconductor -3.8, 3.7配R-3.5
  • Bioconductor -3.6, 3.5配R-3.4


這個對應並不是一對一,較常出現的是兩個bioconductor版本對應到某個版本的R。

2019年7月5日 星期五

靈敏度 ✕ 特異度 ✕ ROC曲線

在開發檢測方法的時候,通常都會有許多參數可以調整。例如說:
  • 提高靈敏度Sensitivity:故意把預測陽性的數目增多
  • 提高特異度Specificity:故意把預測陰性的數量增多

這時候需要一個方法來估算某檢測方法的好壞。其中一種方式就是畫出某種檢測方法的ROC curve(Receiver Operating Characteristic curve見維基百科上面的範例圖):
  • y軸 = Sensitivity = TPR:故y值越大越好
  • x軸 = 1 - Specificity = 1 - FPR:x值越小越好

2019年7月4日 星期四

混淆矩陣之 Accuracy, MCC, F1 score

前面兩篇文章談及預測準不準確的測量如下:
這兩種都是要用多個數字來看預測準不準,這邊要介紹的則是用一個數值來看。要注意的是,因為只有用一個數字,所以一些極端的狀況下反而會有誤導。這些數值包含了:
  • ACCAccuracy準確率。數值在0到1之間,越大越準
    • 一般的檢測最愛拿這個當作標準,但如果實際有與實際無的數量差很多,使用ACC無法判斷檢測是不是好的。
  • MCCMatthews correlation coefficient,數值會在-1到1之間
    • 數值靠近0:代表跟隨機亂猜差不多
    • 數值遠離0:正的代表預測的很準、負值代表是反指標
  • F1 score:又稱為F-score或F-measure

跟之前一樣,先把混淆矩陣confusion matrix寫出來:

2019年7月2日 星期二

混淆矩陣之 Precision vs. NPV

上一篇談及《Sensitivity vs. Specificity》,主要是以實際有無為的數量當作分母來判斷檢測好不好。這篇談及的則是檢測出陰陽當作分母來判斷好壞。下面則是所使用到的混淆矩陣(Confusion Matrix):

真實情況
有, +無, -



陽性 Positive, P(真陽性, TP)(偽陽性, FP)(P=TP+FP)
陰性 Negative, N(偽陰性, FN)(真陰性, TN)(N=FN+TN)

上述表格裡面使用(小括號)圈起來的代表是要填寫自然數,裡面縮寫分別代表:

2019年7月1日 星期一

混淆矩陣之 Sensitivity vs. Specificity

判斷一個預測的準確程度,會先把實際情形與預測結果的數量畫出一個矩陣,這個矩陣稱之為混淆矩陣(Confusion Matrix),畫出來就是下列的形式:

真實情況
有, +無, -



陽性 Positive, P(真陽性, TP)(偽陽性, FP)
陰性 Negative, N(偽陰性, FN)(真陰性, TN)
(y=TP+FN)(n=FP+TN)

上述表格裡面使用(小括號)圈起來的代表是要填寫自然數,裡面縮寫分別代表:

2019年2月19日 星期二

基因變異對於致病性的分類

對於基因變異對於某種疾病的致病性,可以根據AMCG (American College of Medical Genetics and Genomics)與AMP (Association for Molecular Pathology) 的建議分成五類:
  • Pathogenic:致病
  • Likely pathogenic:可能致病
  • Uncertain significance:不明確
  • Likely benign:可能良性
  • Benign:良性

2018年12月7日 星期五

Illumina® SBS次世代定序技術

Sequence by Synthesis (SBS) 是Illumina公司的次世代定序技術,官方介紹如下:


包含了四個主要的步驟:
  1. Sample preparation:樣品準備。
  2. Cluster generation:每個上述的片段都會在定溫下放大(isothermally amplified)
  3. Sequencing:使用標有螢光的核苷酸(nucleotide)來測定序列
  4. Data analysis:將讀出來的小片段組裝起來

下面詳細說明這四個步驟:

2018年12月6日 星期四

2018年9月4日 星期二

science circle

這個部落格主要寫與生命科學相關的議題,主要是:
臉書專頁叫做「不專業學術閒聊
_EOF_

2017年10月24日 星期二

用needle與water做序列比對

要比較兩條序列(pairwise sequence alignment),最常用的兩種方法:
  1. Needleman-Wunsch algorithm:做全域比對(global alignment)
  2. Smith-Waterman algorithm:做區域比對(local alignment)
要做也很簡單,只要安裝EMBOSS(The European Molecular Biology Open Software Suite),就會內建needlewater兩個程式。只要準備好兩條用fasta格式寫的序列a.fasta與b.fasta,使用下面的指令即可,結果會輸出到global.needlelocal.water這兩個檔案:
  1. needle -asequence a.fasta -bsequence b.fasta -auto -outfile global.needle
  2. water -asequence a.fasta -bsequence b.fasta -auto -outfile local.water
這邊-auto代表gap penalty相關的參數都用預設值。
若要直接輸出到標準輸出,那就將-outfile改成-stdout
  1. needle -asequence a.fasta -bsequence b.fasta -auto -stdout
  2. water -asequence a.fasta -bsequence b.fasta -auto -stdout
_EOF_

2016年12月2日 星期五

計算核酸的濃度

現有一管single strand RNA (ssRNA)溶液1 mL,裡面的ssRNA重量是10 μg (microgram),序列不知道但長度是41 nucleotides,計算此管ssRNA溶液的濃度:
  • 重量濃度:10 μg / 1 mL = 10 * 10-6 / 10-3 g/L = 10 * 10-3 g/L = 10 mg/L
要計算體積莫耳濃度(molarity, M),需要知道序列的分子量。如果序列已知又會寫Python程式可以參考這篇,不會寫程式的參考《DNA and RNA Molecular Weights and Conversions》,找到"Approximate M.W.'s of Nucleic Acids"這個段落:
  • M.W. of ssRNA = (# nucleotides * 320.5) + 159.0 = (41 * 320.5) + 159.0 = 13299.5 g/mol = 13299.5 Daltons
上面公式是計算ssRNA分子量,如果是single-strand DNA或是double-strand DNA用:
  • M.W. of ssDNA = (# nucleotides * 303.7) + 79.0
  • M.W. of dsDNA = (# nucleotides * 607.4) + 157.9
有了分子量,可以用GraphPad的Molarity Calculator來計算體積莫耳濃度,或用下列公式手動作換算:
  • 體積莫耳濃度:10 μg/mL = 10 mg/L = (10 mg/L) / (13299.5 g/mol)
    ≒ 0.0007519 mmol/L = 0.7519 μmol/L = 751.9 nmol/L = 751.9 nM  ≒ 0.75 μM
_EOF_