P4メトリック

P 4指標[1] [2] (FSまたは対称F [3]とも呼ばれる)は、2値分類器の性能評価を可能にする。P 4指標は、精度再現率特異度NPV (陰性予測値)から計算される。P 4指標の定義はF 1指標の定義と類似しているが、P 4指標の定義はF 1指標の定義に対する批判に対処している。したがって、P 4指標の定義はF 1指標の拡張として理解することができる

他の既知のメトリックと同様に、P 4メトリックは、TP (真陽性)、TN (真陰性)、FP (偽陽性)、FN (偽陰性)の関数です

正当化

P 4メトリックの重要な概念は、次の 4 つの重要な条件付き確率を活用することです。

  1. — 分類器の結果が陽性の場合に、サンプルが陽性である確率。
  2. — サンプルが陽性の場合、分類器の結果が陽性になる確率。
  3. — サンプルが陰性の場合、分類器の結果が陰性になる確率。
  4. — 分類器の結果が陰性だった場合、サンプルが陰性になる確率。

この指標の背後にある主な前提は、適切に設計されたバイナリ分類器の場合、上記のすべての確率が1に近づくということです。実際、上記のすべての確率が1に等しい場合、そしてその場合に限ります。もう一つの重要な特徴は、上記の確率のいずれかが0に近づくということです。

意味

P 4は、4 つの主要な条件付き確率の調和平均として定義されます

TP、TN、FP、FN に関しては、次のように計算できます。

バイナリ分類器の性能評価

二値分類器の性能評価は、多分野にわたる概念です。医療検査や精神医学検査の評価から、様々な分野の機械学習分類器の評価まで、その範囲は多岐にわたります。そのため、使用されている指標の多くは複数の名前で存在し、中には独立して定義されているものもあります。

予測される条件出典: [4] [5] [6] [7] [ 8 ] [9] [10] [11]
総人口
= P + N
陽性と予測される予測陰性情報量ブックメーカーの情報量(BM)
=TPR+TNR−1
有病率閾値(PT)
= √TPR × FPR − FPR/TPR − FPR
実際の状況
実正(P) [a]真陽性(TP)、
ヒット[b]
偽陰性(FN)、
見逃し、過小評価
真陽性率(TPR)、再現率感度(SEN)、検出確率、ヒット率、検出力
= TP/P = 1 − FNR
偽陰性率(FNR)、
見逃し率
タイプIIエラー [c]
= FN/P = 1 − TPR
実数負数(N)[d]偽陽性(FP)、
誤警報、過大評価
真陰性(TN)、
正しい拒絶反応[e]
偽陽性率(FPR)、
誤報確率、フォールアウト
タイプIエラー [f]
= FP/ = 1 − TNR
真陰性率(TNR)、
特異度(SPC)、選択性
= テネシー州/ = 1 − FPR
有病率
= P/P + N
陽性予測値(PPV)、 精度
= TP/TP + FP = 1 − FDR
誤脱落率(FOR)
= FN/TN + FN = 1 − NPV
陽性尤度比(LR+)
= TPR/FPR
陰性尤度比(LR−)
= FNR/TNR
精度(ACC)
= TP + TN/P + N
誤発見率(FDR)
= FP/TP + FP = 1 − PPV
陰性予測値(NPV)
= テネシー州/TN + FN = 1 − のために
マーク度(MK)、デルタP(Δp)
= PPV + NPV − 1
診断オッズ比(DOR)
= LR+/LR−
バランスのとれた精度(BA)
TPR + TNR/2
F 1スコア
= 2 PPV × TPR/PPV + TPR = 2TP/2 TP + FP + FN
フォークス・マロウズ指数(FM)
= √PPV ×TPR
ファイまたはマシューズ相関係数(MCC)
= √TPR × TNR × PPV × NPV - √FNR × FPR × FOR × FDR
脅威スコア(TS)、クリティカル成功指数(CSI)、ジャカード指数
= TP/TP + FN + FP
  1. ^ データ内の実際の陽性症例数
  2. ^ 状態または特性の存在を正しく示す検査結果
  3. ^ タイプIIエラー: 特定の条件または属性が欠如していると誤って示すテスト結果
  4. ^ データ内の実際の陰性症例数
  5. ^ 状態または特徴の欠如を正しく示す検査結果
  6. ^ 第1種の誤り: 特定の条件または属性が存在すると誤って示すテスト結果


Pの特性4メトリック

  • 対称性 — F 1指標とは対照的に、P 4は対称的です。つまり、データセットのラベルが変更されても値は変化せず、陽性は陰性と呼ばれ、陰性は陽性と呼ばれます。
  • 範囲:
  • これを達成するには、主要な 4 つの条件付き確率がすべて 1 に近づく必要があります。
  • 重要な 4 つの条件付き確率のうち1 つが 0 に近ければ十分です。

他の指標との比較例

選択したメトリックの依存関係テーブル (「true」は依存、「false」は依存しないことを意味します):

P4真実真実真実真実
F1真実真実間違い間違い
情報間違い真実真実間違い
顕著性真実間違い間違い真実

特定の確率に依存しないメトリックは、確率が 0 に近づくと誤って表現される傾向があります。

例1:希少疾患検出検査

希少疾患の検出に用いられる医療検査を考えてみましょう。人口が10万人で、感染率が0.05%であるとします。さらに、検査の精度が以下の通りであるとします。陽性者の95%が正しく分類され(TPR =0.95)、陰性者の95%が正しく分類されます(TNR =0.95)。このような場合、人口の不均衡が大きく、検査精度が高い(0.95)にもかかわらず、陽性と分類された個人が実際に陽性である確率は非常に低くなります。

この低い確率がいくつかの指標にどのように反映されているかがわかります。

  • 情報量/ユーデン指数)、
  • 顕著性)。

例2: 画像認識 - 猫と犬

ニューラルネットワークベースの画像分類器を、犬を含む画像(ラベル0)と猫を含む画像(ラベル1)の2種類の画像のみで学習させる問題を考えてみます。つまり、目標は猫と犬を区別することです。分類器が猫(「陽性」サンプル)を過大評価すると仮定します。つまり、猫は99.99%正しく分類されますが、犬はわずか1%しか正しく分類されません。さらに、画像データセットが10万枚の画像で構成されており、そのうち90%が猫の写真、10%が犬の写真だとします。この状況では、犬を含む画像が正しく分類される確率は非常に低くなります。

すべてのメトリックがこの低い確率に気付くわけではありません。

  • 情報量/ユーデン指数)、
  • 顕著性)。

参照

参考文献

  1. ^ Sitarz, Mikolaj (2023). 「F1指標の拡張、確率的アプローチ」.人工知能と機械学習の進歩. 03 (2): 1025– 1038. arXiv : 2210.11997 . doi :10.54364/AAIML.2023.1161.
  2. ^ 「P4 メトリック、バイナリ分類器を評価する新しい方法」。
  3. ^ Hand, David J.; Christen, Peter; Ziyad, Sumayya (2024). 「分類パフォーマンス指標の選択:問題への指標のマッチング」arXiv : 2409.12391 [cs.LG].
  4. ^ Fawcett, Tom (2006). 「ROC分析入門」(PDF) .パターン認識レターズ. 27 (8): 861– 874. doi :10.1016/j.patrec.2005.10.010. S2CID  2027090.
  5. ^ プロボスト、フォスター、トム・フォーセット(2013年8月1日)「ビジネスのためのデータサイエンス:データマイニングとデータ分析的思考について知っておくべきこと」オライリーメディア社
  6. ^ Powers, David MW (2011). 「評価:適合率、再現率、F値からROC、情報量、注目度、相関まで」. Journal of Machine Learning Technologies . 2 (1): 37– 63.
  7. ^ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (編).機械学習百科事典. Springer. doi :10.1007/978-0-387-30164-8. ISBN 978-0-387-30164-8
  8. ^ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (2015年1月26日). 「WWRP/WGNE予報検証研究共同ワーキンググループ」.オーストラリア気象気候研究協力機構. 世界気象機関. 2019年7月17日閲覧
  9. ^ Chicco D, Jurman G (2020年1月). 「二値分類評価におけるF1スコアと精度に対するマシューズ相関係数(MCC)の利点」BMC Genomics . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312 . PMID  31898477. 
  10. ^ Chicco D, Toetsch N, Jurman G (2021年2月). 「マシューズ相関係数(MCC)は、2クラス混同行列評価において、バランスのとれた正確性、ブックメーカーの情報量、およびマーク度よりも信頼性が高い」. BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID  33541410 . 
  11. ^ Tharwat A. (2018年8月). 「分類評価方法」.応用コンピューティング・インフォマティクス. 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
「https://en.wikipedia.org/w/index.php?title=P4-metric&oldid=1321575995」より取得