コンピュータービジョンと画像処理のデータセット一覧

これは機械学習研究のためのデータセットのリストです。これは機械学習研究のためのデータセットのリストの一部です。これらのデータセットは、主に物体検出顔認識マルチラベル分類などのタスクのための画像または動画で構成されています

物体検出と認識

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
MNISTグレースケールの手書き数字のデータベース。6万画像、ラベル分類1994[1]LeCunら
拡張MNISTグレースケールの手書き数字と文字のデータベース。81万画像、ラベル分類2010[2]NIST
NYU 物体認識ベンチマーク (NORB)さまざまな方向から見たおもちゃの立体写真のペア。中心化、摂動。97,200 枚の画像ペア(36 の角度、9 つの方位、6 つの照明条件下での均一な色のおもちゃ 50 個)画像物体認識2004[3] [4]LeCunら
8000万枚の小さな画像75,062 個の非抽象名詞でラベル付けされた 32×32 の画像 8,000 万枚。80,000,000画像、ラベル2008[5]Torralbaら
ストリートビューの番地(SVHN)Google ストリートビューで捉えた、境界ボックス付きの番地番号 630,420 桁630,420画像、ラベル、境界ボックス2011[6] [7]Netzerら
JFT-300MGoogle Research 内部のデータセット。18,291 のカテゴリに 3 億 7,500 万のラベルが付いた 3 億 300 万枚の画像3億300万画像、ラベル2017[8] [9] [10]Googleリサーチ
JFT-3BGoogle Research 内部。30 億枚の画像に、階層的に約 3 万のカテゴリが注釈付けされています。3,000,000,000画像、ラベル2021[11]Googleリサーチ
場所400 以上のシーン クラスに 1,000 万枚以上の画像があり、クラスごとに 5,000 ~ 30,000 枚の画像があります。10,000,000画像、ラベル2018[12]周ら
エゴ4D世界中の 74 か所と 9 か国で収集された、3,670 時間を超える日常生活の活動ビデオを含む、大規模な自己中心的なデータセットとベンチマーク スイートです。オブジェクトの境界ボックス、転写、ラベル付け。3,670時間のビデオビデオ、オーディオ、トランスクリプトマルチモーダル一人称タスク2022[13]K. Grauman 他
Wikipediaベースの画像テキストデータセット108 の Wikipedia 言語にわたる 1,150 万の固有画像を含む 3,750 万の画像テキスト例。11,500,000画像、キャプション事前トレーニング、画像キャプション2021[14]スリニヴァサン他、Google Research
ビジュアルゲノム画像とその説明10万8000画像、テキスト画像キャプション2016[15]R. クリシュナら
バークレー3Dオブジェクトデータセット75の異なるシーンで撮影された849枚の画像。約50の異なるオブジェクトクラスにラベルが付けられています。オブジェクトの境界ボックスとラベル付け。849ラベル付き画像、テキスト物体認識2014[16] [17]A. Janoch 他
バークレーセグメンテーションデータセットとベンチマーク500(BSDS500)500枚の自然画像(トレーニング、検証、テストの各サブセットに明示的に分割)とベンチマークコード。BSDS300に基づいています。各画像は平均して 5 つの異なる主題に分割されます。500セグメント化された画像輪郭検出と階層的画像セグメンテーション2011[18]カリフォルニア大学バークレー校
Microsoft 共通オブジェクト イン コンテキスト (MS COCO)自然な状況における一般的な物体の複雑な日常の光景。オブジェクトの強調表示、ラベル付け、および 91 種類のオブジェクトへの分類。250万ラベル付き画像、テキスト物体認識、画像セグメンテーション、キーポインティング、画像キャプション作成2015[19] [20] [21]T. Lin ら
イメージネットImageNet大規模視覚認識チャレンジで使用されるラベル付きオブジェクト画像データベースラベル付きオブジェクト、境界ボックス、説明語、SIFT特徴14,197,122画像、テキスト物体認識、シーン認識2009年(2014年)[22] [23] [24]J. Deng 他
SUN(シーン理解)非常に大規模なシーンおよびオブジェクト認識データベース。場所とオブジェクトにラベルが付けられます。オブジェクトはセグメント化されます。131,067画像、テキスト物体認識、シーン認識2014[25] [26]J. Xiao ら
LSUN(ラージサン)10 個のシーン カテゴリ (寝室など) と 20 個のオブジェクト カテゴリ (飛行機など)画像とラベル。約6000万画像、テキスト物体認識、シーン認識2015[27] [28] [29]Yuら
LVIS(大規模語彙インスタンスセグメンテーション)画像内の1000以上のエントリーレベルのオブジェクトカテゴリのセグメンテーションマスク220万のセグメンテーション、164Kの画像画像、セグメンテーションマスク。画像セグメンテーションマスキング2019[30]
画像を開く数千のクラスにまたがる画像レベルのラベルと境界ボックスを備えた、CC BY 2.0 ライセンスを持つとリストされている画像の大規模なセット。画像レベルのラベル、境界ボックス9,178,275画像、テキスト分類、物体認識2017

(V7:2022)

[31]
テレビニュースチャンネルのCM検出データセットテレビコマーシャルやニュース放送。静止画像から抽出されたオーディオとビデオの特徴。129,685文章クラスタリング、分類2015[32] [33]P. Guha 他
Statlog(画像セグメンテーション)データセットインスタンスは 7 つの屋外画像のデータベースからランダムに抽出され、手動でセグメント化されて、すべてのピクセルの分類が作成されました。多くの機能が計算されます。2310文章分類1990[34]マサチューセッツ大学
カリフォルニア工科大学101オブジェクトの写真。オブジェクトの詳細なアウトラインがマークされています。9146画像分類、物体認識2003[35] [36]F. Li ら
カリフォルニア工科大学-256オブジェクト分類用の画像の大規模なデータセット。画像は分類され、手作業で並べ替えられています。30,607画像、テキスト分類、物体検出2007[37] [38]G. グリフィン他
コヨ-700M画像とテキストのペアのデータセットCommonCrawl の HTML 文書内の代替テキストと画像ソースのペア 100 億件7億4,697万2,269画像、テキスト分類、画像言語2022[39]
SIFT10MデータセットCaltech-256 データセットのSIFT特徴。広範な SIFT 特徴抽出。11,164,866文章分類、物体検出2016[40]X. Fu ら
ラベルミーシーンの注釈付き写真。オブジェクトの輪郭が描かれています。187,240画像、テキスト分類、物体検出2005[41]MITコンピュータ科学・人工知能研究所
PASCAL VOCデータセット20 のカテゴリの画像とローカリゼーション境界ボックス。ラベル付け、境界ボックスを含む50万画像、テキスト分類、物体検出2010[42] [43]M. Everingham 他
CIFAR-10データセット10 種類のオブジェクトの、低解像度の小さな画像が多数あります。クラスにラベルが付けられ、トレーニング セットの分割が作成されました。6万画像分類2009[23] [44]A. Krizhevsky
CIFAR-100データセット上記の CIFAR-10 と同様ですが、オブジェクトのクラスが 100 個指定されています。クラスにラベルが付けられ、トレーニング セットの分割が作成されました。6万画像分類2009[23] [44]A. Krizhevsky 他
CINIC-10 データセットCIFAR-10とImagenetの統合された貢献で、10クラス、3つの分割が可能です。CIFAR-10よりも大きいです。ラベル付けされたクラス、トレーニング、検証、テスト セットの分割が作成されました。27万画像分類2018[45]ルーク・N・ダーロウ、エリオット・J・クロウリー、アントアス・アントニウ、エイモス・J・ストーキー
ファッション-MNISTMNISTのようなファッション製品データベースクラスにラベルが付けられ、トレーニング セットの分割が作成されました。6万画像分類2017[46]ザランドSE
非MNISTMNISTに類似したデータセットを作成するために、公開されているフォントからグリフを抽出しました。10クラスあり、A~Jの文字はそれぞれ異なるフォントから取得されています。クラスにラベルが付けられ、トレーニング セットの分割が作成されました。50万画像分類2011[47]ヤロスラフ・ブラトフ
リンネ5データセット5 つのクラスのオブジェクトの画像。クラスにラベルが付けられ、トレーニング セットの分割が作成されました。8000画像分類2017[48]チャラゼ&カラトジシビリ
11Kハンド性別認識および生体認証用の、18〜75歳のさまざまな年齢の190人の被験者の11,0​​76枚の手の像(1600 x 1200ピクセル)。なし11,076枚の手の画像画像と(.mat、.txt、.csv)ラベルファイル性別認識と生体認証2017[49]M・アフィフィ
CORe50継続的/生涯学習と物体認識のために特別に設計された、10 の異なるカテゴリに属する​​ 50 個の家庭用オブジェクトの 500 本を超えるビデオ (30 fps) のコレクションです。クラスにラベルが付けられ、3 方向の複数実行ベンチマークに基づいてトレーニング セットの分割が作成されます。164,866枚のRBG-D画像画像(.png または .pkl)

および(.pkl、.txt、.tsv)ラベルファイル

分類、物体認識2017[50]V. ロモナコとD. マルトーニ
OpenLORISオブジェクト複数の高解像度センサーを搭載した実ロボットによって収集された生涯/継続的ロボットビジョンデータセット(OpenLORIS-Object)には、121個のオブジェクトインスタンス(データセット第1版、20シーンにおける40カテゴリの日用品オブジェクト)が含まれています。このデータセットは、照明、オクルージョン、オブジェクトのピクセルサイズ、クラッターの4つの環境要因を異なるシーンにおいて厳密に考慮し、各要因の難易度を明示的に定義しています。ラベル付けされたクラス、ベンチマーク スクリプトによって作成されたトレーニング/検証/テスト セットの分割。1,106,424枚のRBG-D画像画像(.png および .pkl)

および (.pkl) ラベルファイル

分類、生涯にわたる物体認識、ロボットビジョン2019[51]Q. 彼女らは
THzおよび熱ビデオデータセットこのマルチスペクトル データ セットには、人の衣服の下に隠された物体のテラヘルツ、熱、可視、近赤外線、および 3D ビデオが含まれています。画像と3D点群動画は20本以上。各動画の長さは約85秒(約345フレーム)です。AP2J隠された物体の検出に関する実験2019[52] [53]アレクセイ・A・モロゾフとオルガ・S・スシュコワ

3Dオブジェクト

2015年時点の3Dオブジェクトの33データセットのレビューについては、(Calli et al, 2015) [54]を参照してください。2022年時点のより多くのデータセットのレビューについては、(Downs et al., 2022) [55]を参照してください。

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
プリンストンシェイプベンチマークインターネットから収集した3Dポリゴンモデル92のカテゴリーに1814のモデル3Dポリゴンモデル、カテゴリ形状ベースの検索と分析2004[56] [57]Shilaneら
バークレー 3D オブジェクト データセット (B3DO)クラウドソーシングされたMicrosoft Kinectユーザーから収集された深度画像とカラー画像。50のオブジェクトカテゴリに分類されています。75シーン、849枚の画像カラー画像、深度画像、オブジェクトクラス、境界ボックス、3D中心点境界ボックスを予測する2011年、2014年更新[58]Janochら
シェイプネット3Dモデル。一部はImageNetと同様にWordNet Synsetsに分類されます。また、3,135のカテゴリに部分的に分類されています。3,000,000 個のモデルがあり、そのうち 220,000 個が分類されています。3Dモデル、クラスラベルクラスラベルを予測します。2015[59]チャンら
オブジェクトネット3D画像、3D 形状、オブジェクトの 100 のカテゴリ。90127枚の画像、201888個のオブジェクト、44147個の3D形状画像、3Dシェイプ、オブジェクトの境界ボックス、カテゴリラベル2D画像から物体の3Dポーズと3D形状を認識する2016[60] [61]Xiangら
3D の一般的なオブジェクト (CO3D)Amazon Mechanical Turk のユーザーが撮影した、50 の MS-COCO カテゴリのオブジェクトをキャプチャしたビデオのビデオ フレーム。40,000本のビデオから600万フレームマルチビュー画像、カメラポーズ、3Dポイントクラウド、オブジェクトカテゴリオブジェクトカテゴリを予測します。オブジェクトを生成します。2021年、2022年にCO3Dv2として更新[62] [63]メタAI
GoogleスキャンオブジェクトSDF形式でスキャンされたオブジェクト1000万以上2022[55]Google AI
オブジェクトバースXL3Dオブジェクト1000万以上3Dオブジェクト、メタデータ新しいビュー合成、3Dオブジェクト生成2023[64]Deitkeら
オムニオブジェクト3Dスキャンされたオブジェクトは、190 の毎日のカテゴリにラベル付けされます6,000テクスチャメッシュ、ポイントクラウド、マルチビュー画像、ビデオ堅牢な3D認識、新規ビュー合成、表面再構成、3Dオブジェクト生成2023[65] [66]Wuら
3Dの珍しいオブジェクト(uCO3D)LVISの1,070のカテゴリー2025[67] [68]メタAI

自動運転車のための物体検出と認識

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
都市景観データセット街頭シーンを撮影したステレオビデオシーケンス。ピクセルレベルの注釈付き。メタデータも含まれています。ピクセルレベルのセグメンテーションとラベリング2万5000画像、テキスト分類、物体検出2016[69]ダイムラーAG
ドイツの交通標識検出ベンチマークデータセットドイツの道路標識を車から撮影した画像。これらの標識は国連基準に準拠しているため、他の国の標識と同様です。手動でラベルを貼った標識900画像分類2013[70] [71]S. Houben 他
KITTI Visionベンチマークデータセット中規模都市を走行する自律走行車は、カメラとレーザースキャナーを使用してさまざまなエリアの画像を撮影しました。データから抽出された多数のベンチマーク。100 GB以上のデータ画像、テキスト分類、物体検出2012[72] [73] [74]A. ガイガーら
フィールドセーフステレオカメラ、サーマルカメラ、ウェブカメラ、360 度カメラ、LIDAR、レーダー、正確な位置特定など、農業における障害物検出用のマルチモーダル データセット。地理的にラベル付けされたクラス。400 GB以上のデータ画像と3D点群分類、物体検出、物体位置特定2017[75]M. Kragh ら
ダイムラー単眼歩行者検知データセット都市環境における歩行者のデータセットです。歩行者はボックスごとにラベル付けされます。ラベル付き部分には、歩行者を含むサンプルが15,560個、歩行者を含まないサンプルが6,744個含まれています。テストセットには、ラベルなしの画像が21,790枚含まれています。画像物体認識と分類2006[76] [77] [78]ダイムラーAG
カムビッドCambridge-driving Labeled Video Database (CamVid) は、ビデオのコレクションです。データセットには、32 個のセマンティック クラスに対するセマンティック ラベルが付けられています。700枚以上の画像画像物体認識と分類2008[79] [80] [81]ガブリエル・J・ブロストウ、ジェイミー・ショットン、ジュリアン・フォーキュール、ロベルト・シポッラ
レールセメスター19RailSem19 は、鉄道のビジョンシステムのシーンを理解するためのデータセットです。データセットは意味的かつボックスごとにラベル付けされています。8500画像物体認識と分類、シーン認識2019[82] [83]オリバー・ゼンデル、マルクス・ムルシッツ、マルセル・ザイリンガー、ダニエル・シュタイニンガー、サラ・アッバシ、チャバ・ベレズナイ
ボレアスBOREASは、複数季節にわたる自動運転データセットです。Velodyne Alpha-Prime(128ビーム)LIDAR、FLIR Blackfly Sカメラ、Navtech CIR304-Hレーダー、Applanix POS LV GNSS-INSのデータが含まれています。データには 3D 境界ボックスによる注釈が付けられます。350kmの走行データ画像、ライダー、レーダーデータ物体認識と分類、シーン認識2023[84] [85]キーナン・バーネット、デイビッド・J・ユン、ユーチェン・ウー、アンドリュー・ゾウ・リー、ハオウェイ・チャン、シーチェン・ルー、ジンシン・チェン、ウェイカン・ツェン、アンドリュー・ランバート、キース・Y・K・レオン、アンジェラ・P・ショーリグ、ティモシー・D・バーフット
Bosch 小型信号機データセット信号機のデータセットです。ラベルには、信号機の境界ボックスとその状態 (アクティブな信号) が含まれます。トレーニング用の5000枚の画像と評価用の8334フレームのビデオシーケンス画像信号機認識2017[86] [87]カルステン・ベーレント、リボール・ノバク、ラミ・ボトロス
FRサインフランスの鉄道信号のデータセットです。ラベルには、鉄道信号の境界ボックスとその状態 (アクティブなライト) が含まれます。100000以上画像鉄道信号認識2020[88] [89]ジャニーン・ハーブ、ニコラ・レベナ、ラファエル・ショシドー、グレゴワール・ロブラン、ロマン・ポタルソフ、ハテム・ハジリ
ジェラルドドイツの鉄道信号のデータセットです。ラベルには、鉄道信号の境界ボックスとその状態 (アクティブなライト) が含まれます。5000画像鉄道信号認識2023[90] [91]フィリップ・ライブナー、ファビアン・ハンペル、クリスチャン・シンドラー
マルチキュー歩行者マルチキューオンボード歩行者検出データセットは、歩行者を検出するためのデータセットです。データベースはボックスごとにラベル付けされています。歩行者用ボックス1776個を含む1092の画像ペア画像物体認識と分類2009[92]クリスチャン・ヴォジェク、ステファン・ウォーク、ベルント・シーレ
生のRAWPED は、鉄道における歩行者を検出するためのデータセットです。データセットはボックスごとにラベル付けされています。26000画像物体認識と分類2020[93] [94]トゥグチェ・トプラク、ブラク・ベレンリオグル、ブラク・アイドゥン、キュニート・グゼリス、M. アルパー・セルバー
OSDaR23OSDaR23 は、鉄道のコンテキストにおけるオブジェクトの検出用の多センサー データセットです。データベースはボックスごとにラベル付けされています。16874フレーム画像、ライダー、レーダー、赤外線物体認識と分類2023[95] [96]ローマン・ティリー、ルスタム・タギエフ、パベル・クラセク(DZSF);フィリップ・ノイマイヤー、パトリック・デンツラー、トビアス・クロッカウ、マルティン・ボークホフ、マルティン・ケッペル (Digitale Schiene Deutschland)。 Karsten Schwalbe (FusionSystems)
アグロバースArgoverse は、道路上の物体を検出するための多センサー データセットです。データセットはボックスごとに注釈が付けられます。320時間の録音7台のカメラとLiDARからのデータ物体認識と分類、物体追跡2022[97] [98]Argo AI、カーネギーメロン大学ジョージア工科大学
レール3DRail3Dは、ハンガリー、フランス、ベルギーで記録された鉄道のLiDARデータセットです。データセットは意味的に注釈付けされている2億8800万点の注釈付きポイントライダー物体認識と分類、物体追跡2024[99]アブデラザク・カルービ、バルーシュ・ズハイル、ラフィカ・ハッジ、アナス・ヤルード、ローランド・ビレン。リエージュ大学およびハッサン 2 世農学獣医学研究所
WHU-鉄道3DWHU-Railway3Dは、中国の都市部、農村部、高原の鉄道を記録したLiDARデータセットです。データセットは意味的に注釈付けされている46億の注釈付きデータポイントライダー物体認識と分類、物体追跡2024[100]Bo Qiu、Yuzhou Zhou、Lei Dai。 Bing Wang、Jianping Li、Zhen Dong、Chenglu Wen、Zhiliang Ma、Bisheng Yang。武漢大学オックスフォード大学香港理工大学南洋理工大学厦門大学清華大学
レールFOD23鉄道架線上の異物データセットデータセットはボックス単位で注釈が付けられている14,615枚の画像画像物体認識と分類、物体追跡2024[101]Zhichao Chen、Jie Yang、Zhicheng Feng、Hao Zhu;江西科学技術大学
エスローラッドル・アーヴルルーアンの都市道路と鉄道のシーンの画像と点群のデータセットデータセットはボックス単位で注釈が付けられている2,700,000枚の仮想画像と100,000枚の実画像画像、LiDAR物体認識と分類、物体追跡2022[102]レドゥアン・ケマール、アントワーヌ・モーリ、カミーユ・デュロンポン、ジャヤディープ・ガジュラ、ヴァンサン・ヴォーシェ、マジッド・ハダッド、レミ・ブートー。ル・アーブル・ノルマンディー大学とSEGULA Technologies
レールVIDカーポート、車庫、直線を含む さまざまな鉄道シナリオで InfiRay の AT615X 赤外線サーモグラフィーによって記録されたデータ。データセットは意味的に注釈付けされている1,071枚の画像赤外線画像物体認識と分類、物体追跡2022[103]ハオ・ユアン、ジェンクン・メイ、イーハオ・チェン、ウェイロン・ニウ、チェン・ウー。蘇州大学
レールPC鉄道分野におけるLiDARデータセットデータセットは意味的に注釈付けされている30億のデータポイントライダー物体認識と分類、物体追跡2024[104]Tengping Jiang、Shiwei Li、Qinyu Zhang、Guangshuai Wang、Zequn Zhang、Fankun Zeng、Peng An、Xin Jin、Shan Liu、Yongjun Wang ;南京師範大学天然資源部東部理工大学、天津鉄道交通ナビゲーション測位及び時空間ビッグデータ技術重点実験室、西北師範大学セントルイス・ワシントン大学、寧波理工大学
レールクラウド-HdF鉄道分野におけるLiDARデータセットデータセットは意味的に注釈付けされている80億6030万のデータポイントライダー物体認識と分類、物体追跡2024[105]マフディ・アビッド、マティス・テイシェイラ、アンクル・マフタニ、トーマス・ローラン。ライレニウム
レールゴエル24鉄道分野におけるRGBとLiDARデータセットデータセットはボックス単位で注釈が付けられている12205 HD RGBフレームと383922305 LiDARカラークラウドポイントRGB、ライダー人物認識と分類2025[106]ルスタム・タギエフ、イルカイ・ワンダーリッヒ、フィリップ・ザニッツァー、マーク、サストゥバ、カールステン・ノール、キリアン・ゲラー、ハーディア・アムヤド、シュテフェン・ザイツ
MRSI鉄道におけるRGBと赤外線データセットデータセットはボックス単位とピクセル単位で注釈が付けられており、背景を含む11のクラスがある。23000枚のRGB画像と4000枚の赤外線画像RGB、赤外線物体認識と分類2022[107]Yihao Chen、Ning Zhu、Qian Wu、Cheng Wu、Weilong Niu、Yiming Wang
RailDriVE 2019年2月号鉄道車両測位実験用データセットデータセットには注釈が付けられていない1.2 kmのトラック区間で26分46秒の往復走行GNSS、IMU、速度/距離センサー(レーダー、光学式、オドメーター)、RGBローカリゼーションとマッピング2019[108]ハンノ・ウィンター、マイケル・ヘルムート・ロス

顔認識

コンピュータビジョンにおいて、顔画像は顔認識システム顔検出、その他顔画像を用いる多くのプロジェクトの開発に広く利用されてきました。 2005年以前の期間に焦点を当てたデータセットの精選リストについては、 [109]を参照してください。

データセット名簡単な説明前処理インスタンス形式デフォルトのタスク作成(更新)参照クリエイター
野生のラベル付き顔(LFW)インターネット検索によって得られた、名前の付いた人物の画像。正面顔検出、境界ボックス切り取り5749人の個人名が記された13233枚の画像画像、ラベル制約のない顔認識2008[110] [111]黄ら
アフワイルド200人の298本のビデオ、約1,250,000枚の手動で注釈が付けられた画像:次元的感情(価数-覚醒)の観点から注釈付け、野生環境の設定、色データベース、さまざまな解像度(平均 = 640x360)検出された顔、顔の特徴、感情価覚醒の注釈約1,250,000枚の手動で注釈が付けられた画像ビデオ(視覚 + 音声モダリティ感情認識(感情価-覚醒度推定)2017CVPR [112]

IJCV [113]

D. コリアス 他
アフィワイルド2458人の558本のビデオ、約2,800,000枚の手動で注釈が付けられた画像:i)カテゴリ感情(7つの基本表現:中立、幸福、悲しみ、驚き、恐怖、嫌悪、怒り)、ii)次元感情(価数-覚醒)、iii)行動単位(AU 1、2、4、6、12、15、20、25)、野外設定、色データベース、さまざまな解像度(平均 = 1030x630)の観点から注釈が付けられています。検出された顔、検出されて位置合わせされた顔、注釈約2,800,000枚の手動で注釈が付けられた画像ビデオ(視覚 + 音声)感情認識(感情価覚醒推定、基本表現分類、行動単位検出)2019BMVC [114]

FG [115]

D. コリアス 他
FERET(顔認識技術)1199 人の人物をさまざまな位置と時間に撮影した 11,338 枚の画像。なし。11,338画像分類、顔認識2003[116] [117]米国国防総省
ライアソン感情音声・歌唱音声ビジュアルデータベース(RAVDESS)プロの俳優 24 名による 7,356 本のビデオとオーディオの録音。それぞれ 2 段階の強さで 8 つの感情を表現しました。表情ラベルが付けられたファイル。319人の評価者による知覚検証評価。7,356ビデオ、サウンドファイル分類、顔認識、音声認識2018[118] [119]SRリビングストンとFAルッソ
SCFaceさまざまな角度の顔のカラー画像。抽出された顔の特徴の位置。特徴の座標が示されています。4,160画像、テキスト分類、顔認識2011[120] [121]M. Grgic 他
イェール大学顔データベース11 種類の表情を持つ 15 人の顔。式のラベル。165画像顔認識1997[122] [123]J. Yang ら
Cohn-Kanade AUコード化発現データベース表情のラベルが付いた画像の大規模なデータベース。特定の顔の特徴の追跡。500以上のシーケンス画像、テキスト表情分析2000[124] [125]T. Kanade 他
JAFFE表情データベース日本人女性モデル10名による7つの表情(基本表情6種+ニュートラル表情1種)の画像213枚。画像は顔の領域に合わせて切り取られています。感情ラベルの意味評価データが含まれています。213画像、テキスト表情認識1998[126] [127]ライオンズ、カマチ、ギョバ
フェイススクラブ画像検索から削除された著名人の画像。名前と m/f 注釈。107,818画像、テキスト顔認識2014[128] [129]H. Ng ら
BioID顔データベース目の位置がマークされた顔の画像。目の位置を手動で設定します。1521画像、テキスト顔認識2001[130]バイオID
肌セグメンテーションデータセット顔画像からランダムにサンプリングされたカラー値。B、G、Rの値を抽出しました。245,057文章セグメンテーション、分類2012[131] [132]R.バット。
ボスポラス海峡3D顔画像データベース。34 個のアクション ユニットと 6 つの表現がラベル付けされ、24 個の顔のランドマークがラベル付けされました。4652

画像、テキスト

顔認識、分類2008[133] [134]A Savran ら
UOY 3Dフェイス無表情な顔、5 つの表情: 怒り、喜び、悲しみ、目を閉じた、眉を上げた。ラベリング。5250

画像、テキスト

顔認識、分類2004[135] [136]ヨーク大学
CASIA 3D顔データベース表情: 怒り、笑顔、笑い、驚き、目を閉じる。なし。4624

画像、テキスト

顔認識、分類2007[137] [138]中国科学院オートメーション研究所
カシア・ニル表情:怒り、嫌悪、恐怖、幸福、悲しみ、驚きなし。480注釈付き可視スペクトルと近赤外線ビデオを毎秒25フレームでキャプチャします顔認識、分類2011[139]趙 G. 他
BU-3DFE無表情な顔と、怒り、喜び、悲しみ、驚き、嫌悪、恐怖(4 レベル)の 6 つの表情。抽出された 3D 画像。なし。2500画像、テキスト表情認識、分類2006[140]ビンガムトン大学
顔認識グランドチャレンジデータセット被験者ごとに最大22個のサンプル。表情:怒り、喜び、悲しみ、驚き、嫌悪、ふくれっ面。3Dデータ。なし。4007画像、テキスト顔認識、分類2004[141] [142]国立標準技術研究所
ガヴァブドブ被験者ごとに最大61個のサンプル。表情:無表情、笑顔、正面からの強調笑い、正面からのランダムなジェスチャー。3D画像。なし。549画像、テキスト顔認識、分類2008[143] [144]キング・フアン・カルロス大学
3D-RMA被写体は最大100名。表情はほぼ無表情。ポーズもいくつかあります。なし。9971画像、テキスト顔認識、分類2004[145] [146]王立陸軍士官学校(ベルギー)
ソフ112 人 (男性 66 人、女性 46 人) が異なる照明条件下で眼鏡をかけます。難易度の異なる合成フィルター (ぼかし、オクルージョン、ノイズ、ポスタリゼーション) のセット。42,592(原画像2,662枚×合成画像16枚)画像、MATファイル性別分類、顔検出、顔認識、年齢推定、メガネ検出2017[147] [148]Afifi、M. 他
IMDb-WIKI性別と年齢のラベルが付いた IMDb と Wikipedia の顔画像。なし523,051画像性別分類、顔検出、顔認識、年齢推定2015[149]R. ローテ、R. ティモフテ、LV グール

行動認識

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
AVA-Kinetics 人間の行動を局所的に分析するビデオKinetics-700 のビデオのキーフレームから 80 個のアクション クラスに注釈を付けました。160 万件の注釈。238,906 件のビデオ クリップ、624,430 個のキーフレーム。注釈、ビデオ。行動予測2020[150] [151]Google AIの Perception チームの Li ら
テレビヒューマンインタラクションデータセット20 種類のテレビ番組のビデオから、握手、ハイタッチ、ハグ、キス、なしなどの社会的行動を予測します。なし。6,766本のビデオクリップビデオクリップ行動予測2013[152]Patron-Perez、A. 他
バークレーマルチモーダルヒューマンアクションデータベース(MHAD)1人の人物が12の動作を行っている様子を録画モーションキャプチャの前処理660個のアクションサンプルPhaseSpaceモーションキャプチャ8台、ステレオカメラ2台、クアッドカメラ4台、加速度計6台、マイク4台アクション分類2013[153]Ofli、F. 他
THUMOSデータセットアクション分類用の大規模なビデオ データセット。アクションは分類され、ラベル付けされます。45Mフレームのビデオビデオ、画像、テキスト分類、行動検出2013[154] [155]Y. Jiang 他
メックスアクション2行動の位置特定とスポッティングのためのビデオデータセットアクションは分類され、ラベル付けされます。1000ビデオアクション検出2014[156]ストイアンら

手書きと文字認識

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
人工文字データセット英語の大文字 10 文字の構造を記述する人工的に生成されたデータ。描画された線の座標は整数で与えられます。その他、様々な機能があります。6000文章手書き認識、分類1992[157]H. Guvenir 他
文字データセット大文字の印刷文字。すべての画像から 17 個の特徴が抽出されます。2万文章OCR、分類1991[158] [159]D. スレート他
CASIA-HWDBオフラインの手書き中国語文字データベース。GB 2312文字セットの 3755 クラス。背景ピクセルが 255 とラベル付けされたグレースケール画像。1,172,907画像、テキスト手書き認識、分類2009[160]カシア
CASIA-OLHWDBアノトペンで紙に書き写して収集したオンライン手書き漢字データベース。GB 2312文字セットの 3755 クラス。ストロークの座標のシーケンスを提供します。1,174,364画像、テキスト手書き認識、分類2009[161] [160]カシア
キャラクター軌跡データセット人が簡単な文字を書くときのペン先の軌跡のラベル付きサンプル。各サンプルの3次元ペン先速度軌跡行列2858文章手書き認識、分類2008[162] [163]B.ウィリアムズ
Chars74Kデータセット英語とカンナダ語の両方で使用される記号の自然画像における文字認識74,107文字認識、手書き認識、OCR、分類2009[164]T. デ・カンポス
EMNISTデータセット3600人の寄稿者による手書き文字NIST Special Database 19から派生。MNISTデータセットに合わせて28x28ピクセルの画像に変換。[165]80万画像文字認識、分類、手書き認識2016EMNISTデータセット[166]

ドキュメンテーション[167]

グレゴリー・コーエン他
UJIペン文字データセット分離された手書き文字文字が書き込まれたときのペンの位置の座標が与えられます。11,640文章手書き認識、分類2009[168] [169]F. Prat ら
ジゼットデータセットよく混同される 4 文字と 9 文字の手書きサンプル。画像から抽出された特徴はトレーニング/テストに分割され、手書き画像のサイズは正規化されます。13,500画像、テキスト手書き認識、分類2003[170]Yann LeCun 他
オムニグロットデータセット50 種類のアルファベットから 1623 種類の手書き文字。手書きラベル。38,300画像、テキスト、ストローク分類、ワンショット学習2015[171] [172]アメリカ科学振興協会
MNISTデータベース手書き数字のデータベース。手書きラベル。6万画像、テキスト分類1994[173] [174]国立標準技術研究所
手書き数字の光学認識データセット手書きデータの正規化されたビットマップ。サイズが正規化され、ビットマップにマッピングされます。5620画像、テキスト手書き認識、分類1998[175]E. Alpaydin 他
ペンベース手書き数字認識データセット電子ペンタブレットに手書きした数字。均一間隔になるように抽出された特徴ベクトル。10,992画像、テキスト手書き認識、分類1998[176] [177]E. Alpaydin 他
Semeion手書き数字データセット80人からの手書きの数字。すべての手書きの数字はサイズが正規化され、同じグリッドにマッピングされています。1593画像、テキスト手書き認識、分類2008[178]T.Srl
HASYv2手書きの数学記号すべてのシンボルは中央に配置され、サイズは 32 ピクセル x 32 ピクセルです。168233画像、テキスト分類2017[179]マーティン・トーマ
ノイズの多い手書きベンガル語データセット手書き数字データセット (10 クラス) と基本文字データセット (50 クラス) が含まれており、各データセットには、ホワイト ガウス、モーション ブラー、コントラスト低減の 3 種類のノイズがあります。すべての画像は中央に配置され、サイズは 32x32 です。数値データセット:

23330,

文字データセット:

76000

画像、

文章

手書き認識、

分類

2017[180] [181]M. Karki 他

航空写真

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
iSAID: 航空画像データセットにおけるインスタンスセグメンテーション正確なインスタンス レベルの注釈はプロの注釈者によって実行され、明確に定義されたガイドラインに準拠する専門の注釈者によって相互チェックおよび検証されます。655,451 (15クラス)画像、jpg、json航空分類、物体検出、インスタンスセグメンテーション2019[182] [183]サイード・ワカス・ザミール

アディティア・アローラ

アクシタ・グプタ

サルマン・カーン

スン・グオレイ

ファハド・シャバズ・カーン、ファン・チュー、

リン・シャオ、グイソン・シア、シャン・バイ

航空画像セグメンテーションデータセット空間解像度が 0.3 ~ 1.0 の高解像度航空写真 80 枚。画像は手動でセグメント化されています。80画像航空分類、物体検出2013[184] [185]J. Yuan 他
KIT AISデータセット群衆の航空写真の複数のラベル付きトレーニングおよび評価データセット。群衆の中の人々の経路を示すために手動でラベル付けされた画像。約150パス付き画像人物追跡、航空追跡2012[186] [187]M. Butenuth 他
ウィルトデータセット病気の樹木やその他の土地被覆に関するリモートセンシングデータ。さまざまな特徴を抽出しました。4899画像分類、空中物体検出2014[188] [189]B.ジョンソン
MASATIデータセット可視スペクトルによる光学航空画像の海洋風景。ダイナミックな海洋環境におけるカラー画像が含まれており、各画像には、異なる気象条件や照明条件における1つまたは複数のターゲットが含まれている場合があります。オブジェクトの境界ボックスとラベル付け。7389画像分類、空中物体検出2018[190] [191]A.-J. Gallego 他
森林タイプマッピングデータセット日本の森林の衛星画像。抽出された画像波長帯域。326文章分類2015[192] [193]B.ジョンソン
上空画像研究データセット注釈付きの俯瞰画像。複数のオブジェクトを含む画像。画像のコンテキスト内でターゲットを説明する 30 を超える注釈と 60 を超える統計。1000画像、テキスト分類2009[194] [195]F. Tanner 他
スペースネットSpaceNet は、商用衛星画像とラベル付きトレーニング データのコーパスです。建物のフットプリントを含む GeoTiff および GeoJSON ファイル。>17533画像分類、物体識別2017[196] [197] [198]デジタルグローブ株式会社
UCマーセド土地利用データセットこれらの画像は、米国各地のさまざまな都市部に関する USGS 国立地図都市部画像コレクションの大きな画像から手動で抽出されました。これは研究目的の21クラスの土地利用画像データセットです。クラスごとに100枚の画像があります。2,100256x256、30 cm(1フィート)GSDの画像チップ土地被覆分類2010[199]イー・ヤンとショーン・ニューサム
SAT-4 航空データセット画像は、国立農業画像プログラム (NAIP) データセットから抽出されました。SAT-4 には、不毛地、樹木、草地、および上記の 3 つ以外のすべての土地被覆クラスで構成されるクラスを含む 4 つの広範な土地被覆クラスがあります。50万画像分類2015[200] [201]S. Basu ら
SAT-6 航空データセット画像は、国立農業画像プログラム (NAIP) データセットから抽出されました。SAT-6 には、不毛地、樹木、草地、道路、建物、水域を含む 6 つの広範な土地被覆クラスがあります。40万5000画像分類2015[200] [201]S. Basu ら

水中画像

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
SUIMデータセットこれらの画像は海洋探査や人間とロボットの共同実験中に厳密に収集され、人間の参加者によって注釈が付けられました。魚類(脊椎動物)、サンゴ礁(無脊椎動物)、水生植物、難破船/遺跡、人間のダイバー、ロボット、海底の 8 つのオブジェクト カテゴリのピクセル注釈が付いた画像。1,635画像セグメンテーション2020[202]Md Jahidul Islam 他
LIACIデータセット画像は船舶の水中検査中に収集され、人間のドメイン専門家によって注釈が付けられました。欠陥、腐食、塗装の剥がれ、海洋生物、海底格子、船外バルブ、プロペラ、陽極、ビルジキール、船体の 10 個のオブジェクト カテゴリのピクセル注釈付きの画像。1,893画像セグメンテーション2022[203]Waszakら

その他の画像

データセット名簡単な説明前処理インスタンス形式デフォルトタスク作成(更新)参照クリエイター
コダック ロスレス トゥルーカラー イメージ スイート画像圧縮をテストするための RGB 画像。なし24画像画像圧縮1999[204]コダック
NRC-ガンマ新しいベンチマークガスメーター画像データセットなし28,883画像、ラベル分類2021[205] [206]A. エバディ、P. ポール、S. アウアー、S. トレンブレイ
SUPATLANTIQUEデータセットスキャンされた公式文書とWikipedia文書の画像なし4908TIFF/pdfソースデバイスの識別、偽造検出、分類など。2020[207]C. ベン・ラバ他
グラフェンの密度汎関数理論量子シミュレーショングラフェンのシミュレーションへの生の入力のラベル付き画像密度汎関数理論量子シミュレーションからの生データ(HDF5形式)と出力ラベル60744 個のテストファイルと 501473 個のトレーニングファイルラベル付き画像回帰2019[208]K. ミルズ & I. タンブリン
2次元ポテンシャル井戸内の電子の量子シミュレーション2次元量子力学のシミュレーションへの生の入力のラベル付き画像生データ(HDF5形式)と量子シミュレーションからの出力ラベル130万枚の画像ラベル付き画像回帰2017[209]K. ミルズ、MA スパナー、I. タンブリン
MPII 調理活動データセットさまざまな料理活動のビデオと画像。アクティビティのパスと方向、ラベル、きめ細かなモーションのラベル付け、アクティビティ クラス、静止画像の抽出とラベル付け。881,755フレームラベル付けされたビデオ、画像、テキスト分類2012[210] [211]M. Rohrbach 他
FAMOSデータセット5,000 個の固有の微細構造。すべてのサンプルは 2 台の異なるカメラで 3 回取得されています。オリジナルのPNGファイルはカメラごと、そして取得ごとにソートされています。取得ごとにカメラごとに16384×5000行列を1つ含むMATLABデータファイル。3万画像と.matファイル認証2012[212]S. Voloshynovskiy 他
PharmaPackデータセットクラスごとに 54 枚の画像を持つ 1,000 個の固有クラス。クラスラベル付け、SIFT や aKaZE などの多くのローカル記述子、Fisher Vector (FV) などのローカル特徴集約器。54,000画像と.matファイル細粒度分類2017[213]O. Taran および S. Rezaeifar ら。
スタンフォード犬のデータセット世界中の120種類の犬種の写真。トレーニング/テスト分割と ImageNet アノテーションが提供されます。20,580画像、テキスト細粒度分類2011[214] [215]A. Khosla ら
StanfordExtraデータセットStanford Dogs データセットの 2D キーポイントとセグメンテーション。2D キーポイントとセグメンテーションが提供されます。12,035ラベル付き画像3D再構成/姿勢推定2020[216]B. ビッグス他
オックスフォード-IIIT ペットデータセットペットのカテゴリーは 37 種類あり、それぞれ約 200 枚の画像があります。品種ラベル、タイトな境界ボックス、前景と背景のセグメンテーション。約7,400画像、テキスト分類、物体検出2012[215] [217]O. Parkhi ら
Corel 画像特徴データセット特徴を抽出した画像のデータベース。色ヒストグラム、共起テクスチャ、カラーモーメントなどの多くの機能、68,040文章分類、物体検出1999[218] [219]M. Ortega-Bindenberger 他
オンラインビデオの特性とトランスコーディング時間のデータセット。さまざまなビデオおよびビデオ プロパティのトランスコード時間。ビデオ機能が提供されます。168,286文章回帰2015[220]T. Deneke 他
Microsoft Sequential Image Narrative Dataset (SIND)視覚から言語への連続データセット各写真には説明的なキャプションとストーリーが付けられ、写真は順番に並べられています81,743画像、テキスト視覚的なストーリーテリング2016[221]マイクロソフトリサーチ
Caltech-UCSD Birds-200-2011 データセット鳥の画像の大規模なデータセット。鳥類の部位の位置、境界ボックス、312個のバイナリ属性が与えられている11,788画像、テキスト分類2011[222] [223]C. Wah ら
YouTube-8M大規模かつ多様なラベル付きビデオデータセット4,800 の視覚的エンティティの多様な語彙から抽出した YouTube 動画の ID と関連ラベル800万ビデオ、テキストビデオ分類2016[224] [225]S. アブ・エル・ハイジャ 他
YFCC100M大規模かつ多様なラベル付き画像およびビデオデータセットFlickr の動画と画像、および関連する説明、タイトル、タグ、その他のメタデータ( Exifやジオタグなど)1億ビデオ、画像、テキストビデオと画像の分類2016[226] [227]B. Thomee ら
ディスクリート LIRIS-ACCEDE価値と興奮度について注釈が付けられた短いビデオ。価数と覚醒度のラベル。9800ビデオビデオ感情喚起検出2015[228]Y. Baveye 他
継続的なLIRIS-ACCEDE電気皮膚反応も収集しながら、感情価と覚醒度について注釈を付けた長いビデオ。価数と覚醒度のラベル。30ビデオビデオ感情喚起検出2015[229]Y. Baveye 他
メディヴァル LIRIS-ACCEDE映画の暴力レベルに関する注釈を含む Discrete LIRIS-ACCEDE の拡張。暴力、価値、​​興奮のラベル。10900ビデオビデオ感情喚起検出2015[230]Y. Baveye 他
リーズ・スポーツ・ポーズFlickr の 2000 枚の自然なスポーツ画像における人間のポーズの注釈。14の共同ラベルを持つ単一の関心対象者の周りの粗い切り取り2000画像と.matファイルのラベル人間の姿勢推定2010[231]S. ジョンソンとM. エヴァリンガム
リーズ・スポーツ・ポーズ・エクステンデッド・トレーニングFlickr の 10,000 枚の自然なスポーツ画像における人間のポーズの注釈。クラウドソーシングによる14の共同レーベル10000画像と.matファイルのラベル人間の姿勢推定2011[232]S. ジョンソンとM. エヴァリンガム
MCQデータセット多肢選択式テスト評価システム用に開発されたコンピューター ビジョン技術とシステムを評価するための、6 つの異なる実際の多肢選択式試験 (解答用紙 735 枚と解答ボックス 33,540 個)。なし解答用紙735枚、解答箱33,540個画像と.matファイルのラベル多肢選択式テスト評価システムの開発2017[233] [234]Afifi、M. 他
監視ビデオ実際の監視ビデオは、長い監視時間(7 日間、各 24 時間)をカバーします。なし監視ビデオ 19 本 (7 日間、各 24 時間)。ビデオデータ圧縮2016[235]Taj-Eddin、IATF 他
ライラBCアレクサンドリアのラベル付き情報ライブラリ:生物学と保全。生態学と環境科学に関する機械学習研究を支援するラベル付き画像。なし約1,000万枚の画像画像分類2019[236]LILAワーキンググループ
光合成を見ることはできますか?DC 照明条件と AC 照明条件の両方で録画された、8 枚の生きている葉と 8 枚の枯れた葉のビデオ 32 本。なし32本のビデオビデオ植物の生体検知2017[237]Taj-Eddin、IATF 他
数学的な数学ミーム数学に関するミーム 10,000 個のコレクション。なし約10,000画像視覚的なストーリーテリング、オブジェクト検出。2021[238]数学的な数学ミーム
Flickr-Faces-HQデータセットFlickrからクロールされた、顔が映っている画像のコレクション「さまざまな自動フィルター」でトリミングされ、顔に合わせて切り取られ、クラウドソーシングを通じて彫像、絵画、写真の写真の画像が削除された。7万画像顔生成2019[239]カラスら
Fruits-360データセット170 種類の果物、野菜、ナッツ、種子を含む画像のコレクション。100x100 ピクセル、白背景。115499画像(jpg)分類2017~2025年[240]ミハイ・オルテアン

参考文献

  1. ^ Bottou, L.; Cortes, C.; Denker, JS; Drucker, H.; Guyon, I.; Jackel, LD; LeCun, Y.; Muller, UA; Sackinger, E.; Simard, P.; Vapnik, V. (1994). 「分類器手法の比較:手書き数字認識における事例研究」.第12回IAPR国際パターン認識会議論文集 (Cat. No.94CH3440-5) . 第2巻. IEEE Comput. Soc. Press. pp.  77– 82. doi :10.1109/ICPR.1994.576879. ISBN 978-0-8186-6270-6
  2. ^ 「NISTスペシャルデータベース19」NIST . 2010年8月27日.
  3. ^ LeCun, Yann. 「NORB: 画像における汎用物体認識」. cs.nyu.edu . 2025年4月26日閲覧
  4. ^ LeCun, Y.; Fu Jie Huang; Bottou, L. (2004). 「姿勢と照明に対する不変性を備えた汎用物体認識のための学習手法」. 2004 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Proceedings of the 2004 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, 2004. CVPR 2004.第2巻. IEEE. pp.  97– 104. doi :10.1109/CVPR.2004.1315150. ISBN 978-0-7695-2158-9
  5. ^ Torralba, A.; Fergus, R.; Freeman, WT (2008年11月). 「8000万枚の小さな画像:ノンパラメトリック物体・シーン認識のための大規模データセット」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 30 (11): 1958– 1970. Bibcode :2008ITPAM..30.1958T. doi :10.1109/TPAMI.2008.128. ISSN  0162-8828. PMID  18787244.
  6. ^ 「ストリートビューハウスナンバー(SVHN)データセット」ufldl.stanford.edu . 2025年2月25日閲覧
  7. ^ Yuval Netzer、Tao Wang、Adam Coates、Alessandro Bissacco、Bo Wu、Andrew Y. Ng。「教師なし特徴学習による自然画像内の数字の読み取り」NIPSワークショップ「ディープラーニングと教師なし特徴学習」2011
  8. ^ Hinton, Geoffrey; Vinyals, Oriol; Dean, Jeff (2015-03-09). 「ニューラルネットワークにおける知識の抽出」arXiv : 1503.02531 [stat.ML].
  9. ^ Sun, Chen; Shrivastava, Abhinav; Singh, Saurabh; Gupta, Abhinav (2017). 「ディープラーニング時代におけるデータの不当な有効性の再考」pp.  843– 852. arXiv : 1707.02968 [cs.CV].
  10. ^ アブナル、サミラ;デガニ、モスタファ。ネイシャブル、ベーナム。セギ、ハニエ(2021-10-05)。 「大規模な事前トレーニングの限界を探る」。arXiv : 2110.02095 [cs.LG]。
  11. ^ Zhai, Xiaohua; Kolesnikov, Alexander; Houlsby, Neil; Beyer, Lucas (2021-06-08). 「Scaling Vision Transformers」. arXiv : 2106.04560 [cs.CV].
  12. ^ Zhou, Bolei; Lapedriza, Agata; Khosla, Aditya; Oliva, Aude; Torralba, Antonio (2018-06-01). 「Places: シーン認識のための1000万画像データベース」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 40 (6): 1452– 1464. Bibcode :2018ITPAM..40.1452Z. doi :10.1109/TPAMI.2017.2723009. ISSN  0162-8828. PMID  28692961.
  13. ^ グローマン、クリステン;ウェストベリー、アンドリュー。バーン、ユージーン。チャヴィス、ザカリー。フルナリ、アントニーノ。ギルダール、ロヒット。ハンバーガー、ジャクソン。ジャン・ハオ。劉、ミャオ族。劉星宇。マーティン、ミゲル。ナガラジャン、トゥシャール。ラドサボビッチ、イリヤ。ラーマクリシュナン、サントシュ・クマール。ライアン、フィオナ。シャルマ、ジャヤント。レイ、マイケル。徐、孟夢。徐、エリック・ジョンコン。趙、陳。バンサル、シッダント。バトラ、ドゥルブ。カルティリエ、ヴァンサン。クレイン、ショーン。やれよ、ティエン。ドゥラティ、モリー。エラパリ、アクシャイ。フェイヒテンホーファー、クリストフ。フラゴメニ、アドリアーノ。フー、チーチェン。ゲブレセラシエ、アブラハム。ゴンザレス、クリスティーナ。ヒリス、ジェームズ。黄、徐華。ファン、イーフェイ。ジア、ウェンキ。クー、ウェスリー。コーラー、ヤヒム。コットゥル、サトウィック。クマール、アヌラグ。ランディーニ、フェデリコ。リー、チャオ。リー、ヤンハオ。李鎮強。マンガラム、カルトティケヤ。モドゥグ、ラガヴァ。マンロー、ジョナサン。マレル、タリー。西安拓海価格、意志。プエンテス、パオラ・ルイス。ラマザノバ、メレイ。サリ、レダ。ソマスンダラム、キラン。サザーランド、オードリー。菅野祐介;タオ、ルイジエ。ボー、ミン。ワン・ユチェン。呉、新地。八木拓馬趙紫偉。朱、雲宜。アルベラエス、パブロ。デビッド・クランドール。ダーメン、ディマ。ファリネッラ、ジョバンニ・マリア。フューゲン、クリスチャン。ガネム、バーナード;イタプ、ヴァムシ・クリシュナ。ジャワハル、CV;チュ、ハンビョル。キタニ、クリス。李、海州。ニューカム、リチャード。オリバ、オード。パク・ヒョンス;レーグ、ジェームス M.佐藤洋一;シー・ジャンボ。ショウ、マイク・ジェン;トラルバ、アントニオ。トレサーニ、ロレンツォ。ヤン、ミンフェイ。マリク、ジテンドラ (2022)。 「Ego4D: 3,000 時間の自己中心的なビデオで世界一周」。arXiv : 2110.07058 [cs.CV]。
  14. ^ Srinivasan, Krishna; Raman, Karthik; Chen, Jiecao; Bendersky, Michael; Najork, Marc (2021-07-11). 「WIT: マルチモーダル多言語機械学習のためのWikipediaベースの画像テキストデータセット」.第44回国際ACM SIGIR情報検索研究開発会議議事録. ACM. pp.  2443– 2449. arXiv : 2103.01913 . doi :10.1145/3404835.3463257. ISBN 978-1-4503-8037-9
  15. ^ Krishna, Ranjay; Zhu, Yuke; Groth, Oliver; Johnson, Justin; Hata, Kenji; Kravitz, Joshua; Chen, Stephanie; Kalantidis, Yannis; Li, Li-Jia; Shamma, David A; Bernstein, Michael S; Fei-Fei, Li (2017). 「Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations」. International Journal of Computer Vision . 123 : 32– 73. arXiv : 1602.07332 . doi :10.1007/s11263-016-0981-7. S2CID  4492210.
  16. ^ Karayev, S., et al. 「カテゴリレベルの3Dオブジェクトデータセット:Kinectの活用」IEEE国際コンピュータビジョンワークショップ議事録。2011年。
  17. ^ Tighe, Joseph, Svetlana Lazebnik . 「Superparsing: スーパーピクセルを用いたスケーラブルなノンパラメトリック画像解析」( Wayback Machineに2019年8月6日アーカイブ)Computer Vision–ECCV 2010. Springer Berlin Heidelberg, 2010. 352–365.
  18. ^ Arbelaez, P.; Maire, M; Fowlkes, C; Malik, J (2011年5月). 「輪郭検出と階層的画像セグメンテーション」(PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 33 (5): 898– 916. Bibcode :2011ITPAM..33..898A. doi :10.1109/tpami.2010.161. PMID  20733228. S2CID  206764694. 2016年2月27日閲覧.
  19. ^ Lin, Tsung-Yi; Maire, Michael; Belongie, Serge; Bourdev, Lubomir; Girshick, Ross; Hays, James; Perona, Pietro; Ramanan, Deva; Lawrence Zitnick, C.; Dollár, Piotr (2014). 「Microsoft COCO: コンテキストにおける共通オブジェクト」. arXiv : 1405.0312 [cs.CV].
  20. ^ Russakovsky, Olga; et al. (2015). 「Imagenet大規模視覚認識チャレンジ」. International Journal of Computer Vision . 115 (3): 211– 252. arXiv : 1409.0575 . doi :10.1007/s11263-015-0816-y. hdl :1721.1/104944. S2CID  2930547.
  21. ^ 「COCO – コンテキスト内の共通オブジェクト」。cocodataset.org
  22. ^ Deng, Jia他「Imagenet:大規模階層型画像データベース」Computer Vision and Pattern Recognition、2009年。CVPR 2009。IEEE Con​​ference on。IEEE、2009年。
  23. ^ abc Krizhevsky, Alex, Ilya Sutskever, Geoffrey E. Hinton. 「深層畳み込みニューラルネットワークによるImageNet分類」ニューラル情報処理システムの進歩. 2012年.
  24. ^ ルサコフスキー、オルガ;鄧、佳。スー、ハオ。クラウス、ジョナサン。サシーシュ、サンジーブ。他。 (2015 年 4 月 11 日)。 「ImageNet 大規模視覚認識チャレンジ」。コンピュータビジョンの国際ジャーナル115 ( 3) : 211–252.arXiv : 1409.0575 土井:10.1007/s11263-015-0816-y。hdl :1721.1/104944。S2CID  2930547。
  25. ^ シャオ、建雄;ヘイズ、ジェームズ。エヒンガー、クリスタ A.オリバ、オード。アントニオ・トラルバ(2010年6月)。 「SUN データベース: 修道院から動物園までの大規模シーン認識」。2010 年のコンピュータ ビジョンとパターン認識に関する IEEE コンピュータ協会会議。 IEEE。 pp.  3485–3492 . doi :10.1109/cvpr.2010.5539970。hdl : 1721.1/60690ISBN 978-1-4244-6984-0
  26. ^ Donahue, Jeff; Jia, Yangqing; Vinyals, Oriol; Hoffman, Judy; Zhang, Ning; Tzeng, Eric; Darrell, Trevor (2013). 「DeCAF:汎用視覚認識のための深層畳み込み活性化特徴」. arXiv : 1310.1531 [cs.CV].
  27. ^ Yu, Fisher; Seff, Ari; Zhang, Yinda; Song, Shuran; Funkhouser, Thomas; Xiao, Jianxiong (2016-06-04). 「LSUN: 人間を介入させるディープラーニングを用いた大規模画像データセットの構築」. arXiv : 1506.03365 [cs.CV].
  28. ^ 「/lsun/のインデックス」dl.yf.io . 2024年9月19日閲覧
  29. ^ "LSUN".複雑適応システム研究所. 2024年9月19日閲覧。
  30. ^ Gupta, Agrim; Dollar, Piotr; Girshick, Ross (2019). 「LVIS: 大規模語彙インスタンスセグメンテーションのためのデータセット」: 5356–5364 . {{cite journal}}:ジャーナルを引用するには|journal=ヘルプ)が必要です
  31. ^ イワン・クラシン、トム・ドゥエリグ、ニール・アルドリン、アンドレアス・ファイト、サミ・アブエルハイジャ、セルジュ・ベロンジー、デビッド・カイ、ゼユン・フェン、ヴィットリオ・フェラーリ、ビクター・ゴメス、アビナフ・グプタ、ディアネシュ・ナラヤナン、チェン・サン、ガル・チェチク、ケビン・マーフィー。 「OpenImages: 大規模なマルチラベルおよびマルチクラス画像分類用の公開データセット、2017 年。https://github.com/openimages から入手可能。」
  32. ^ Vyas, Apoorv他「放送ニュース動画におけるコマーシャルブロックの検出」2014年インドコンピュータビジョングラフィックスおよび画像処理会議議事録。ACM、2014年。
  33. ^ ハウプトマン、アレクサンダー・G.、マイケル・J.・ウィットブロック。「放送ニュース映像におけるストーリーセグメンテーションとコマーシャルの検出」『デジタル図書館における研究と技術の進歩』、1998年。ADL 98。議事録。IEEE国際フォーラム、IEEE、1998年。
  34. ^ Tung, Anthony KH, Xin Xu, Beng Chin Ooi. 「Curler:非線形相関クラスターの検出と可視化」2005 ACM SIGMOD国際データ管理会議議事録. ACM, 2005.
  35. ^ Jarrett, Kevin, et al. 「物体認識に最適なマルチステージアーキテクチャとは?」Computer Vision、2009 IEEE 第12回国際会議。IEEE、2009年。
  36. ^ Lazebnik, SvetlanaCordelia Schmid、Jean Ponce. 「特徴バッグを超えて:自然シーンカテゴリーを認識するための空間ピラミッドマッチング」Computer Vision and Pattern Recognition、2006 IEEE Computer Society Conference on . 第2巻、IEEE、2006年。
  37. ^ Griffin, G., A. Holub, P. Perona. Caltech-256 オブジェクトカテゴリデータセット California Inst . Technol., Tech. Rep. 7694, 2007. 入手先: http://authors.library.caltech.edu/7694, 2007.
  38. ^ Baeza-Yates, Ricardo, Berthier Ribeiro-Neto.現代の情報検索. 第463巻. ニューヨーク: ACMプレス, 1999年.
  39. ^ “🐺 COYO-700M: 画像-テキストペアデータセット”. Kakao Brain. 2022年11月3日. 2022年11月3日閲覧
  40. ^ Fu, Xiping, et al. 「NOKMeans: 非直交K平均法ハッシュ」Computer Vision—ACCV 2014. Springer International Publishing, 2014. 162–177.
  41. ^ Heitz, Geremy; et al. (2009). 「記述的分類のための形状ベースの物体位置推定」. International Journal of Computer Vision . 84 (1): 40– 62. CiteSeerX 10.1.1.142.280 . doi :10.1007/s11263-009-0228-y. S2CID  646320. 
  42. ^ Everingham, Mark; et al. (2010). 「Pascalビジュアルオブジェクトクラス(VOC)の課題」. International Journal of Computer Vision . 88 (2): 303– 338. doi :10.1007/s11263-009-0275-4. hdl : 20.500.11820/88a29de3-6220-442b-ab2d-284210cf72d6 . S2CID  4246903.
  43. ^ Felzenszwalb, Pedro F.; et al. (2010). 「識別的に訓練されたパーツベースモデルによる物体検出」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 32 (9): 1627– 1645. Bibcode :2010ITPAM..32.1627F. CiteSeerX 10.1.1.153.2745 . doi :10.1109/tpami.2009.167. PMID  20634557. S2CID  3198903. 
  44. ^ ab Gong、Yunchao、Svetlana Lazebnik。「反復量子化:バイナリコード学習へのプロクルステス的アプローチ」コンピュータビジョンとパターン認識(CVPR)、2011 IEEEカンファレンス。IEEE、2011年。
  45. ^ 「CINIC-10 データセット」. Luke N. Darlow、Elliot J. Crowley、Antreas Antoniou、Amos J. Storkey (2018) CINIC-10 は ImageNet や CIFAR-10 ではありません。 2018-10-09 2018年11月13日に取得
  46. ^ 「fashion-mnist: MNIST風ファッション商品データベース。ベンチマーク:point_right」Zalando Research. 2017年10月7日. 2017年10月7日閲覧
  47. ^ "notMNISTデータセット".機械学習など. 2011年9月8日. 2017年10月13日閲覧
  48. ^ Chaladze、G.、Kalatozishvili、L. (2017)。 リンネ 5 データセット。  Chaladze.com。 2017 年 11 月 13 日取得、http://chaladze.com/l5/ より
  49. ^ Afifi, Mahmoud (2017-11-12). 「大規模な手の画像データセットを用いた性別認識と生体認証」arXiv : 1711.04322 [cs.CV].
  50. ^ Lomonaco, Vincenzo; Maltoni, Davide (2017-10-18). 「CORe50:連続物体認識のための新たなデータセットとベンチマーク」arXiv : 1705.03550 [cs.CV].
  51. ^ 彼女、チー;フェン、ファン。ハオ、シンユエ。ヤン、チーハン。ラン、川林。ロモナコ、ヴィンチェンツォ。シー・シュエソン。王正偉。郭、姚。チャン・イーミン。チャオ、フェイ。チャン、ローザ HM (2019-11-15)。 「OpenLORIS-Object: 生涯にわたるディープラーニングのためのロボットビジョンデータセットとベンチマーク」。arXiv : 1911.06487v2 [cs.CV]。
  52. ^ Morozov, Alexei; Sushkova, Olga (2019-06-13). 「THzおよび熱ビデオデータセット」。マルチチャンネルビデオ監視における人間行動分析のためのマルチエージェントロジックプログラミングアプローチの開発。モスクワ:IRE RAS 。 2019年7月19日閲覧
  53. ^ Morozov, Alexei; Sushkova, Olga; Kershner, Ivan; Polupanov, Alexander (2019-07-09). 「テラヘルツ波と3Dビデオ画像の意味的融合に基づくテラヘルツインテリジェントビデオ監視手法の開発」(PDF) . CEUR . 2391 : paper19 . 2019-07-19閲覧.
  54. ^ Calli, Berk; Walsman, Aaron; Singh, Arjun; Srinivasa, Siddhartha; Abbeel, Pieter; Dollar, Aaron M. (2015年9月). 「マニピュレーション研究におけるベンチマーキング:Yale-CMU-Berkeleyオブジェクトおよびモデルセットの使用」. IEEE Robotics & Automation Magazine . 22 (3): 36– 52. arXiv : 1502.03143 . Bibcode :2015IRAM...22c..36C. doi :10.1109/MRA.2015.2448951. ISSN  1070-9932.
  55. ^ ab Downs, Laura; Francis, Anthony; Koenig, Nate; Kinman, Brandon; Hickman, Ryan; Reymann, Krista; McHugh, Thomas B.; Vanhoucke, Vincent (2022-05-23). 「Google Scanned Objects: 3Dスキャンされた家庭用品の高品質データセット」. 2022 International Conference on Robotics and Automation (ICRA) . IEEE. pp.  2553– 2560. arXiv : 2204.11918 . doi :10.1109/ICRA46639.2022.9811809. ISBN 978-1-7281-9681-7
  56. ^ 「プリンストン・シェイプ・ベンチマーク」shape.cs.princeton.edu . 2025年3月7日閲覧
  57. ^ Shilane, P.; Min, P.; Kazhdan, M.; Funkhouser, T. (2004). 「プリンストン形状ベンチマーク」. Proceedings Shape Modeling Applications, 2004 . IEEE. pp.  167– 388. doi :10.1109/SMI.2004.1314504. ISBN 978-0-7695-2075-9
  58. ^ Janoch, Allison; Karayev, Sergey; Jia, Yangqing; Barron, Jonathan T.; Fritz, Mario; Saenko, Kate; Darrell, Trevor (2013), Fossati, Andrea; Gall, Juergen; Grabner, Helmut; Ren, Xiaofeng (eds.), "A Category-Level 3D Object Dataset: Putting the Kinect to Work", Consumer Depth Cameras for Computer Vision: Research Topics and Applications , London: Springer, pp.  141– 165, doi :10.1007/978-1-4471-4640-7_8, ISBN 978-1-4471-4640-7、 2025年3月7日閲覧
  59. ^ Chang, Angel X.; Funkhouser, Thomas; Guibas, Leonidas; Hanrahan, Pat; Huang, Qixing; Li, Zimo; Savarese, Silvio; Savva, Manolis; Song, Shuran (2015-12-09). 「ShapeNet:情報豊富な3Dモデルリポジトリ」. arXiv : 1512.03012 [cs.GR].
  60. ^ 「Computational Vision and Geometry Lab」. cvgl.stanford.edu . 2025年3月7日閲覧。
  61. ^ Xiang, Yu; Kim, Wonhui; Chen, Wei; Ji, Jingwei; Choy, Christopher; Su, Hao; Mottaghi, Roozbeh; Guibas, Leonidas; Savarese, Silvio (2016). 「ObjectNet3D: 3D物体認識のための大規模データベース」. Leibe, Bastian; Matas, Jiri; Sebe, Nicu; Welling, Max (編). Computer Vision – ECCV 2016 . Lecture Notes in Computer Science. Vol. 9912. Cham: Springer International Publishing. pp.  160– 176. doi :10.1007/978-3-319-46484-8_10. ISBN 978-3-319-46484-8
  62. ^ ライゼンシュタイン, ジェレミー; シャポバロフ, ローマン; ヘンツラー, フィリップ; スボルドーネ, ルカ; ラバトゥット, パトリック; ノヴォトニー, デイヴィッド (2021). 「3Dにおける一般的な物体:実生活における3Dカテゴリー再構築の大規模学習と評価」: 10901–10911 . {{cite journal}}:ジャーナルを引用するには|journal=ヘルプ)が必要です
  63. ^ Reizenstein, Jeremy; Shapovalov, Roman; Henzler, Philipp; Sbordone, Luca; Labatut, Patrick; Novotny, David (2021-09-01). 「3Dにおける一般的なオブジェクト:実生活における3Dカテゴリー再構築の大規模学習と評価」arXiv : 2109.00512 [cs.CV].
  64. ^ マット・デイトケ;リュー、ルオシ。マシュー・ウォーリングフォード。ンゴ、フォン。ミシェル、オスカー。アディティヤ、クスパティ。ファン、アラン。ラフォルテ、クリスチャン。ヴォレティ、ヴィクラム。ガドレ、サミール・イツハク。ヴァンダービルト、イーライ。ケンバヴィ、アニルッダ。カール・ヴォンドリック。ジョージア州グキオサリ。エサニ、キアナ(2023-12-15)。 「Objaverse-XL: 1,000 万以上の 3D オブジェクトの宇宙」。神経情報処理システムの進歩36 : 35799–35813
  65. ^ ウー、トン;チャン、ジアルイ。フー、シャオ。王宇新。レン、ジアウェイ。パン、リャン。ウー、ウェイン。ヤン、レイ。王佳琦。チェン・チェン;リン、ダーファ。劉紫偉(2023)。 「OmniObject3D: 現実的な知覚、再構築、生成のための大量の語彙を備えた 3D オブジェクト データセット」: 803 ~ 814。 {{cite journal}}:ジャーナルを引用するには|journal=ヘルプ)が必要です
  66. ^ 「OmniObject3D:リアルな知覚、再構築、生成のための大規模語彙3Dオブジェクトデータセット」omniobject3d.github.io . 2025年3月7日閲覧
  67. ^ 「3Dの珍しいオブジェクト」uco3d.github.io . 2025年3月7日閲覧
  68. ^ Liu, Xingchen; Tayal, Piyush; Wang, Jianyuan; Zarzar, Jesus; Monnier, Tom; Tertikas, Konstantinos; Duan, Jiali; Toisoul, Antoine; Zhang, Jason Y. (2025-01-13). 「3Dにおける珍しい物体」. arXiv : 2501.07574 [cs.CV].
  69. ^ M. Cordts、M. Omran、S. Ramos、T. Scharwächter、M. Enzweiler、R. Benenson、U. Franke、S. Roth、B. Schiele、「The Cityscapes Dataset」。CVPRワークショップ「ビジョンにおけるデータセットの未来」、2015年。
  70. ^ Houben, Sebastian, et al. 「実世界画像における交通標識の検出:ドイツ交通標識検出ベンチマーク」ニューラルネットワーク(IJCNN)、2013年国際合同会議、IEEE、2013年。
  71. ^ Mathias, Mayeul他「交通標識認識:解決策まであとどれくらいか?」ニューラルネットワーク(IJCNN)、2013年国際合同会議、IEEE、2013年。
  72. ^ Geiger, Andreas, Philip Lenz, Raquel Urtasun. 「自動運転への準備はできているか? Kitti Visionベンチマークスイート」Computer Vision and Pattern Recognition (CVPR)、2012 IEEE Con​​ference on . IEEE、2012年。
  73. ^ Sturm, Jürgen, et al. 「RGB-D SLAMシステムの評価のためのベンチマーク」インテリジェントロボットシステム(IROS)、2012 IEEE/RSJ国際会議。IEEE、2012年。
  74. ^ YouTubeの KITTI Vision ベンチマーク スイート
  75. ^ Kragh, Mikkel F.; et al. (2017). 「FieldSAFE – 農業における障害物検知のためのデータセット」. Sensors . 17 (11): 2579. arXiv : 1709.03526 . Bibcode :2017Senso..17.2579K. doi : 10.3390/s17112579 . PMC 5713196. PMID  29120383 . 
  76. ^ 「Papers with Code - Daimler Monocular Pedestrian Detection Dataset」. paperswithcode.com . 2023年5月5日閲覧
  77. ^ Enzweiler, Markus; Gavrila, Dariu M. (2009年12月). 「単眼歩行者検出:調査と実験」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 31 (12): 2179– 2195. Bibcode :2009ITPAM..31.2179E. doi :10.1109/TPAMI.2008.260. ISSN  1939-3539. PMID  19834140. S2CID  1192198.
  78. ^ Yin, Guojun; Liu, Bin; Zhu, Huihui; Gong, Tao; Yu, Nenghai (2020年7月28日). 「複数物体追跡と行動分析のための大規模都市監視ビデオデータセット」. arXiv : 1904.11784 [cs.CV].
  79. ^ 「ビデオデータセットにおける物体認識」mi.eng.cam.ac.uk . 2023年5月5日閲覧
  80. ^ Brostow, Gabriel J.; Shotton, Jamie; Fauqueur, Julien; Cipolla, Roberto (2008). 「モーションポイントクラウドからの構造抽出を用いたセグメンテーションと認識」. Computer Vision – ECCV 2008. Lecture Notes in Computer Science. Vol. 5302. Springer. pp.  44– 57. doi :10.1007/978-3-540-88682-2_5. ISBN 978-3-540-88681-5
  81. ^ Brostow, Gabriel J.; Fauqueur, Julien; Cipolla, Roberto (2009年1月15日). 「ビデオにおけるセマンティックオブジェクトクラス:高解像度グラウンドトゥルースデータベース」. Pattern Recognition Letters . 30 (2): 88– 97. Bibcode :2009PaReL..30...88B. doi :10.1016/j.patrec.2008.04.005. ISSN  0167-8655.
  82. ^ 「WildDash 2 ベンチマーク」. wilddash.cc . 2023年5月5日閲覧
  83. ^ Zendel, Oliver; Murschitz, Markus; Zeilinger, Marcel; Steininger, Daniel; Abbasi, Sara; Beleznai, Csaba (2019年6月). 「RailSem19: 鉄道シーンのセマンティック理解のためのデータセット」. 2019 IEEE/CVF コンピュータービジョンおよびパターン認識ワークショップ (CVPRW) . pp.  1221– 1229. doi :10.1109/CVPRW.2019.00161. ISBN 978-1-7281-2506-0. S2CID  198166233。
  84. ^ 「The Boreas Dataset」. www.boreas.utias.utoronto.ca . 2023年5月5日閲覧
  85. ^ Burnett, Keenan; Yoon, David J.; Wu, Yuchen; Li, Andrew Zou; Zhang, Haowei; Lu, Shichen; Qian, Jingxing; Tseng, Wei-Kang; Lambert, Andrew; Leung, Keith YK; Schoellig, Angela P.; Barfoot, Timothy D. (2023年1月26日). 「Boreas:マルチシーズン自動運転データセット」. arXiv : 2203.10168 [cs.RO].
  86. ^ 「Bosch Small Traffic Lights Dataset」hci.iwr.uni-heidelberg.de . 2017年3月1日. 2023年5月5日閲覧
  87. ^ Behrendt, Karsten; Novak, Libor; Botros, Rami (2017年5月). 「交通信号へのディープラーニングアプローチ:検出、追跡、分類」. 2017 IEEE International Conference on Robotics and Automation (ICRA) . pp.  1370– 1377. doi :10.1109/ICRA.2017.7989163. ISBN 978-1-5090-4633-1. S2CID  6257133。
  88. ^ "FRSign Dataset". frsign.irt-systemx.fr . 2023年5月5日閲覧
  89. ^ ハーブ、ジャニーン;レベナ、ニコラス。チョシドウ、ラファエル。ロブラン、グレゴワール。ポタルソフ、ローマ人。ハジリ、ハテム(2020年2月5日)。 「FRSign: 自動運転列車用の大規模信号機データセット」。arXiv : 2002.05665 [cs.CY]。
  90. ^ "ifs-rwth-aachen/GERALD". 鉄道車両・輸送システム研究所会長. 2023年4月30日. 2023年5月5日閲覧
  91. ^ Leibner, Philipp; Hampel, Fabian; Schindler, Christian (2023年4月3日). 「GERALD: ドイツ本線鉄道信号検出のための新規データセット」Proceedings of the Institution of Mechanical Engineers, Part F: Journal of Rail and Rapid Transit . 237 (10): 1332– 1342. doi :10.1177/09544097231166472. ISSN  0954-4097. S2CID  257939937.
  92. ^ Wojek, Christian; Walk, Stefan; Schiele, Bernt (2009年6月). 「マルチキューオンボード歩行者検出」. 2009 IEEE Con​​ference on Computer Vision and Pattern Recognition . pp.  794– 801. doi :10.1109/CVPR.2009.5206638. ISBN 978-1-4244-3992-8. S2CID  18000078。
  93. ^ トプラク、トゥチェ;アイドゥン、ブラク。ベレンリオール、ブラク。ギュゼリス、キュネイト。セルバー、M. アルパー(2020 年 4 月 5 日) 「鉄道運転手支援システムにおけるカメラベースの車載歩行者検出用の転送モデルの条件付き重み付けアンサンブル」。車両技術に関する IEEE トランザクション69 (5): 5041。ビブコード:2020ITVT...69.5041T。土井:10.1109/TVT.2020.2983825。S2CID  216510283 2023 年5 月 5 日に取得
  94. ^ Toprak, Tugce; Belenlioglu, Burak; Aydın, Burak; Guzelis, Cuneyt; Selver, M. Alper (2020年5月). 「鉄道運転支援システムにおけるカメラベース車載歩行者検知のための条件付き加重転移モデルのアンサンブル」. IEEE Transactions on Vehicular Technology . 69 (5): 5041– 5054. Bibcode :2020ITVT...69.5041T. doi :10.1109/TVT.2020.2983825. ISSN  1939-9359. S2CID  216510283.
  95. ^ ティリー、ローマン;ノイマイヤー、フィリップ。シュワルベ、カルステン。クラセク、パベル。タギエフ、ロスタム。パトリック・デンズラー。トビアス、クロッカウ。ボークホフ、マーティン。ケッペル、マルティン (2023)。 「鉄道2023のオープンセンサーデータ」。FID ムーブ(ドイツ語)。土井:10.57806/9mv146r0。
  96. ^ タギエフ、ロスタム;ケッペル、マルティン。シュワルベ、カルステン。パトリック・デンズラー。ノイマイヤー、フィリップ。トビアス、クロッカウ。ボークホフ、マーティン。クラセク、パベル。ティリー、ローマン(2023年5月4日)。 「OSDaR23: 鉄道 2023 のオープン センサー データ」。2023 年第 8 回ロボット工学および自動化工学国際会議 (ICRAE)。ページ 270–276。arXiv : 2305.03001土井:10.1109/ICRAE59816.2023.10458449。ISBN 979-8-3503-2765-6
  97. ^ “ホーム”. Argoverse . 2023年5月5日閲覧
  98. ^ Chang, Ming-Fang; Lambert, John; Sangkloy, Patsorn; Singh, Jagjeet; Bak, Slawomir; Hartnett, Andrew; Wang, De; Carr, Peter; Lucey, Simon; Ramanan, Deva; Hays, James (2019年11月6日). 「Argoverse: リッチマップによる3Dトラッキングと予測」. arXiv : 1911.02620 [cs.CV].
  99. ^ Kharroubi, Abderrazzaq; Ballouch, Zouhair; Hajji, Rafika; Yarroudh, Anass; Billen, Roland (2024年4月9日). 「鉄道セマンティックセグメンテーションのためのマルチコンテキストポイントクラウドデータセットと機械学習」. Infrastructures . 9 (4): 71. doi : 10.3390/infrastructures9040071 .
  100. ^ Qiu, Bo; Zhou, Yuzhou; Dai, Lei; Wang, Bing; Li, Jianping; Dong, Zhen; Wen, Chenglu; Ma, Zhiliang; Yang, Bisheng (2024年12月). 「WHU-Railway3D:鉄道ポイントクラウドのセマンティックセグメンテーションのための多様なデータセットとベンチマーク」. IEEE Transactions on Intelligent Transportation Systems . 25 (12): 20900– 20916. Bibcode :2024ITITr..2520900Q. doi :10.1109/TITS.2024.3469546. ISSN  1558-0016.
  101. ^ Chen, Zhichao; Yang, Jie; Feng, Zhicheng; Zhu, Hao (2024年1月16日). 「RailFOD23:鉄道送電線における異物検出のためのデータセット」. Scientific Data . 11 (1): 72. Bibcode :2024NatSD..11...72C. doi :10.1038/s41597-024-02918-9. ISSN  2052-4463. PMC 10791632. PMID 38228610  . 
  102. ^ ケンマール、レドゥアン;マウリ、アントワーヌ。デュロンポン、カミーユ。ガジュラ、ジャヤディープ。ヴィンセント・ヴォーシー。ハダド、マジド。ブトー、レミ(2022年5月22日)。 「道路と鉄道のスマート モビリティ: 高解像度のグラウンド トゥルース ハイブリッド データセット」。センサー22 (10): 3922。ビブコード:2022Senso..22.3922K。土井: 10.3390/s22103922PMC 9143394PMID  35632331。 
  103. ^ ICONS 2022:第17回国際システム会議:2022年4月24~28日、バルセロナ、スペイン。米国デラウェア州ウィルミントン:IARIA。2022年。ISBN 978-1-61208-941-6
  104. ^ ジャン・テンピン;リー、シーウェイ。張、秦宇。王光帥。チャン、ゼクン。ゼン、ファンクン。アン、ペン。ジン、シン。リュー、シャン。ワン・ヨンジュン(2024)。 「RailPC: 大規模な鉄道点群セマンティック セグメンテーション データセット」。インテリジェンス テクノロジーに関する CAAI トランザクション9 (6): 1548 – 1560. doi : 10.1049/cit2.12349ISSN  2468-2322。
  105. ^ Abid, Mahdi; Teixeira, Mathis; Mahtani, Ankur; Laurent, Thomas (2024). 「RailCloud-HdF: 鉄道シーンのセマンティックセグメンテーションのための大規模ポイントクラウドデータセット」.第19回コンピュータビジョン、イメージング、コンピュータグラフィックス理論と応用に関する国際合同会議議事録. pp.  159– 170. doi :10.5220/0012394800003660. ISBN 978-989-758-679-8
  106. ^ ロスタム、タギエフ;イルカイ、ワンダーリッヒ。フィリップ、ザニッツァー。マーク、サストゥバ。カールステン、ノール。キリアン、ゲラー。ハーディア、アムジャド。ステフェン、ザイツ (2025)。 「ゲルリッツ鉄道試験センター CV データセット 2024 (RailGoerl24)」。ドイツ国立科学技術図書館
  107. ^ Chen, Yihao; Zhu, Ning; Wu, Qian; Wu, Cheng; Niu, Weilong; Wang, Yiming (2022). 「MRSI:鉄道輸送における環境認識のためのマルチモーダル近接リモートセンシングデータセット」. Journal of Intelligent systems . 37 : 5530– 5556. doi :10.1002/int.22801.
  108. ^ Winter, Hanno; Roth, Michael Helmut (2020). RailDriVE 2019年2月 - 鉄道車両測位実験用データセット」elib.dlr.de.
  109. ^ 「顔認識ホームページ - データベース」www.face-rec.org . 2025年4月26日閲覧
  110. ^ Huang, Gary B., et al. 「野生のラベル付き顔:制約のない環境での顔認識を研究するためのデータベース」第1巻第2号技術報告書07-49、マサチューセッツ大学アマースト校、2007年。
  111. ^ “LFW Face Database: Main”. 2012年12月1日. 2012年12月1日時点のオリジナルよりアーカイブ2025年4月26日閲覧。
  112. ^ Zafeiriou, S.; Kollias, D.; Nicolaou, MA; Papaioannou, A.; Zhao, G.; Kotsia, I. (2017). 「Aff-Wild: 感情価と覚醒の『野生における』挑戦」(PDF) . 2017 IEEE コンピュータビジョンおよびパターン認識ワークショップ (CVPRW). pp.  1980– 1987. doi :10.1109/CVPRW.2017.248. ISBN 978-1-5386-0733-6. S2CID  3107614。
  113. ^ Kollias, D.; Tzirakis, P.; Nicolaou, MA; Papaioannou, A.; Zhao, G.; Schuller, B.; Kotsia, I.; Zafeiriou, S. (2019). 「野生におけるディープアフェクト予測:Aff-Wildデータベースと課題、ディープアーキテクチャ、そしてその先へ」. International Journal of Computer Vision . 127 ( 6–7 ): 907–929 . arXiv : 1804.10938 . doi : 10.1007/s11263-019-01158-4 . S2CID  13679040.
  114. ^ Kollias, D.; Zafeiriou, S. (2019). 「表情、感情、行動単位の認識:Aff-wild2、マルチタスク学習、そしてarcface」(PDF) .英国マシンビジョン会議 (BMVC), 2019 . arXiv : 1910.04855 .
  115. ^ Kollias, D.; Schulc, A.; Hajiyev, E.; Zafeiriou, S. (2020). 「第一回ABAW 2020コンペティションにおける感情行動の分析」. 2020 第15回IEEE国際自動顔・ジェスチャー認識会議 (FG 2020) . pp.  637– 643. arXiv : 2001.11409 . doi :10.1109/FG47880.2020.00126. ISBN 978-1-7281-3079-8. S2CID  210966051。
  116. ^ Phillips, P. Jonathon; et al. (1998). 「顔認識アルゴリズムのためのFERETデータベースと評価手順」. Image and Vision Computing . 16 (5): 295– 306. doi :10.1016/s0262-8856(97)00070-x.
  117. ^ Wiskott, Laurenz; et al. (1997). 「弾性バンチグラフマッチングによる顔認識」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 19 (7): 775– 779. CiteSeerX 10.1.1.44.2321 . doi :10.1109/34.598235. S2CID  30523165. 
  118. ^ Livingstone, Steven R.; Russo, Frank A. (2018). 「Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS): A dynamic, multimodal set of facial and vocal expressions in North American English. PLOS ONE . 13 (5) e0196391. Bibcode :2018PLoSO..1396391L. doi : 10.1371/journal.pone.0196391 . PMC 5955500 . PMID  29768426. 
  119. ^ Livingstone, Steven R.; Russo, Frank A. (2018). 「感情」. Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS) . doi :10.5281/zenodo.1188976.
  120. ^ Grgic, Mislav; Delac, Kresimir; Grgic, Sonja (2011). 「SCface–監視カメラ顔データベース」.マルチメディアツールとアプリケーション. 51 (3): 863– 879. doi :10.1007/s11042-009-0417-2. S2CID  207218990.
  121. ^ Wallace, Roy他「顔認証におけるセッション間変動モデリングと共同因子分析」バイオメトリクス(IJCB)、2011年国際合同会議、IEEE、2011年。
  122. ^ Georghiades, A. 「Yale face database」.イェール大学計算視覚制御センター. 2 : 1997.
  123. ^ Nguyen, Duy; et al. (2006). 「フィールドプログラマブルゲートアレイを用いたリアルタイム顔検出および唇特徴抽出」. IEEE Transactions on Systems, Man, and Cyber​​netics - Part B: Cyber​​netics . 36 (4): 902– 912. Bibcode :2006ITSMB..36..902N. CiteSeerX 10.1.1.156.9848 . doi :10.1109/tsmcb.2005.862728. PMID  16903373. S2CID  7334355. 
  124. ^ Kanade, Takeo , Jeffrey F. Cohn, Yingli Tian . 「顔表情分析のための包括的なデータベース」Automatic Face and Gesture Recognition, 2000. Proceedings. Fourth IEEE International Conference on . IEEE, 2000.
  125. ^ Zeng, Zhihong; et al. (2009). 「感情認識手法の概観:音声、視覚、および自発的表現」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 31 (1): 39– 58. Bibcode :2009ITPAM..31...39Z. CiteSeerX 10.1.1.144.217 . doi :10.1109/tpami.2008.52. PMID  19029545. 
  126. ^ マイケル・ライオンズ;鎌池みゆき;魚場次郎(1998年)。 「表情画像」。日本女性の表情(JAFFE)データベース土井:10.5281/zenodo.3451524。
  127. ^ マイケル・ライオンズ、赤松 茂、鎌池 美幸、行場 次郎「ガボールウェーブレットによる表情のコーディング」自動顔・ジェスチャー認識、1998年。議事録。第3回IEEE国際会議。IEEE、1998年。
  128. ^ Ng、Hong-Wei、Stefan Winkler。「大規模な顔データセットのクリーニングに対するデータ駆動型アプローチ」(2019年12月6日アーカイブ、Wayback Machine画像処理(ICIP)、2014年IEEE国際会議。IEEE、2014年。
  129. ^ ロイ・チョードリー、アルニ;リン・ツンユー;マジ、サブランス。エリック・ラーンド・ミラー (2015)。 「双線形 CNN による 1 対多の顔認識」。arXiv : 1506.01342 [cs.CV]。
  130. ^ Jesorsky, Oliver, Klaus J. Kirchberg, Robert W. Frischholz. 「ハウスドルフ距離を用いた堅牢な顔検出」音声・動画ベースの生体認証. Springer Berlin Heidelberg, 2001.
  131. ^ Bhatt, Rajen B.他「低複雑度のファジー決定木モデルを用いた効率的な肌領域セグメンテーション」インド会議(INDICON)、2009年IEEE年次大会。IEEE、2009年。
  132. ^ Lingala, Mounika; et al. (2014). 「ファジーロジックによる色検出:メラノーマ皮膚鏡検査画像における青色領域」. Computerized Medical Imaging and Graphics . 38 (5): 403– 410. doi :10.1016/j.compmedimag.2014.03.007. PMC 4287461. PMID 24786720  . 
  133. ^ Maes, Chris, et al. 「ポーズの正規化と認識のための3D顔面表面における特徴検出」バイオメトリクス:理論・応用・システム(BTAS)、2010年第4回IEEE国際会議。IEEE、2010年。
  134. ^ Savran, Arman, et al. 「3D顔分析のためのボスポラスデータベース」『バイオメトリクスとアイデンティティ管理』Springer Berlin Heidelberg, 2008年、47-56ページ。
  135. ^ Heseltine, Thomas, Nick Pears, Jim Austin. 「3次元顔認識:固有面アプローチ」画像処理、2004年。ICIP'04。2004年国際顔認識会議、第2巻。IEEE、2004年。
  136. ^ Ge, Yun; et al. (2011). 「顔認識のための3D新規顔サンプルモデリング」. Journal of Multimedia . 6 (5): 467– 475. CiteSeerX 10.1.1.461.9710 . doi :10.4304/jmm.6.5.467-475. 
  137. ^ Wang, Yueming; Liu, Jianzhuang; Tang, Xiaoou (2010). 「局所形状差ブースティングによるロバストな3D顔認識」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 32 (10): 1858– 1870. Bibcode :2010ITPAM..32.1858W. CiteSeerX 10.1.1.471.2424 . doi :10.1109/tpami.2009.200. PMID  20724762. S2CID  15263913. 
  138. ^ Zhong, Cheng, Zhenan Sun, Tieniu Tan. 「学習済みビジュアルコードブ​​ックを用いた堅牢な3D顔認識」Computer Vision and Pattern Recognition, 2007. CVPR'07. IEEE Con​​ference on . IEEE, 2007.
  139. ^ 趙、G.ファン、X。タイニ、M.リー、サウスカロライナ州。ピエティカイネン、M. (2011)。 「近赤外線動画による表情認識」(PDF)画像およびビジョン コンピューティング29 (9): 607–619土井:10.1016/j.imavis.2011.07.002。[リンク切れ]
  140. ^ Soyel, Hamit, Hasan Demirel. 「3D顔特徴距離を用いた表情認識」『画像分析と認識』Springer Berlin Heidelberg, 2007年、831-838ページ。
  141. ^ Bowyer, Kevin W.; Chang, Kyong; Flynn, Patrick (2006). 「3Dおよびマルチモーダル3D+2D顔認識におけるアプローチと課題の概観」. Computer Vision and Image Understanding . 101 (1): 1– 15. CiteSeerX 10.1.1.134.8784 . doi :10.1016/j.cviu.2005.05.005. 
  142. ^ Tan, Xiaoyang; Triggs, Bill (2010). 「困難な照明条件下での顔認識のための強化された局所テクスチャ特徴セット」. IEEE Transactions on Image Processing . 19 (6): 1635– 1650. Bibcode :2010ITIP...19.1635T. CiteSeerX 10.1.1.105.3355 . doi :10.1109/tip.2010.2042645. PMID  20172829. S2CID  4943234. 
  143. ^ Mousavi, Mir Hashem; Faez, Karim; Asghari, Amin (2008). 「SVM分類器を用いた3次元顔認識」.第7回IEEE/ACIS国際コンピュータ・情報科学会議 (Icis 2008) . pp.  208– 213. doi :10.1109/ICIS.2008.77. ISBN 978-0-7695-3131-1. S2CID  2710422。
  144. ^ アンバーグ, ブライアン; ノーテ, ラインハルト; ヴェッター, トーマス (2008). 「モーフィング可能なモデルを用いた表情に依存しない3D顔認識」(PDF) . 2008 第8回IEEE国際自動顔・ジェスチャー認識会議. pp.  1– 6. doi :10.1109/AFGR.2008.4813376. ISBN 978-1-4244-2154-1. S2CID 5651453. 2018年7月28日時点の オリジナル(PDF)からアーカイブ2019年8月6日閲覧。
  145. ^ Irfanoglu, MO; Gokberk, B.; Akarun, L. (2004). 「自動登録された顔面を用いた3D形状ベース顔認識」.第17回国際パターン認識会議論文集, 2004. ICPR 2004. pp. 183–186, Vol.4. doi :10.1109/ICPR.2004.1333734. ISBN 0-7695-2128-2. S2CID  10987293。
  146. ^ Beumier, Charles; Acheroy, Marc (2001). 「3Dおよびグレーレベル手がかりによる顔認証」. Pattern Recognition Letters . 22 (12): 1321– 1329. Bibcode :2001PaReL..22.1321B. doi :10.1016/s0167-8655(01)00077-0.
  147. ^ Afifi, Mahmoud; Abdelhamed, Abdelrahman (2017-06-13). 「AFIF4: AdaBoostベースの孤立顔特徴と霧状顔の融合に基づく深層性別分類」arXiv : 1706.04277 [cs.CV].
  148. ^ 「SoFデータセット」。sites.google.com 。 2017年11月18日閲覧
  149. ^ "IMDb-WIKI". data.vision.ee.ethz.ch . 2018年3月13日閲覧
  150. ^ 「AVA:原子視覚アクションのビデオデータセット」research.google.com . 2024年10月18日閲覧
  151. ^ リー、アン;ソタクリ、メーガーナ。ロス、デビッド A.カレイラ、ジョアン。ヴォストリコフ、アレクサンダー。ジッサーマン、アンドリュー (2020-05-20)。 「AVA-Kinetics ローカライズされた人間の行動ビデオ データセット」。arXiv : 2005.00214 [cs.CV]。
  152. ^ Patron-Perez, A.; Marszalek, M.; Reid, I.; Zisserman, A. (2012). 「テレビ番組における人間同士のインタラクションの構造化学習」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 34 (12): 2441– 2453. Bibcode :2012ITPAM..34.2441P. doi :10.1109/tpami.2012.24. PMID  23079467. S2CID  6060568.
  153. ^ Ofli, F.、Chaudhry, R.、Kurillo, G.、Vidal, R.、Bajcsy, R. (2013 年 1 月)。 Berkeley MHAD: 包括的なマルチモーダルな人間の行動データベース。コンピュータ ビジョン (WACV) のアプリケーション、2013 IEEE ワークショップ (pp. 53–60)。 IEEE。
  154. ^ Jiang, YG, et al. 「THUMOSチャレンジ:多数のクラスによる動作認識」ICCVワークショップ「多数のクラスによる動作認識」 、http://crcv.ucf.edu/ICCV13-Action-Workshop. 2013.
  155. ^ Simonyan, Karen、Andrew Zisserman. 「動画内の動作認識のための2ストリーム畳み込みネットワーク」Advances in Neural Information Processing Systems . 2014.
  156. ^ Stoian, Andrei; Ferecatu, Marin; Benois-Pineau, Jenny; Crucianu, Michel (2016). 「大規模ビデオアーカイブにおける高速アクションローカリゼーション」. IEEE Transactions on Circuits and Systems for Video Technology . 26 (10): 1917– 1930. Bibcode :2016ITCSV..26.1917S. doi :10.1109/TCSVT.2015.2475835. S2CID  31537462.
  157. ^ Botta, M., A. Giordana, L. Saitta . 「あいまい概念の定義の学習」ファジーシステム、1993年、第2回IEEE国際会議、IEEE、1993年。
  158. ^ Frey, Peter W.; Slate, David J. (1991). 「Holland型適応分類器を用いた文字認識」.機械学習. 6 (2): 161– 182. doi : 10.1007/bf00114162 .
  159. ^ ペルトネン、ヤーコ;クラミ、アルト。カスキ、サミュエル (2004)。 「探索的分析のためのリーマン計量の学習の改善」。ニューラルネットワーク17 ( 8 ): 1087–1100。CiteSeerX 10.1.1.59.4865 土井:10.1016/j.neunet.2004.06.008。PMID  15555853。 
  160. ^ ab Liu, Cheng-Lin; Yin, Fei; Wang, Da-Han; Wang, Qiu-Feng (2013年1月). 「オンラインおよびオフライン手書き中国語文字認識:新規データベースのベンチマーク」.パターン認識. 46 (1): 155– 162. Bibcode :2013PatRe..46..155L. doi :10.1016/j.patcog.2012.06.021.
  161. ^ Wang, D.; Liu, C.; Yu, J.; Zhou, X. (2009). 「CASIA-OLHWDB1: オンライン手書き中国語文字データベース」. 2009 第10回国際文書分析認識会議. pp.  1206– 1210. doi :10.1109/ICDAR.2009.163. ISBN 978-1-4244-4500-4. S2CID  5705532。
  162. ^ Williams, Ben H., Marc Toussaint, Amos J. Storkey.自然手書きデータからの動きのプリミティブ抽出. Springer Berlin Heidelberg, 2006.
  163. ^ Meier, Franziska, et al. 「プリミティブライブラリを用いた動作セグメンテーション」インテリジェントロボットシステム(IROS)、2011 IEEE/RSJ国際会議。IEEE、2011年。
  164. ^ TE de Campos、BR Babu、M. Varma. 自然画像における文字認識。国際コンピュータビジョン理論・応用会議(VISAPP)論文集、ポルトガル、リスボン、2009年2月
  165. ^ コーエン、グレゴリー、アフシャール、サイード、タプソン、ジョナサン、アンドレ・ヴァン・シャイク (2017). 「EMNIST: 手書き文字へのMNISTの拡張」arXiv : 1702.05373v1 [cs.CV].
  166. ^ 「EMNISTデータセット」NIST 2017年4月4日。
  167. ^ コーエン、グレゴリー、アフシャール、サイード、タプソン、ジョナサン、アンドレ・ヴァン・シャイク (2017). 「EMNIST: 手書き文字へのMNISTの拡張」arXiv : 1702.05373 [cs.CV].
  168. ^ Llorens, David他「UJIpencharsデータベース:ペンベースの孤立手書き文字データベース」LREC .2008年。
  169. ^ Calderara, Simone; Prati, Andrea; Cucchiara, Rita (2011). 「人物の軌跡形状解析におけるフォン・ミーゼス分布の混合」. IEEE Transactions on Circuits and Systems for Video Technology . 21 (4): 457– 471. Bibcode :2011ITCSV..21..457C. doi :10.1109/tcsvt.2011.2125550. hdl :11380/646181. S2CID  1427766.
  170. ^ Guyon, Isabelle, et al. 「NIPS 2003 特徴選択チャレンジの結果分析」神経情報処理システムの進歩2004年。
  171. ^ Lake, BM; Salakhutdinov, R.; Tenenbaum, JB (2015-12-11). 「確率的プログラム誘導による人間レベルの概念学習」. Science . 350 (6266): 1332– 1338. Bibcode :2015Sci...350.1332L. doi : 10.1126/science.aab3050 . ISSN  0036-8075. PMID  26659050.
  172. ^ Lake, Brenden (2019-11-09). 「ワンショット学習のためのOmniglotデータセット」. GitHub . 2019年11月10日閲覧。
  173. ^ LeCun, Yann; et al. (1998). 「文書認識への勾配ベース学習の適用」Proceedings of the IEEE . 86 (11): 2278– 2324. CiteSeerX 10.1.1.32.9552 . doi :10.1109/5.726791. S2CID  14542261. 
  174. ^ Kussul, Ernst; Baidyk, Tatiana (2004). 「MNISTデータベースを用いた手書き数字認識の改良法の検証」Image and Vision Computing . 22 (12): 971– 981. doi :10.1016/j.imavis.2004.03.008.
  175. ^ Xu, Lei; Krzyżak, Adam; Suen, Ching Y. (1992). 「複数の分類器を組み合わせる方法と手書き認識への応用」. IEEE Transactions on Systems, Man, and Cyber​​netics . 22 (3): 418– 435. doi :10.1109/21.155943. hdl :10338.dmlcz/135217.
  176. ^ Alimoglu、Fevzi、他「ペンベースの手書き数字認識のための複数の分類器の組み合わせ」(1996年)。
  177. ^ Tang, E. Ke; et al. (2005). 「関連性重み付けLDAを用いた線形次元削減」.パターン認識. 38 (4): 485– 493. Bibcode :2005PatRe..38..485T. doi :10.1016/j.patcog.2004.09.005. S2CID  10580110.
  178. ^ Hong, Yi, et al. 「分類と次元削減のためのスパース距離メトリックの混合学習」Computer Vision (ICCV)、2011 IEEE International Conference on . IEEE、2011。
  179. ^ Thoma, Martin (2017). 「HASYv2データセット」. arXiv : 1701.08380 [cs.CV].
  180. ^ カルキ、マノハール;劉群。ディビアーノ、ロバート。バス、サイカット。ムコパディヤイ、スープラティク(2018-06-20)。 「ノイズの多い手書きバングラ文字のピクセルレベルの再構成と分類」。arXiv : 1806.08037 [cs.CV]。
  181. ^ Liu, Qun; Collier, Edward; Mukhopadhyay, Supratik (2019). 「PCGAN-CHAR: ノイズの多い手書きベンガル語文字の分類のための漸進的に訓練された分類器生成的敵対的ネットワーク」.未来に向けたデジタル情報の岐路に立つデジタル図書館. コンピュータサイエンス講義ノート. 第11853号. Springer International Publishing. pp.  3– 15. arXiv : 1908.08987 . doi :10.1007/978-3-030-34058-2_1. ISBN 978-3-030-34057-5. S2CID  201665955。
  182. ^ “iSAID”. captain-whu.github.io . 2021年11月30日閲覧
  183. ^ Zamir, Syed & Arora, Aditya & Gupta, Akshita & Khan, Salman & Sun, Guolei & Khan, Fahad & Zhu, Fan & Shao, Ling & Xia, Gui-Song & Bai, Xiang. (2019). iSAID: 航空写真におけるインスタンスセグメンテーションのための大規模データセット. ウェブサイト
  184. ^ Yuan, Jiangye; Gleason, Shaun S.; Cheriyadat, Anil M. (2013). 「航空画像セグメンテーションの体系的ベンチマーク」. IEEE Geoscience and Remote Sensing Letters . 10 (6): 1527– 1531. Bibcode :2013IGRSL..10.1527Y. doi :10.1109/lgrs.2013.2261453. S2CID  629629.
  185. ^ Vatsavai, Ranga Raju. 「オブジェクトベースの画像分類:最新技術と計算上の課題」第2回ACM SIGSPATIAL国際ワークショップ「ビッグ地理空間データのための分析」議事録。ACM、2013年。
  186. ^ Butenuth, Matthias, et al. 「群衆分析のための歩行者シミュレーション、追跡、イベント検出の統合」Computer Vision Workshops (ICCV Workshops)、2011 IEEE International Conference on . IEEE、2011。
  187. ^ Fradi、Hajer、Jean-Luc Dugelay。「フレーム単位の正規化特徴を用いた低レベル群衆分析による人数カウント」Information Forensics and Security (WIFS)、2012 IEEE国際ワークショップ。IEEE、2012年。
  188. ^ ジョンソン、ブライアン・アラン、立石龍太郎、グエン・タン・ホアン。「ハイブリッド・パンシャープン手法とマルチスケール・オブジェクトベース画像解析による、病変のある松とオークの樹木のマッピング」国際リモートセンシング誌34.20 (2013): 6969–6982。
  189. ^ Mohd Pozi, Muhammad Syafiq; Sulaiman, Md Nasir; Mustapha, Norwati; Perumal, Thinagaran (2015). 「遺伝的プログラミングとサポートベクターマシンを用いたクラス不均衡データセットの新しい分類モデル:萎凋病分類の事例研究」. Remote Sensing Letters . 6 (7): 568– 577. Bibcode :2015RSL.....6..568M. doi :10.1080/2150704X.2015.1062159. S2CID  58788630.
  190. ^ Gallego, A.-J.; Pertusa, A.; Gil, P.「畳み込みニューラルネットワークによる光学航空画像からの船舶の自動分類」リモートセンシング. 2018; 10(4):511.
  191. ^ Gallego, A.-J.; Pertusa, A.; Gil, P.「MAritime SATellite Imagery dataset」 出典: https://www.iuii.ua.es/datasets/masati/, 2018.
  192. ^ ジョンソン, ブライアン; 立石 龍太郎; 謝 志暁 (2012). 「画像分類における地理的に重み付けされた変数の利用」.リモートセンシングレター. 3 (6): 491– 499. Bibcode :2012RSL.....3..491J. doi :10.1080/01431161.2011.629637. S2CID  122543681.
  193. ^ Chatterjee, Sankhadeep, et al. 「森林タイプ分類:ハイブリッドNN-GAモデルベースアプローチ」『情報システム設計とインテリジェントアプリケーション』Springer India, 2016年、227-236ページ。
  194. ^ Diegert, Carl. 「形状の意味論を用いた物体追跡のための組み合わせ的手法」応用画像パターン認識ワークショップ (AIPR)、2010 IEEE 第39回。IEEE、2010年。
  195. ^ Razakarivony, Sebastien, Frédéric Jurie. 「前景と背景の多様体を組み合わせた小型ターゲット検出」IAPR 国際機械視覚応用会議2013年。
  196. ^ “SpaceNet”. explore.digitalglobe.com . 2018年3月13日時点のオリジナルよりアーカイブ。 2018年3月13日閲覧
  197. ^ Etten, Adam Van (2017年1月5日). 「SpaceNetデータ入門」The DownLinQ . 2018年3月13日閲覧
  198. ^ Vakalopoulou, M.; Bus, N.; Karantzalosa, K.; Paragios, N. (2017年7月). 「エッジ/境界事前分布と分類スコアの統合による超高解像度データにおける建物検出」. 2017 IEEE 国際地球科学およびリモートセンシングシンポジウム (IGARSS) . pp.  3309– 3312. doi :10.1109/IGARSS.2017.8127705. ISBN 978-1-5090-4951-6. S2CID  8297433。
  199. ^ Yang, Yi; Newsam, Shawn (2010). 「土地利用分類のためのBag-of-visual-wordsと空間拡張」.第18回SIGSPATIAL国際地理情報システムの進歩に関する会議議事録. ニューヨーク、ニューヨーク、米国: ACM Press. pp.  270– 279. doi :10.1145/1869790.1869829. ISBN 978-1-4503-0428-3. S2CID  993769。
  200. ^ ab バス、サイカット;ガングリー、サングラム。ムコパディヤイ、スープラティク。ディビアーノ、ロバート。カルキ、マノハール。ネマニ、ラーマクリシュナ (2015-11-03)。 「DeepSat: 衛星画像の学習フレームワーク」。地理情報システムの進歩に関する第 23 回 SIGSPATIAL 国際会議の議事録。 ACM。 pp.  1–10 .土井:10.1145/2820783.2820816。ISBN 978-1-4503-3967-4. S2CID  4387134。
  201. ^ ab 劉、群;バス、サイカット。ガングリー、サングラム。ムコパディヤイ、スープラティク。ディビアーノ、ロバート。カルキ、マノハール。ネマニ、ラーマクリシュナ (2019-11-21)。 「DeepSat V2: 衛星画像分類のための強化された畳み込みニューラル ネットワークを備えています」。リモートセンシングレター11 (2): 156–165 . arXiv : 1911.07747土井:10.1080/2150704x.2019.1693071。ISSN  2150-704X。S2CID  208138097。
  202. ^ Md Jahidul Islam他「水中画像のセマンティックセグメンテーション:データセットとベンチマーク」2020 IEEE/RSJ 国際知能ロボット・システム会議(IROS)。IEEE、2020年。
  203. ^ Waszak他「船舶水中検査におけるセマンティックセグメンテーション:ベンチマークとデータセット」IEEE Journal of Oceanic Engineering IEEE、2022年。
  204. ^ 「True Color Kodak Images」. r0k.us . 2025年2月27日閲覧
  205. ^ エバディ、アシュカン;ポール、パトリック。アウアー、ソフィア。トレンブレイ、ステファン(2021-11-12)。 「NRC-GAMMA: 新しい大型ガスメーター画像データセットの紹介」。arXiv : 2111.06827 [cs.CV]。
  206. ^ カナダ、カナダ政府国立研究会議 (2021). 「ガスメーター画像データセット (NRC-GAMMA) - NRCデジタルリポジトリ」nrc-digital-repository.canada.ca . doi :10.4224/3c8s-z290 . 2021年12月2日閲覧
  207. ^ Rabah, Chaima Ben; Coatrieux, Gouenou; Abdelfattah, Riadh (2020年10月). 「デジタル画像フォレンジックのためのSupatlantiqueスキャン文書データベース」. 2020 IEEE International Conference on Image Processing (ICIP) . IEEE. pp.  2096– 2100. doi :10.1109/icip40778.2020.9190665. ISBN 978-1-7281-6395-6. S2CID  224881147。
  208. ^ Mills, Kyle; Tamblyn, Isaac (2018-05-16). 「Big graphene data」. カナダ国立研究評議会. doi :10.4224/c8sc04578j.data. {{cite web}}:欠落または空|url=(ヘルプ)
  209. ^ Mills, Kyle; Spanner, Michael; Tamblyn, Isaac (2018-05-16). 「量子シミュレーション」. 2次元ポテンシャル井戸内の電子の量子シミュレーション. カナダ国立研究会議. doi :10.4224/PhysRevA.96.042113.data.
  210. ^ Rohrbach, M.; Amin, S.; Andriluka, M.; Schiele, B. (2012). 「調理動作のきめ細かな動作検出のためのデータベース」. 2012 IEEE Con​​ference on Computer Vision and Pattern Recognition . IEEE. pp.  1194– 1201. doi :10.1109/cvpr.2012.6247801. ISBN 978-1-4673-1228-8
  211. ^ クエネ、ヒルデ、アリ・アルスラン、トーマス・セール。「行動の言語:目標指向的な人間活動の構文と意味の復元」IEEEコンピュータビジョンおよびパターン認識会議議事録。2014年。
  212. ^ Sviatoslav, Voloshynovskiy他「物理的に複製不可能な機能に基づく認証における再現可能な結果の実現に向けて:フォレンジック認証マイクロストラクチャ光学セット(FAMOS)」IEEE国際情報フォレンジック・セキュリティワークショップ議事録。2012年。
  213. ^ Olga, Taran、Shideh, Rezaeifar、他「PharmaPack:医薬品パッケージのモバイルきめ細かな認識」欧州信号処理会議(EUSIPCO)講演論文集、2017年。
  214. ^ Khosla, Aditya, et al. 「細粒度画像分類のための新たなデータセット:スタンフォード大学の犬」CVPR Fine-Grained Visual Categorization (FGVC) ワークショップ議事録。2011年。
  215. ^ ab Parkhi, Omkar M., et al. 「猫と犬」。コンピュータビジョンとパターン認識(CVPR)、2012 IEEE Con​​ference on。IEEE、2012年。
  216. ^ ビッグス, ベンジャミン; ボイン, オリバー; チャールズ, ジェームズ; フィッツギボン, アンドリュー; チポラ, ロベルト (2020).コンピュータビジョン – ECCV 2020 . コンピュータサイエンス講義ノート. 第12356巻. arXiv : 2007.11110 . doi :10.1007/978-3-030-58621-8. ISBN 978-3-030-58620-1. S2CID  227173931。
  217. ^ Razavian, Ali他「CNNの既成機能:認識のための驚異的なベースライン」IEEEコンピュータビジョンおよびパターン認識ワークショップ会議論文集。2014年。
  218. ^ Ortega, Michael; et al. (1998). 「MARSにおけるランク付けされたブール類似度クエリのサポート」IEEE Transactions on Knowledge and Data Engineering . 10 (6): 905– 925. CiteSeerX 10.1.1.36.6079 . doi :10.1109/69.738357. 
  219. ^ He, Xuming, Richard S. Zemel, Miguel Á. Carreira-Perpiñán. 「画像ラベル付けのためのマルチスケール条件付きランダムフィールド[リンク切れ]。」コンピュータビジョンとパターン認識、2004年。CVPR 2004。2004年IEEEコンピュータソサエティ会議論文集。第2巻。IEEE、2004年。
  220. ^ Deneke, Tewodros, et al. 「プロアクティブな負荷分散のためのビデオトランスコーディング時間予測」マルチメディア・アンド・エキスポ(ICME)、2014 IEEE国際会議。IEEE、2014年。
  221. ^ Ting-Hao (Kenneth) Huang、Francis Ferraro、Nasrin Mostafazadeh、Ishan Misra、Aishwarya Agrawal、Jacob Devlin、Ross Girshick、Xiaodong He、Pushmeet Kohli、Dhruv Batra、C. Lawrence Zitnick、Devi Parikh、Lucy Vanderwende、Michel Galley、Margaret Mitchell (2016年4月13日). 「ビジュアル・ストーリーテリング」. arXiv : 1604.03968 [cs.CL].{{cite arXiv}}: CS1 maint: multiple names: authors list (link)
  222. ^ Wah, Catherine, et al. 「Caltech-UCSD birds-200-2011データセット」(2011年)。
  223. ^ Duan, Kun他「きめ細かな認識のための局所属性の発見」コンピュータビジョンとパターン認識(CVPR)、2012 IEEEカンファレンス。IEEE、2012年。
  224. ^ 「YouTube-8Mデータセット」research.google.com . 2016年10月1日閲覧
  225. ^ アブ・エル・ハイジャ、サーミ;コタリ、ニサルグ。イ・ジュンソク。ナツェフ、ポール。トデリシ、ジョージ。バラダラジャン、バラクリシュナン。ヴィジャヤナラシンハン、スディーンドラ(2016年9月27日)。 「YouTube-8M: 大規模なビデオ分類ベンチマーク」。arXiv : 1609.08675 [cs.CV]。
  226. ^ "YFCC100Mデータセット". mmcommons.org . Yahoo-ICSI-LLNL . 2017年6月1日閲覧
  227. ^ バート・トーメ;デビッド・A・シャンマ。ジェラルド・フリードランド。ベンジャミン・エリザルデ。カール・ニー;ダグラス ポーランド;ダミアン・ボース;リー・ジア・リー(2016年4月25日)。 「Yfcc100m: マルチメディア研究における新しいデータ」。ACM の通信59 (2): 64–73 . arXiv : 1503.01817土井:10.1145/2812802。S2CID  207230134。
  228. ^ Y. Baveye、E. Dellandrea、C. Chamaret、L. Chen、「LIRIS-ACCEDE: 感情コンテンツ分析のためのビデオデータベース」、IEEE Transactions on Affective Computing、2015 年。
  229. ^ Y. Baveye、E. Dellandrea、C. Chamaret、L. Chen、「ディープラーニングとカーネル法: ビデオにおける感情予測のパフォーマンス」、2015 年ヒューメイン協会感情コンピューティングおよびインテリジェントインタラクション会議 (ACII)、2015 年。
  230. ^ M. Sjöberg、Y. Baveye、H. Wang、VL Quang、B. Ionescu、E. Dellandréa、M. Schedl、C.-H. Demarty、およびL. Chen、「The medieval 2015 affective impact of movies task」、MediaEval 2015 ワークショップ、2015 年。
  231. ^ S. JohnsonとM. Everingham、「人間の姿勢推定のためのクラスター化ポーズと非線形外観モデル」、 Wayback Machineで2021年11月4日にアーカイブ、第21回英国マシンビジョン会議(BMVC2010)の議事録
  232. ^ S. JohnsonとM. Everingham、「不正確な注釈から効果的な人間の姿勢推定を学習する」、2021年11月4日にWayback Machineにアーカイブ、IEEE Computer Vision and Pattern Recognition Conference (CVPR2011)の議事録
  233. ^ Afifi, Mahmoud; Hussain, Khaled F. (2017-11-02). 「画像分類技術を用いた多肢選択式テストにおける柔軟性の向上の実現」arXiv : 1711.00972 [cs.CV].
  234. ^ 「MCQデータセット」. sites.google.com . 2017年11月18日閲覧。
  235. ^ Taj-Eddin, IATF; Afifi, M.; Korashy, M.; Hamdy, D.; Nasser, M.; Derbaz, S. (2016年7月). 「監視ビデオのための新しい圧縮技術:新しいデータセットを用いた評価」. 2016年 第6回デジタル情報通信技術とその応用に関する国際会議 (DICTAP) . pp.  159– 164. doi :10.1109/DICTAP.2016.7544020. ISBN 978-1-4673-9609-7. S2CID  8698850。
  236. ^ Tabak, Michael A.; Norouzzadeh, Mohammad S.; Wolfson, David W.; Sweeney, Steven J.; Vercauteren, Kurt C.; Snow, Nathan P.; Halseth, Joseph M.; Di Salvo, Paul A.; Lewis, Jesse S.; White, Michael D.; Teton, Ben; Beasley, James C.; Schlichting, Peter E.; Boughton, Raoul K.; Wight, Bethany; Newkirk, Eric S.; Ivan, Jacob S.; Odell, Eric A.; Brook, Ryan K.; Lukacs, Paul M.; Moeller, Anna K.; Mandeville, Elizabeth G.; Clune, Jeff; Miller, Ryan S.; Photopoulou, Theoni (2018). 「機械学習によるカメラトラップ画像内の動物種の分類:生態学への応用」『生態学と進化の方法10 (4): 585– 590. doi : 10.1111/2041-210X.13120 . ISSN  2041-210X.
  237. ^ Taj-Eddin, Islam ATF; Afifi, Mahmoud; Korashy, Mostafa; Ahmed, Ali H.; Ng, Yoke Cheng; Hernandez, Evelyng; Abdel-Latif, Salma M. (2017年11月). 「光合成は見えるか?オイラービデオ拡大法を用いた植物の緑葉の微細な色変化の拡大」. Journal of Electronic Imaging . 26 (6) 060501. arXiv : 1706.03867 . Bibcode :2017JEI....26f0501T. doi :10.1117/1.jei.26.6.060501. ISSN  1017-9909. S2CID  12367169.
  238. ^ 「数学のミーム」.
  239. ^ Karras, Tero; Laine, Samuli; Aila, Timo (2019年6月). 「生成的敵対ネットワークのためのスタイルベースのジェネレータアーキテクチャ」. 2019 IEEE/CVF コンピュータビジョンとパターン認識会議 (CVPR) . IEEE. pp.  4396– 4405. arXiv : 1812.04948 . doi :10.1109/cvpr.2019.00453. ISBN 978-1-7281-3293-8. S2CID  54482423。
  240. ^ オルティアン、ミハイ (2017). 「Fruits-360 データセット」。GitHub
Retrieved from "https://en.wikipedia.org/w/index.php?title=List_of_datasets_in_computer_vision_and_image_processing&oldid=1324240644#Object_detection_and_recognition_for_autonomous_vehicles"