MIRU2026 若手プログラム|データセット構築研究

採択される
データセット論文を書くために

トップカンファレンスで発表されたデータセット論文とOpenReviewの査読内容を分析し, 採択される論文に共通する特徴を,データセットの「構築前」「構築中」「構築後」の観点から整理しました.

Overview

調査概要

データセット論文は,単に新しいデータを公開するだけでは採択されません. 本調査では,査読者が何を評価し,どこを問題視しているのかを定量・定性の両面から調べました.

調査目的

トップカンファレンスで発表されたデータセット論文を分析し,採択される論文の特徴を明らかにします.

調査方法

NeurIPSのOpenReviewで評価された項目を集計するとともに,論文を「構築前」「構築中」「構築後」の3段階から分析し, 各段階で重視される記載内容を整理しました.

調査結果

データセットの新規性だけでなく,評価実験の厳密さ,公開性,アノテーション品質など, データセット全体の作り込みが採否を左右することが分かりました.

NeurIPS Datasets & Benchmarks Track 2024–2025

OpenReviewの統計分析

NeurIPS Datasets & Benchmarks TrackのOpenReviewを対象に,採択論文で肯定的に評価された要素, 新手法の有無,発表区分ごとの評価傾向を集計しました.

1,117 分析対象論文
956 採択論文
4,246 査読レポート件数

1.採択の決め手:新規性「だけ」では通らない

各割合は,採択論文の査読において,該当要素が肯定的に評価された割合です.

新規性
評価実験の厳密さ
データセットの公開
実有用性
データセットの規模
アノテーション品質

この結果から分かったこと

新規性は最も多く評価されており,採択の土台となる重要な要素です. しかし,評価実験の厳密さ,データセットを公開しているか,実有用性,規模,アノテーション品質も幅広く評価されています. したがって,独自性のあるデータを提示するだけでは不十分であり,厳密な検証と第三者が利用・再現できる形での公開を組み合わせることが重要です.

2.データセットのみを提案 or 新手法も含めて提案

新手法も提案した論文と,データセットのみを主貢献とする論文を比較しています.

手法も提案した論文の割合

採択 956本
31%
不採択(公開情報のみ)
30%

Spotlight/Oral採択率

手法あり
13.8%
データセットのみ
13.4%

肯定的なコメント

手法あり
73%
データセットのみ
63%

批判的なコメント

手法あり
75%
データセットのみ
66%

この結果から分かったこと

新手法を含む論文の割合は,採択論文と不採択論文でほぼ同じでした. また,Spotlight・Oralへの採択率にも大きな差はありません. 手法を含んだ論文は新規性や方法論として評価されやすくなる一方で,その妥当性に対する批判も増えるため,利点とリスクが相殺されていると考えられます. データセット論文に手法を追加する場合は,データセット部分の貢献を手法提案部分が相殺しないようにする必要があります.

3.PosterからSpotlight/Oralへ:上位は「作り込みの深さ」で差がつく

各割合は,それぞれの発表区分において,該当要素が肯定的に評価された割合です.

Poster Spotlight Oral

新規性

Poster59%
Spotlight58%
Oral50%

評価の厳密さ

Poster45%
Spotlight57%
Oral56%

アノテーション品質

Poster24%
Spotlight23%
Oral44%

この結果から分かったこと

新規性はすべての発表区分で高く評価されていますが,PosterからOralに進むほど割合が上がるわけではなく,上位発表を分ける決定的な要素とは言い切れません. 一方,評価の厳密さはSpotlight・Oralで高く,アノテーション品質はOralで大きく上昇しています. つまり,上位発表を目指すには,データセットの新しさに加えて,評価設計とアノテーション工程をどこまで丁寧に作り込んだかが重要だと考えられます.

解釈上の注意: 本分析はOpenReview上の記述を集計したものであり,各要素と採否の因果関係を直接証明するものではありません. 査読でどのような特徴が評価される傾向にあるかを把握するための結果としてご覧ください.
Before / During / After

データセット論文を作り込む3つの段階

採択されるデータセット論文を書くためには,データセットを提示するだけでなく, 構築前の問題設定から構築後の公開・利用までを一貫して設計する必要があります.

1

構築前:必要性を明確化する

  • 従来手法の性能上の限界を示す.
  • 既存データセットの収集・撮像・アノテーション上の問題を示す.
  • データ数,カテゴリ,環境などの不足を具体的に示す.
2

構築中:再現性と品質を示す

  • 本文には収集・アノテーション方法の要点を書く.
  • Supplementary Materialには詳細設定や実装条件を書く.
  • 使用したツール,作業者,パイプライン,品質評価の方法を明示する.
3

構築後:分析し,利用へつなげる

  • データ例,分布,多様性,メタデータを分析する.
  • 既存データセットと規模・品質・タスクを比較する.
  • プロジェクトページ,導入手順,サンプルコードを整備する.
Literature Survey

データセット論文の文献リスト

本チームでは,CVPRなどの国際会議で発表されたデータセット論文を分担して精読し,定性的な分析を行った. 精読した論文を,タイトル,著者,会議名,発行年,データの種類,タスク,URL,得られた知見の観点から整理します. 文献リストはキーワード検索と複数条件の組合せによる絞り込みが可能です.

タイトル 著者 会議名 発行年 データの種類 タスク URL 分かりやすい点
条件に一致する文献がありません.
Poster

発表ポスター

MIRU2026 若手プログラムで作成したポスターを,ブラウザ上で閲覧またはPDFとして開くことができます.

このブラウザではPDFを埋め込み表示できません. ポスターPDFを開いてください.

Updates

更新履歴

  •  プロジェクトページを作成し,OpenReview分析,文献検索機能,ポスターPDFを追加.