質問するログイン新規登録

Q&A

解決済

3回答

509閲覧

手書き数字認識の課題について質問です・

flancflt

総合スコア1

scikit-learn

scikit-learnは、Pythonで使用できるオープンソースプロジェクトの機械学習用ライブラリです。多くの機械学習アルゴリズムが実装されていますが、どのアルゴリズムも同じような書き方で利用できます。

画像認識

画像認識は、コンピュータビジョン分野の「画像認識」に関する技術(CNN、YOLO、OpenCVなど)の紹介や実装方法に使われます。

機械学習

機械学習は、データからパターンを自動的に発見し、そこから知能的な判断を下すためのコンピューターアルゴリズムを指します。人工知能における課題のひとつです。

0グッド

1クリップ

投稿2026/07/19 05:49

0

1

実現したいこと

現在、手書き数字認識の課題に取り組んでいます。

条件は以下のとおりです。

データセット:scikit-learn の Digits(8×8画像)

対象クラス:2、3、4 の3クラス分類

学習時:各ラベルにつき訓練画像を1枚のみ使用(合計3枚)

テスト時:追加学習は行わない

テスト画像の予測ラベルを正解ラベルとして利用しない(自己学習・半教師あり学習は禁止)

この条件で、95%以上の認識精度を達成できるアルゴリズムは存在するのでしょうか。

発生している問題・分からないこと

一般的な機械学習アルゴリズム(k-NN、SVM、Random Forest、ニューラルネットなど)では、

各クラス1枚だけの学習では95%以上はかなり難しいという認識です。

もし95%以上を達成できる手法がある場合は、

どのようなアルゴリズムを使用するのか

特徴量抽出や前処理を含めて実現可能なのか

この条件下で実際に95%以上を達成した事例があるのか

について教えていただきたいです。

該当のソースコード

特になし

試したこと・調べたこと

  • teratailやGoogle等で検索した
  • ソースコードを自分なりに変更した
  • 知人に聞いた
  • その他
上記の詳細・結果

「各クラス1枚だけ学習という条件では、95%以上を安定して達成できるアルゴリズムは、一般的
にはない!」という趣旨の回答を大学の先生から頂きました。私は、運が良いきれいな3枚を選べばできると思うのですが、実際のところを教えてください。

補足

特になし

気になる質問をクリップする

クリップした質問は、後からいつでもMYページで確認できます。

またクリップした質問に回答があった際、通知やメールを受け取ることができます。

fana

2026/07/19 07:07

>運が良いきれいな3枚を選べばできると思う ってどういう意味ですか? (アルゴリズムではなくて教師データ次第だと言っている?)
meg_

2026/07/20 13:45

> 現在、手書き数字認識の課題に取り組んでいます。 > 私は、運が良いきれいな3枚を選べばできると思うのですが 実際にやってみれば良いのではないですか?「きれいな3枚を選」ぶという点でアルゴリズムの性能を証明するものにはならないと思いますが、jackさんの仮説が正しいかどうか実験すれば良いかと思います。
guest

回答3

0

https://arxiv.org/abs/2201.08815

ハイパーパラメータと1-shot の事例の選び方次第で、3クラス問題ならaccuracy95%は超えられそう(Claude Codeで実装させたら95%超えるハイパラと教師は見つかった。実装の中身見てないので「超えられそう」で)


それはそれとして、
先生は「95%以上を安定して達成できるアルゴリズム、一般的にはない」と言っていて、それに対して「運が良いきれいな3枚を選べばできる」はなんの反論にもならないでしょう。「安定してない」と自ら言っているようなものなので。
「運が良いきれいな3枚を選べばできる」には研究的価値はありませんし。

投稿2026/07/21 06:17

編集2026/07/21 06:37
quickquip

総合スコア11377

flancflt

2026/07/22 01:52

自分が何を理解できていなかったのか、そして何が問題だったのかを改めて気づかされました。 また、自分の考えの浅さも痛感しました。 ありがとうございました。
guest

0

入力画像に,てきとーな自由度の変換処理(アフィン変換みたいな)を施すことを考える.
各教師画像との相関(何らかの意味で)が最大になるような変換パラメータを見つける(:最適化計算).
で,それらの結果のうち,最も相関が大きいやつを選び,それを分類結果とする.

……みたいなのでも,そこそこいけないですかね?

例えば,教師画像を距離画像変換とかしとけばどうかな.
そしたら,手書き入力の「2」を構成する画素群の(座標変換後の)位置における距離値が小さくなる方向に変換パラメータを最適化していけば,なんかそれっぽいことにならんかな?

文字の種類が多ければ「何言ってんの? そんなのでやれるわけないじゃん」って一蹴されそうだけど,
「{2,3,4} のいずれかに分類する」ってだけの話ならば通用するかもしれん.
(全く機械学習方面の話ではなくなるけど)

投稿2026/07/21 04:28

編集2026/07/21 04:30
fana

総合スコア12464

flancflt

2026/07/22 01:59

ご回答ありがとうございます。 「{2,3,4} のいずれかに分類する」程度であれば通用するかもしれない、というお話はとても興味深かったです。 例えば、2と3のように形状が似ているものは難しそうですが、4については、fanaさんがおっしゃっていた手法でも比較的うまく分類できる可能性があるのかな、と感じました。 こうしていろいろな視点から考えてみると、本当に面白いですね。とても勉強になりました。ありがとうございました。
guest

0

ベストアンサー

正直自分で書いた手書きメモでさえ自分が読めないことがあるので、95%の条件をみたすアルゴリズムを開発することは不可能だと思います。
そして数字というのは10個しかないのでそれを手書きで入力して識別させること自体があまり意味がありません。研究対象としては面白いかもしれませんが、たとえばアルファベットなら前後のつながりで補正ができますが数字にはそれがないためアプローチの仕方も書かれた結果だけで判断が必要です。課題が多い割に成果が低いので電子入力における数値入力は自然と一覧からの選択がベストプラクティスとされています

投稿2026/07/21 02:24

yambejp

総合スコア118584

fana

2026/07/21 04:41

「アルゴリズムの性能」を言う際の「95%」みたいなのって,これどうやって 計測?/評価? をした結果として言うんだろう? (自分で読めないレベルのものを評価データに含めればそれだけ性能評価値は下がりそうな気がしますし…?)
flancflt

2026/07/22 02:06

yambejpさん、 実務的な立場からのご指摘、ありがとうございます。 確かにおっしゃる通りで、実際の運用を考えると、認識率だけでは評価できない点が多いのだと改めて感じました。 また、fanaさんがおっしゃっていた >「『アルゴリズムの性能』を言う際の『95%』みたいなのって、これどうやって計測・評価した結果として言うんだろう?」 というコメントも印象に残りました。 振り返ると、自分の実験条件や評価方法を十分に詰め切れておらず、「95%」という数字だけを根拠なく前提にして話を進めてしまっていました。評価データをどう用意するのか、誰が正解を決めるのか、どのような条件で測定するのかといった点まで考えられておらず、自分の詰めの甘さを痛感しています。 今回いただいたコメントのおかげで、アルゴリズムそのものだけでなく、「どのような条件で性能を評価するのか」まで含めて考えることの重要性に気づくことができました。ありがとうございました。
yambejp

2026/07/22 02:27

補足になりますが、おそらくやりたいことはOCR(光学文字認識)処理のようなものでしょう https://ja.wikipedia.org/wiki/%E5%85%89%E5%AD%A6%E6%96%87%E5%AD%97%E8%AA%8D%E8%AD%98 ただ端末での文字入力はBOTによる攻撃を弾くためにreCAPTCHAなど「認識できない」ことの方が重要になっています。 https://ja.wikipedia.org/wiki/ReCAPTCHA 逆にreCAPTCHAが有効であるということはPCの識字は限界があるということで、識字率はいいとこ50%くらいで満足し、入力後を入力者が訂正する機能をつけていれば十分でしょう。
guest

あなたの回答

tips

太字

斜体

打ち消し線

見出し

引用テキストの挿入

コードの挿入

リンクの挿入

リストの挿入

番号リストの挿入

表の挿入

水平線の挿入

プレビュー

15分調べてもわからないことは
teratailで質問しよう!

ただいまの回答率
85.25%

質問をまとめることで
思考を整理して素早く解決

テンプレート機能で
簡単に質問をまとめる

質問する

関連した質問