GCP Vision API を gcloud から使ってラベル検出と OCR を試す手順
目次
はじめに
「画像に写っているものを自動で識別したい」「画像内の文字をテキストとして抽出したい」——こうした要件を自前でモデルを用意せずに実現できるのが、GCP の Vision API です。本記事では、gcloud SDK 環境から Vision API を使ってラベル検出(物体識別)と文字認識(OCR)を試す手順を解説します。
コマンド 1 行で画像認識が動く体験を通じて、Vision API の概要をつかんでもらえる内容です。
Vision API とは
Vision API は、Google のML(機械学習)技術を活用した画像認識サービスです。大量の画像データから学習済みのモデルを API として提供しているため、独自モデルの準備が不要で手軽に利用できます。主な機能は以下のとおりです。
- ラベル検出(detect-labels): 画像に写っているものを英語で識別し、信頼スコアとともに返す
- 文字認識・OCR(detect-text): 画像内のテキストを抽出してテキストデータとして返す
- その他:顔検出・ランドマーク検出・不適切コンテンツ検出など多数の機能を提供
前提環境
| カテゴリ | ツール・技術 | 役割 |
|---|---|---|
| 実行環境 | gcloud SDK コンテナ(または Cloud Shell) | gcloud CLI コマンドの実行環境 |
| GCP サービス(認識実行) | Cloud Vision API | 画像のラベル検出・文字認識を実行 |
| GCP サービス(画像保存) | Google Cloud Storage(GCS) | 認識対象の画像を保存するバケット |
Vision API で画像認識を実行する手順
1. Vision API を有効化する
課題:デフォルト状態では Vision API が無効になっている。
解決策:GCP コンソールの「API とサービス」→「ライブラリ」で「Cloud Vision API」を検索して有効化する。
API の有効化手順は前回の記事(Text-to-Speech API)と同じです。検索ボックスに「Vision」と入力し、「Cloud Vision API」を選択して「有効にする」をクリックします。
2. GCS バケットに画像をアップロードする
課題:Vision API に渡す画像を GCS か gcloud 環境のローカルに用意する必要がある。
解決策:GCS バケットを作成して画像をアップロードし、gs:// URI を取得する。
GCP コンソール左側メニューから「Storage」→「ブラウザ」を選択します。

「バケットを作成」をクリックします。

バケット名(プロジェクト内で一意の名前)を入力し、データの保存先リージョンを選択して「作成」をクリックします。

バケットが作成できたら、認識させたい画像ファイルをアップロードします。

アップロードしたファイルをクリックすると詳細画面に遷移します。「URI」欄に表示されている gs:// から始まるパスをコピーしておきます。このパスを Vision API のコマンドに渡します。

3. ラベル検出でオブジェクトを識別する
課題:画像に何が写っているかを自動識別したい。
解決策:gcloud ml vision detect-labels コマンドに GCS の URI を渡すだけで識別できる。
以下のコマンドを実行します。--max-results は返却する候補数の上限です(省略可能)。
gcloud ml vision detect-labels gs://YOUR_BUCKET/YOUR_IMAGE.jpg --max-results=1

レスポンスに含まれる主なパラメータの意味は以下のとおりです。
- mid: 識別されたオブジェクトのナレッジグラフ ID
- score: 識別の信頼度(1 に近いほど確信度が高い)
- topicality: 画像全体との関連度(1 に近いほど画像の主題に関連している)
4. 文字認識(OCR)を実行する
課題:画像内のテキストをデータとして取り出したい。
解決策:gcloud ml vision detect-text コマンドで OCR を実行できる。
文字が含まれる画像を GCS にアップロードして以下を実行します。

gcloud ml vision detect-text gs://YOUR_BUCKET/YOUR_TEXT_IMAGE.jpg

画像内のテキストが正確に抽出されています。日本語・英語混在の画像でも高精度で認識できます。
まとめ:Vision API で画像認識を手軽に実装する方法
本記事で解説した手順をまとめます。
- GCS バケットに画像をアップロードして
gs://URI を取得するのが最もシンプルな画像準備方法 gcloud ml vision detect-labels1 コマンドで画像内オブジェクトを識別できる- レスポンスの
scoreとtopicalityで識別の確信度と関連度を確認できる gcloud ml vision detect-textで画像内のテキストを OCR として抽出できる- 独自モデルなしで利用できるため、プロトタイプや小規模な用途に即戦力になる
次回は、同じ gcloud 環境から Kubernetes クラスタを起動して基本操作を試す手順を解説します。





ディスカッション
コメント一覧
まだ、コメントがありません