GCP Vision API を gcloud から使ってラベル検出と OCR を試す手順

2026年6月6日

はじめに

「画像に写っているものを自動で識別したい」「画像内の文字をテキストとして抽出したい」——こうした要件を自前でモデルを用意せずに実現できるのが、GCP の Vision API です。本記事では、gcloud SDK 環境から Vision API を使ってラベル検出(物体識別)と文字認識(OCR)を試す手順を解説します。

コマンド 1 行で画像認識が動く体験を通じて、Vision API の概要をつかんでもらえる内容です。

Vision API とは

Vision API は、Google のML(機械学習)技術を活用した画像認識サービスです。大量の画像データから学習済みのモデルを API として提供しているため、独自モデルの準備が不要で手軽に利用できます。主な機能は以下のとおりです。

  • ラベル検出(detect-labels): 画像に写っているものを英語で識別し、信頼スコアとともに返す
  • 文字認識・OCR(detect-text): 画像内のテキストを抽出してテキストデータとして返す
  • その他:顔検出・ランドマーク検出・不適切コンテンツ検出など多数の機能を提供

前提環境

カテゴリツール・技術役割
実行環境gcloud SDK コンテナ(または Cloud Shell)gcloud CLI コマンドの実行環境
GCP サービス(認識実行)Cloud Vision API画像のラベル検出・文字認識を実行
GCP サービス(画像保存)Google Cloud Storage(GCS)認識対象の画像を保存するバケット

Vision API で画像認識を実行する手順

1. Vision API を有効化する

課題:デフォルト状態では Vision API が無効になっている。
解決策:GCP コンソールの「API とサービス」→「ライブラリ」で「Cloud Vision API」を検索して有効化する。

API の有効化手順は前回の記事(Text-to-Speech API)と同じです。検索ボックスに「Vision」と入力し、「Cloud Vision API」を選択して「有効にする」をクリックします。

2. GCS バケットに画像をアップロードする

課題:Vision API に渡す画像を GCS か gcloud 環境のローカルに用意する必要がある。
解決策:GCS バケットを作成して画像をアップロードし、gs:// URI を取得する。

GCP コンソール左側メニューから「Storage」→「ブラウザ」を選択します。

GCP コンソールの Cloud Storage ブラウザ画面

「バケットを作成」をクリックします。

GCS バケット一覧画面と「バケットを作成」ボタン

バケット名(プロジェクト内で一意の名前)を入力し、データの保存先リージョンを選択して「作成」をクリックします。

GCS バケット作成設定画面(名前とリージョン選択)

バケットが作成できたら、認識させたい画像ファイルをアップロードします。

GCS バケットに画像ファイルをアップロードした後の一覧画面

アップロードしたファイルをクリックすると詳細画面に遷移します。「URI」欄に表示されている gs:// から始まるパスをコピーしておきます。このパスを Vision API のコマンドに渡します。

GCS オブジェクト詳細画面で gs:// URI を確認する

3. ラベル検出でオブジェクトを識別する

課題:画像に何が写っているかを自動識別したい。
解決策:gcloud ml vision detect-labels コマンドに GCS の URI を渡すだけで識別できる。

以下のコマンドを実行します。--max-results は返却する候補数の上限です(省略可能)。

gcloud ml vision detect-labels gs://YOUR_BUCKET/YOUR_IMAGE.jpg --max-results=1
gcloud ml vision detect-labels の実行結果(動物の種類が識別された)

レスポンスに含まれる主なパラメータの意味は以下のとおりです。

  • mid: 識別されたオブジェクトのナレッジグラフ ID
  • score: 識別の信頼度(1 に近いほど確信度が高い)
  • topicality: 画像全体との関連度(1 に近いほど画像の主題に関連している)

4. 文字認識(OCR)を実行する

課題:画像内のテキストをデータとして取り出したい。
解決策:gcloud ml vision detect-text コマンドで OCR を実行できる。

文字が含まれる画像を GCS にアップロードして以下を実行します。

OCR テスト用に用意したテキスト入り画像
gcloud ml vision detect-text gs://YOUR_BUCKET/YOUR_TEXT_IMAGE.jpg
gcloud ml vision detect-text の実行結果(画像内テキストが抽出された)

画像内のテキストが正確に抽出されています。日本語・英語混在の画像でも高精度で認識できます。

まとめ:Vision API で画像認識を手軽に実装する方法

本記事で解説した手順をまとめます。

  • GCS バケットに画像をアップロードして gs:// URI を取得するのが最もシンプルな画像準備方法
  • gcloud ml vision detect-labels 1 コマンドで画像内オブジェクトを識別できる
  • レスポンスの scoretopicality で識別の確信度と関連度を確認できる
  • gcloud ml vision detect-text で画像内のテキストを OCR として抽出できる
  • 独自モデルなしで利用できるため、プロトタイプや小規模な用途に即戦力になる

次回は、同じ gcloud 環境から Kubernetes クラスタを起動して基本操作を試す手順を解説します。