
トークンを理解してカウントする | Gemini API | Google AI for Developers
Gemini API を使用してトークンを理解し、カウントする
AIの速さや料金の話になると、トークンという単位が出てきます。単語や文字のかたまりを指す言い方で、これは間違っていません。
けれどもトークンで数えられるものは、書かれた言葉だけではありませんでした。
拡散する言語モデル:Mercury 2.5は左から順に書かない
AIのInceptionが2026年9月8日、言語モデル「Mercury 2.5」を公開しました。文章を拡散という方式で作るモデルで、公表された速度は毎秒1,107トークンです。ChatGPTなどを使うと答えは左から1文 […]
この記事の定義と数値は、Googleの「トークンを理解してカウントする」から取りました。
1トークンの目安は、英語で4字ぶん
まず大きさから見ていきます。Googleの解説には「1個のトークンは約4文字に相当します」とあります。そして「100個のトークンは約60〜80ワード(英語)に相当します」とも書かれていました。
この目安は英語での話です。100トークンを約400字と見て、単語のあいだの空白まで含めて割ると、たしかに60〜80語あたりに落ち着きます。
切れ目は、字数では決まらない
では4字ごとに区切っているのかというと、そうではありません。同じ解説は「トークンは、zなどの単一の文字、catなどの単語全体にすることができます」と説明しました。
つまり1字で1トークンのこともあれば、3字の単語がまるごと1トークンのこともあります。そして「長い単語は複数のトークンに分割されます」と続きました。
だから区切りの幅はそろっていません。約4字というのは、ならしたときの目安でした。
では、切れ目は何で決まるのでしょうか。モデルは、自分が使うトークンの一覧を持っています。Googleはこの一覧を語彙と呼び、文章をその単位に切り分ける作業をトークン化と呼んでいます。

言葉ではないものも、トークンで数える
ここからが本題で、トークンで数えられるのは書かれた言葉だけではありませんでした。同じ解説には、画像や音声をトークンに置き換えた値が並んでいました。
| 数えるもの | トークン数 |
|---|---|
| 画像(384ピクセル以下) | 258トークン |
| 画像(768×768ピクセルのタイルごと) | 258トークン |
| 動画 | 1秒あたり263トークン |
| 音声 | 1秒あたり32トークン |
小さな写真なら1枚で258トークン、音声を1秒わたすと32トークンとして数えられます。字がひとつも無くても、トークンの数は増えていきます。
しかも画像が大きいときは、768×768ピクセルのタイルに区切って数える決まりです。1枚の写真でも、タイルが増えればそのぶんトークンも積み上がります。

だから「文字のかたまり」では足りない
ここまで来ると、最初の言い方の届く範囲が見えてきました。トークンは文字を数えるものではなく、文章も画像も音も同じ数に置き換えられる単位だったのです。
文章も写真も音も、いったんトークンという同じ数に置き換えられます。だからモデルが一度に扱える量も、この数で決められました。Googleは「各Geminiモデルには、処理できるトークンの最大数がある」と記しています。
この上限は、入力と出力を合わせたトークンの数で決まります。そしてリードで触れた料金も、Gemini APIでは入力と出力のトークンの数で決まる仕組みでした。
まとめ
- 1トークンは英語で約4字、100トークンで約60〜80ワードにあたる
- ただし切れ目はそろっておらず、1字で1トークンのことも、単語まるごと1トークンのこともある
- 切れ目はモデルの語彙で決まる。文章をその単位に切る作業がトークン化
- 長い単語は複数のトークンに分割される
- 画像は258トークン、動画は1秒263トークン、音声は1秒32トークン
- つまりトークンは文字を数えるものではなく、受け取るものを同じ数に置き換える物差し
- 一度に扱える上限も料金も、入力と出力のトークン数で決まる
トークンは、モデルの語彙の単位で文章を切り、画像や音声も同じ数に置き換えた物差しでした。一度に扱える量も料金も、その数で決まります。




