「技術のことば」シリーズのアイキャッチ。マゼンタとシアンの抽象背景に、シリーズ名と用語「トークン」

AIの速さや料金の話になると、トークンという単位が出てきます。単語や文字のかたまりを指す言い方で、これは間違っていません。
けれどもトークンで数えられるものは、書かれた言葉だけではありませんでした。

拡散する言語モデル:Mercury 2.5は左から順に書かない

AIのInceptionが2026年9月8日、言語モデル「Mercury 2.5」を公開しました。文章を拡散という方式で作るモデルで、公表された速度は毎秒1,107トークンです。ChatGPTなどを使うと答えは左から1文 […]

この記事の定義と数値は、Googleの「トークンを理解してカウントする」から取りました。

1トークンの目安は、英語で4字ぶん

まず大きさから見ていきます。Googleの解説には「1個のトークンは約4文字に相当します」とあります。そして「100個のトークンは約60〜80ワード(英語)に相当します」とも書かれていました。

この目安は英語での話です。100トークンを約400字と見て、単語のあいだの空白まで含めて割ると、たしかに60〜80語あたりに落ち着きます。

切れ目は、字数では決まらない

では4字ごとに区切っているのかというと、そうではありません。同じ解説は「トークンは、zなどの単一の文字、catなどの単語全体にすることができます」と説明しました。

つまり1字で1トークンのこともあれば、3字の単語がまるごと1トークンのこともあります。そして「長い単語は複数のトークンに分割されます」と続きました。

だから区切りの幅はそろっていません。約4字というのは、ならしたときの目安でした。

では、切れ目は何で決まるのでしょうか。モデルは、自分が使うトークンの一覧を持っています。Googleはこの一覧を語彙と呼び、文章をその単位に切り分ける作業をトークン化と呼んでいます。

一本の光る帯が、長さの異なる区画に仕切られている。短い区画と長い区画が混ざっている
言葉ではないものも、トークンで数える

ここからが本題で、トークンで数えられるのは書かれた言葉だけではありませんでした。同じ解説には、画像や音声をトークンに置き換えた値が並んでいました。

数えるものトークン数
画像(384ピクセル以下)258トークン
画像(768×768ピクセルのタイルごと)258トークン
動画1秒あたり263トークン
音声1秒あたり32トークン

小さな写真なら1枚で258トークン、音声を1秒わたすと32トークンとして数えられます。字がひとつも無くても、トークンの数は増えていきます。

しかも画像が大きいときは、768×768ピクセルのタイルに区切って数える決まりです。1枚の写真でも、タイルが増えればそのぶんトークンも積み上がります。

記号の帯、写真、音の波形、フィルムの4つが、それぞれ光の線を伝って同じ形の立方体の列へ流れ込んでいる
だから「文字のかたまり」では足りない

ここまで来ると、最初の言い方の届く範囲が見えてきました。トークンは文字を数えるものではなく、文章も画像も音も同じ数に置き換えられる単位だったのです。

文章も写真も音も、いったんトークンという同じ数に置き換えられます。だからモデルが一度に扱える量も、この数で決められました。Googleは「各Geminiモデルには、処理できるトークンの最大数がある」と記しています。

この上限は、入力と出力を合わせたトークンの数で決まります。そしてリードで触れた料金も、Gemini APIでは入力と出力のトークンの数で決まる仕組みでした。

まとめ
  • 1トークンは英語で約4字、100トークンで約60〜80ワードにあたる
  • ただし切れ目はそろっておらず、1字で1トークンのことも、単語まるごと1トークンのこともある
  • 切れ目はモデルの語彙で決まる。文章をその単位に切る作業がトークン化
  • 長い単語は複数のトークンに分割される
  • 画像は258トークン、動画は1秒263トークン、音声は1秒32トークン
  • つまりトークンは文字を数えるものではなく、受け取るものを同じ数に置き換える物差し
  • 一度に扱える上限も料金も、入力と出力のトークン数で決まる

トークンは、モデルの語彙の単位で文章を切り、画像や音声も同じ数に置き換えた物差しでした。一度に扱える量も料金も、その数で決まります。