文章を「拡散」で高速生成するAIモデル「Mercury 2.5」登場、毎秒1107トークンの高速生成&GPT-5.6 Luna級の性能を100万出力トークン当たり約120円で提供 - GIGAZINE

AI企業のInceptionが2026年9月8日、拡散モデルを使って文章を生成するAIモデル「Mercury 2.5」を発表しました。一般的な大規模言語モデル(LLM)が文章を左から順番に生成するのに対してMercury 2.5は複数のトークンを並行して生成・修正する仕組みを採用しており、毎秒1107トークンを出力できるとのこと。性能はGPT-5.6 LunaのLow設定などに匹敵するとされ、通常料金は100万出力トークン当たり0.75ドル(約120円)です。

AIのInceptionが2026年9月8日、言語モデル「Mercury 2.5」を公開しました。文章を拡散という方式で作るモデルで、公表された速度は毎秒1,107トークンです。
ChatGPTなどを使うと答えは左から1文字ずつ現れるので、人が書く順番と同じに見えます。ところがMercury 2.5は、その順番で書いていません。では、どうやって答えを組み立てているのでしょうか。

この記事の数値はInceptionが2026年9月8日に公開した発表によります。仕組みの説明は同社のMercury紹介ページに記載されたものです。

いまのAIは、左から1語ずつ決めている

広く使われている言語モデルは自己回帰型と呼ばれます。Inceptionはこの方式を「左から右へ、一度に1トークンずつ文章を生成する」と説明しました。トークンとは、単語や文字のかたまりを指す単位です。

この作り方には避けられない性質があり、1トークンを決めるたびに巨大なネットワークを1回動かす必要があります。だから長い文章ほど、決める回数がそのまま時間になります。

しかも、いちど出した語は原則としてそのまま残るのです。前半で書き損じても、そこへ戻って直す手順が用意されていません。

拡散は、ぼんやりした全体から始める

拡散モデルの作り方は逆向きで、Inceptionはこれを「粗いところから細かいところへ」進む生成だと記しました。出発点は言葉ではなく意味を持たないノイズで、そこからノイズ除去と呼ぶ工程を何度か通していきます。

そして1回ごとに全体が少しずつはっきりしていく形は、写真の現像で像が浮かび上がる様子に似ています。

自己回帰型拡散型
書く順番左から右へ1トークンずつ全体を同時に
途中の修正戻って直す手順がない各工程で直せる
決める回数トークンの数だけ必要ノイズ除去の回数だけ
形のないもやが、右へ向かうにつれて整った格子へ変わっていく様子
速いのに、間違いを直せる

速さと正確さはふつう片方を選ぶ関係にありますが、拡散では両方が同じ仕組みから出てきました。Inceptionはこのモデルを「出力を継続的に洗練でき、間違いや幻覚を修正できる」と説明します。

幻覚とは、事実でないことをAIがもっともらしく書いてしまう現象です。これを直せる理由は拡散が全体を何度も見直す構造だからで、1回目の工程で妙な語が入っても、次の工程で置き換えられます。

つまり左から順に書く方式では、この直しができません。書き終えた部分に戻る道が、そもそも設計に入っていないからです。

公表された数字
  • 生成速度は毎秒1,107トークン(広く流通しているNVIDIAのGPU上)
  • 一度に扱える文脈は260,000トークン
  • 前の版のMercury 2から、知能が40%向上
  • 同社の把握する範囲で、これまでで最大の拡散言語モデル

あわせて考える深さを調節できる機能や、複数の道具を同時に呼び出す機能も加わりました。また、決まった形のデータを返す機能も用意されています。

まとめ
  • Inceptionが2026年9月8日、拡散方式の言語モデル「Mercury 2.5」を公開した
  • 広く使われている自己回帰型は左から右へ1トークンずつ生成する
  • 拡散型はノイズから始め、ノイズ除去をくり返して全体を同時に整える
  • 各工程で見直せるため、途中の間違いを直せると説明されている
  • 速度は毎秒1,107トークン、文脈は260,000トークン

同じ結果にたどり着くのに、道順は1つではありません。端から順に積むやり方と、全体をぼんやり置いてから彫っていく拡散のやり方があります。
作文でも下書きを一度ぜんぶ書いてから直す人と、1文ずつ完成させて進む人がいます。あなたはどちらでしょうか。