文章を「拡散」で高速生成するAIモデル「Mercury 2.5」登場、毎秒1107トークンの高速生成&GPT-5.6 Luna級の性能を100万出力トークン当たり約120円で提供 - GIGAZINE
AI企業のInceptionが2026年9月8日、拡散モデルを使って文章を生成するAIモデル「Mercury 2.5」を発表しました。一般的な大規模言語モデル(LLM)が文章を左から順番に生成するのに対してMercury 2.5は複数のトークンを並行して生成・修正する仕組みを採用しており、毎秒1107トークンを出力できるとのこと。性能はGPT-5.6 LunaのLow設定などに匹敵するとされ、通常料金は100万出力トークン当たり0.75ドル(約120円)です。
AIのInceptionが2026年9月8日、言語モデル「Mercury 2.5」を公開しました。文章を拡散という方式で作るモデルで、公表された速度は毎秒1,107トークンです。
ChatGPTなどを使うと答えは左から1文字ずつ現れるので、人が書く順番と同じに見えます。ところがMercury 2.5は、その順番で書いていません。では、どうやって答えを組み立てているのでしょうか。
この記事の数値はInceptionが2026年9月8日に公開した発表によります。仕組みの説明は同社のMercury紹介ページに記載されたものです。
いまのAIは、左から1語ずつ決めている
広く使われている言語モデルは自己回帰型と呼ばれます。Inceptionはこの方式を「左から右へ、一度に1トークンずつ文章を生成する」と説明しました。トークンとは、単語や文字のかたまりを指す単位です。
この作り方には避けられない性質があり、1トークンを決めるたびに巨大なネットワークを1回動かす必要があります。だから長い文章ほど、決める回数がそのまま時間になります。
しかも、いちど出した語は原則としてそのまま残るのです。前半で書き損じても、そこへ戻って直す手順が用意されていません。
拡散は、ぼんやりした全体から始める
拡散モデルの作り方は逆向きで、Inceptionはこれを「粗いところから細かいところへ」進む生成だと記しました。出発点は言葉ではなく意味を持たないノイズで、そこからノイズ除去と呼ぶ工程を何度か通していきます。
そして1回ごとに全体が少しずつはっきりしていく形は、写真の現像で像が浮かび上がる様子に似ています。
| 自己回帰型 | 拡散型 | |
|---|---|---|
| 書く順番 | 左から右へ1トークンずつ | 全体を同時に |
| 途中の修正 | 戻って直す手順がない | 各工程で直せる |
| 決める回数 | トークンの数だけ必要 | ノイズ除去の回数だけ |

速いのに、間違いを直せる
速さと正確さはふつう片方を選ぶ関係にありますが、拡散では両方が同じ仕組みから出てきました。Inceptionはこのモデルを「出力を継続的に洗練でき、間違いや幻覚を修正できる」と説明します。
幻覚とは、事実でないことをAIがもっともらしく書いてしまう現象です。これを直せる理由は拡散が全体を何度も見直す構造だからで、1回目の工程で妙な語が入っても、次の工程で置き換えられます。
つまり左から順に書く方式では、この直しができません。書き終えた部分に戻る道が、そもそも設計に入っていないからです。
公表された数字
- 生成速度は毎秒1,107トークン(広く流通しているNVIDIAのGPU上)
- 一度に扱える文脈は260,000トークン
- 前の版のMercury 2から、知能が40%向上
- 同社の把握する範囲で、これまでで最大の拡散言語モデル
あわせて考える深さを調節できる機能や、複数の道具を同時に呼び出す機能も加わりました。また、決まった形のデータを返す機能も用意されています。
まとめ
- Inceptionが2026年9月8日、拡散方式の言語モデル「Mercury 2.5」を公開した
- 広く使われている自己回帰型は左から右へ1トークンずつ生成する
- 拡散型はノイズから始め、ノイズ除去をくり返して全体を同時に整える
- 各工程で見直せるため、途中の間違いを直せると説明されている
- 速度は毎秒1,107トークン、文脈は260,000トークン
同じ結果にたどり着くのに、道順は1つではありません。端から順に積むやり方と、全体をぼんやり置いてから彫っていく拡散のやり方があります。
作文でも下書きを一度ぜんぶ書いてから直す人と、1文ずつ完成させて進む人がいます。あなたはどちらでしょうか。

