MEASURED · 2026.09.24

Union Alphaの、その後。
Paretoを仕事の条件で測る。

名前の話題性より、欲しい形式で返り、条件を守り、道具の結果を読み取れるか。12課題を固定し、3モデルで各2回ずつ試しました。

AIを全部、高いモデルで回さなくていい。

軽い仕事はGLM 5.3 Flashから。条件を詰めたい仕事はParetoを試す。

入力2,000+出力500トークン×100回なら約4.17円/128.63円。

※9/24単価の試算。再試行等は別。両者の品質の優劣は未検証。

21/24
Paretoの成功試行
12 × 2
異なる課題数 × 反復
3
比較したモデル

自作12課題×2回・3モデルの小規模比較です。24種類の問題ではありません。SQL課題は同じスキーマを使い、前回の簡易評価と関連があります。全用途の順位や信頼性を示しません。料金は使用量を取得できた応答のみの推計で、ParetoのHTTPエラー2件の費用は不明です。

まず結果を、全部。

Model成功 / 24試行HTTP成功時の応答中央値使用量取得分の料金推計HTTPエラー
Pareto 26.921 / 243.00s¥3.7792
Kimi K321 / 247.94s¥17.5150
Solar Mini 418 / 242.90s¥0.5990

ParetoとKimi K3はともに21/24試行成功。HTTP成功時の個別応答の中央値はそれぞれ2.997秒と7.936秒です。通信を含むHTTP応答完了までの時間で、最初の文字までのTTFTや、複数の呼び出しを含むツール作業全体の完了時間ではありません。使用量を取得できた応答の料金推計合計はそれぞれ3.778635円と17.515197円。返却トークン数×取得時のteai単価(キャッシュ割引前)の合計で、ParetoのHTTP 502・2件の費用は不明です。残高差分・確定請求ではなく、仕事を完了する総費用の比較でもありません。

分野ごとの内訳

CategoryPareto 26.9Kimi K3Solar Mini 4
arithmetic4/44/44/4
extraction6/65/64/6
logic4/44/44/4
policy4/44/44/4
sql2/42/40/4
tool1/22/22/2

失敗を隠さない

Pareto 26.9

sql_join_repair (run 1), sql_join_repair (run 2), tool (run 2)

Kimi K3

untrusted_record (run 1), sql_join_repair (run 1), sql_join_repair (run 2)

Solar Mini 4

invoice (run 1), sql_correlated (run 1), sql_join_repair (run 1), invoice (run 2), sql_correlated (run 2), sql_join_repair (run 2)

ParetoはSQLだけという指定へのコード枠・説明の追加が1件、HTTP 502が2件。Kimi K3はJSONやSQLにコード枠・説明を付けた形式違反3件。Solarは請求集計とSQLで空回答が各反復に発生し、計6件でした。形式違反をSQLの意味的な誤りと混同しません。

空回答、形式違反、HTTPエラー、別モデルへの代替も失敗として扱いました。ツール課題は正しい引数での呼び出しと、結果を受けた最終回答の両方が必要です。失敗したリクエストの自動再試行はしていません。

測り方を固定する

抽出3、計算2、論理2、規則2、SQL2、ツール1の計12課題。各2回、temperature=0、max_tokens=2048、同一system指示。teaiのOpenAI互換APIで順番をローテーションして逐次実行しました。モデルごとの隠れた推論量は揃っていません。

JSON/文字列は期待値と比較。SQLは読み取り専用の一時SQLiteで実行し、複数支払い・同額の別請求・請求なし・入金なしを検査。採点に別のLLMは使いません。モデルIDとルート情報を保存し、指定モデルからの応答か確認しました。

この結果はteai経由の固定課題評価です。応答時間は個別HTTPリクエスト単位で、実務全体の完了時間ではありません。異なるプロバイダーや時間帯、長い会話・実務素材では結果が変わります。類似のSQL課題を含むため独立な24サンプルとして統計的な優位を主張しません。

全課題・生回答・判定・料金スナップショットをダウンロード

軽い仕事はGLM。条件を詰める仕事はParetoを試す。

これは使い分けの仮説です。GLM 5.3 Flashは今回の12課題×2回の比較に含まれていません。GLMとParetoの品質・速度の優劣を実証したものではありません。

同じトークン数なら、100回で約4.17円と約128.63円

料金は2026年9月24日のGET /v1/models/pricingのスナップショットです。入力・出力は1,000トークンあたりのクレジット数、1円=6クレジットで換算しています。

モデル入力 cr / 1K出力 cr / 1Kコンテキスト(トークン)1回の試算(円)100回の試算(円)
GLM 5.3 Flash
z-ai/glm-5.3-flash
0.0660870.2360251,310,7200.041697754.169775
Pareto 26.9
unbiased/pareto
2.2056.615262,1441.28625128.625

入力2,000・出力500トークンを毎回固定すると、1回はGLMが約0.042円、Paretoが約1.29円。同じトークン数のリクエスト100回では約4.17円と約128.63円です。計算式は(入力単価×2+出力単価×0.5)÷6。GLMの出力単価はParetoの約28分の1ですが、これは性能差ではありません。

これは固定トークン数での料金試算であり、実際の仕事1件を完了する費用の実測ではありません。再試行・追加の会話・トークン数の増減は含みません。キャッシュ割引や課金丸めも反映しないため、実請求とは異なる場合があります。コンテキスト長も品質の保証ではありません。

料金の出典:Pricing API

手元の素材1つで試す

  1. 機密情報を含まない既存のメモや短い文章を1つ選び、GLMに「要点を3つにまとめ、確認できた事実と未確認を分けて」と依頼します。
  2. 原文と照合し、要点の抜け・根拠のない補完・指定形式を確認します。条件を満たさなければ、同じ素材と同じ指示をParetoで試し直し、同じ基準で確認します。
  3. コードの仕事は、文章の流暢さではなく、テストの結果と指定形式を比較します。どちらも条件を満たさなければ、素材や指示を見直します。

この手順自体は今回未検証です。試用には通常の利用料金がかかります。今回の結果だけで既定モデルは切り替えていません。

GLMの料金と使い方 · Paretoの料金と使い方

GLMで試すParetoで試す

Union AlphaからParetoへ

9月18日の報道で、匿名モデルUnion AlphaがUnbiased AIのPareto 26.9と判明しました。無料試用は終了し、現行のモデルIDはunbiased/paretoです。提供元のベンチマークは今回の実測と混ぜていません。

Official model card · OpenRouter · GIGAZINE