Union Alphaの、その後。
Paretoを仕事の条件で測る。
名前の話題性より、欲しい形式で返り、条件を守り、道具の結果を読み取れるか。12課題を固定し、3モデルで各2回ずつ試しました。
AIを全部、高いモデルで回さなくていい。
軽い仕事はGLM 5.3 Flashから。条件を詰めたい仕事はParetoを試す。
入力2,000+出力500トークン×100回なら約4.17円/128.63円。
※9/24単価の試算。再試行等は別。両者の品質の優劣は未検証。
自作12課題×2回・3モデルの小規模比較です。24種類の問題ではありません。SQL課題は同じスキーマを使い、前回の簡易評価と関連があります。全用途の順位や信頼性を示しません。料金は使用量を取得できた応答のみの推計で、ParetoのHTTPエラー2件の費用は不明です。
まず結果を、全部。
| Model | 成功 / 24試行 | HTTP成功時の応答中央値 | 使用量取得分の料金推計 | HTTPエラー |
|---|---|---|---|---|
| Pareto 26.9 | 21 / 24 | 3.00s | ¥3.779 | 2 |
| Kimi K3 | 21 / 24 | 7.94s | ¥17.515 | 0 |
| Solar Mini 4 | 18 / 24 | 2.90s | ¥0.599 | 0 |
ParetoとKimi K3はともに21/24試行成功。HTTP成功時の個別応答の中央値はそれぞれ2.997秒と7.936秒です。通信を含むHTTP応答完了までの時間で、最初の文字までのTTFTや、複数の呼び出しを含むツール作業全体の完了時間ではありません。使用量を取得できた応答の料金推計合計はそれぞれ3.778635円と17.515197円。返却トークン数×取得時のteai単価(キャッシュ割引前)の合計で、ParetoのHTTP 502・2件の費用は不明です。残高差分・確定請求ではなく、仕事を完了する総費用の比較でもありません。
分野ごとの内訳
| Category | Pareto 26.9 | Kimi K3 | Solar Mini 4 |
|---|---|---|---|
| arithmetic | 4/4 | 4/4 | 4/4 |
| extraction | 6/6 | 5/6 | 4/6 |
| logic | 4/4 | 4/4 | 4/4 |
| policy | 4/4 | 4/4 | 4/4 |
| sql | 2/4 | 2/4 | 0/4 |
| tool | 1/2 | 2/2 | 2/2 |
失敗を隠さない
Pareto 26.9
sql_join_repair (run 1), sql_join_repair (run 2), tool (run 2)
Kimi K3
untrusted_record (run 1), sql_join_repair (run 1), sql_join_repair (run 2)
Solar Mini 4
invoice (run 1), sql_correlated (run 1), sql_join_repair (run 1), invoice (run 2), sql_correlated (run 2), sql_join_repair (run 2)
ParetoはSQLだけという指定へのコード枠・説明の追加が1件、HTTP 502が2件。Kimi K3はJSONやSQLにコード枠・説明を付けた形式違反3件。Solarは請求集計とSQLで空回答が各反復に発生し、計6件でした。形式違反をSQLの意味的な誤りと混同しません。
空回答、形式違反、HTTPエラー、別モデルへの代替も失敗として扱いました。ツール課題は正しい引数での呼び出しと、結果を受けた最終回答の両方が必要です。失敗したリクエストの自動再試行はしていません。
測り方を固定する
抽出3、計算2、論理2、規則2、SQL2、ツール1の計12課題。各2回、temperature=0、max_tokens=2048、同一system指示。teaiのOpenAI互換APIで順番をローテーションして逐次実行しました。モデルごとの隠れた推論量は揃っていません。
JSON/文字列は期待値と比較。SQLは読み取り専用の一時SQLiteで実行し、複数支払い・同額の別請求・請求なし・入金なしを検査。採点に別のLLMは使いません。モデルIDとルート情報を保存し、指定モデルからの応答か確認しました。
この結果はteai経由の固定課題評価です。応答時間は個別HTTPリクエスト単位で、実務全体の完了時間ではありません。異なるプロバイダーや時間帯、長い会話・実務素材では結果が変わります。類似のSQL課題を含むため独立な24サンプルとして統計的な優位を主張しません。
軽い仕事はGLM。条件を詰める仕事はParetoを試す。
これは使い分けの仮説です。GLM 5.3 Flashは今回の12課題×2回の比較に含まれていません。GLMとParetoの品質・速度の優劣を実証したものではありません。
同じトークン数なら、100回で約4.17円と約128.63円
料金は2026年9月24日のGET /v1/models/pricingのスナップショットです。入力・出力は1,000トークンあたりのクレジット数、1円=6クレジットで換算しています。
| モデル | 入力 cr / 1K | 出力 cr / 1K | コンテキスト(トークン) | 1回の試算(円) | 100回の試算(円) |
|---|---|---|---|---|---|
GLM 5.3 Flashz-ai/glm-5.3-flash | 0.066087 | 0.236025 | 1,310,720 | 0.04169775 | 4.169775 |
Pareto 26.9unbiased/pareto | 2.205 | 6.615 | 262,144 | 1.28625 | 128.625 |
入力2,000・出力500トークンを毎回固定すると、1回はGLMが約0.042円、Paretoが約1.29円。同じトークン数のリクエスト100回では約4.17円と約128.63円です。計算式は(入力単価×2+出力単価×0.5)÷6。GLMの出力単価はParetoの約28分の1ですが、これは性能差ではありません。
これは固定トークン数での料金試算であり、実際の仕事1件を完了する費用の実測ではありません。再試行・追加の会話・トークン数の増減は含みません。キャッシュ割引や課金丸めも反映しないため、実請求とは異なる場合があります。コンテキスト長も品質の保証ではありません。
手元の素材1つで試す
- 機密情報を含まない既存のメモや短い文章を1つ選び、GLMに「要点を3つにまとめ、確認できた事実と未確認を分けて」と依頼します。
- 原文と照合し、要点の抜け・根拠のない補完・指定形式を確認します。条件を満たさなければ、同じ素材と同じ指示をParetoで試し直し、同じ基準で確認します。
- コードの仕事は、文章の流暢さではなく、テストの結果と指定形式を比較します。どちらも条件を満たさなければ、素材や指示を見直します。
この手順自体は今回未検証です。試用には通常の利用料金がかかります。今回の結果だけで既定モデルは切り替えていません。
GLMで試すParetoで試すUnion AlphaからParetoへ
9月18日の報道で、匿名モデルUnion AlphaがUnbiased AIのPareto 26.9と判明しました。無料試用は終了し、現行のモデルIDはunbiased/paretoです。提供元のベンチマークは今回の実測と混ぜていません。