訂正:ローカルLLM比較の採点ミスと、いま勧める使い方
以前のローカルLLM比較には、正解条件・得点の尺度・最終回答の判定に誤りがありました。旧ランキングと、それに基づくローカル/クラウドの優劣の断定を撤回します。いま勧めるのは、モデルへの前置きに頼るより、計算とデータ保持を外部で確かめる使い方です。
いまは、電卓とJSONの保持チェックから
JSONを整形・修復するときも、ID・数値・文字列などが勝手に変わっていないかを確認します。検証に失敗した出力をそのまま採用せず、入力と照合して直します。クラウドモデルで同じ検証方式がどれだけ改善するかは未検証で、あらゆる用途での正答を保証するものではありません。
訂正1:「最長を1つ選べ」は、同率の片方でよい
旧記事は、次の英文から「最も長い単語を1つだけ選べ」という指示を、最長が一意であるという前提だと誤解していました。
The extraordinarily complicated synchronization failed.
extraordinarily と synchronization はどちらも15文字です。同率でも、どちらか1つを選べば選択として正解です。「同率だから選べない」と指摘することを必須にした採点が誤りでした。文字数を16文字と説明した場合の誤りは、単語の選択とは分けて評価する必要があります。
訂正2:得点の尺度と、最終回答の有無を混同した
3問中2問正解なら、1問1点では2/3、1問2点の尺度にそろえるなら4/6です。旧記事の「2/6」は分子と分母の尺度が混ざった誤表記でした。これは尺度の説明であり、個々のモデルの訂正後得点を示すものではありません。
また、思考がループして最終回答が出なかった出力は無効(最終回答なし)です。思考中に正解らしい語があっても、完成した正答として数えられません。正解条件と最終回答をそろえた再評価が必要なため、ここでモデル別の得点を付け直すことはしません。
以上から、旧得点表・ランキング・偏差値による位置づけを撤回します。この比較からローカルとクラウドの優劣は判断できません。
訂正3:プロンプトと量子化の効果は、この数字では言えない
旧追記の「前提を疑え」で15/21→18/21という集計にも、誤った正解条件が含まれます。この差を改善効果の証拠にはできません。「両方で効いた」「短くすると考える時間が削られて正答率が落ちる」といった効果・原因の断定も撤回します。
「量子化してローカルに載せた瞬間に注意深さが落ちる」という説明も撤回します。量子化以外の条件をそろえた対照比較をしておらず、量子化による性能低下は未測定です。
記録の扱いと、使い分けの考え方
今回の訂正では、過去の生回答・実行ログ・旧集計は書き換えていません。旧集計は当時の記録であり、有効な比較結果として引用しないでください。旧記事にあった生回答JSONの公開リンクは、閲覧できることを保証できないため外しました。
ローカルかクラウドかは、データの扱い・実行環境・費用と、実際の用途での検証結果から選びます。「ローカルは下書き、クラウドなら正しい仕上げ」という旧推奨は撤回します。どちらを使う場合も、まずは計算結果とJSONの値を確かめるところから始めてください。