AIに実務コードを頼んだら、正解でも次の回には答えが返らなかった
小数丸めと区間計算をDeepSeek V4.1 FlashとGPT-6 Astraに各2回。正解・空回答・502を分けて、使える答えが戻るかを測りました。
小数丸めと区間計算をDeepSeek V4.1 FlashとGPT-6 Astraに各2回。正解・空回答・502を分けて、使える答えが戻るかを測りました。
Two runs each of decimal rounding and interval subtraction with DeepSeek V4.1 Flash and GPT-6 Astra. Correct code, empty answers, HTTP 502s and measurement limits.
追加17課題×3回、SQLの8状態検査、形式違反と空回答、初回本文到着を掘り下げる。旧97+追加187応答と測定限界を公開。
17 additional tasks repeated three times, eight SQL fixtures, format errors, empty answers and first-content timing. All 284 recorded responses and measurement limits.
欠測ゼロ補完とX費用倍率を撤回。共通27問の事後参考比較、費用不明3件、停止後の続行を明記しました。計画どおりの成功試験ではなく、順位は断定できません。
Withdrawing zero-imputation and the X cost ratio. A post-hoc common-27 reference comparison, 3 unknown costs and post-halt continuation—not a successful execution of the planned protocol or a definitive ranking.
自作12課題を3モデルで各2回。抽出・計算・SQL・ツール連携の成功、失敗、応答時間と料金推計を、生回答付きで公開。
Twelve synthetic tasks, three models, two runs each. Raw answers, failures, latency and price estimates for extraction, reasoning, SQL and tools.
用途別のモデル選択を、予算内の定期比較と段階導入で更新。Jevの用途判定、採用条件、自動復帰と最新の評価履歴を公開します。
Bounded comparisons and staged adoption update task-specific model choices. Explore Jev classification, promotion criteria, recovery and live evaluation history.
teai Inboxを作り、DecideとJevで同じ24件を判定。両方72/72正解、中央値1.79秒と1.04秒。出力形式・料金・測定条件と実演動画を公開。
Building teai Inbox with Decide and Jev. Both scored 72/72 on 24 inputs; median response times were 1.79s and 1.04s. Full measurements, output semantics and a working demo.
teai・Sente・Sente Cloud・sente-cの違いをやさしく図解。メール1通から始める依頼例、パソコンとCloudの使い分け、KOEの声まで。本人声の紹介動画つき。
送信前の個人情報・鍵マスクをローカルLLM(Ollama)から切り離し、パターン・辞書・日本語ヒューリスティック・Apple固有表現認識の4層に。1ターン112秒で「固まった」に見えた経緯、0.1msの実測、日本語人名の限界、重なりで鍵の後半が漏れたバグまで。
macOSはふたを閉じるとハードウェアレベルで強制スリープします。caffeinateでは防げないため、senteを常駐VMに移し、ジョブの実行先をMacからVMに切り替えました。実ジョブ4件の実測と、本番で踏んだ罠7つを公開します。
GLM-5.2は約2.14円・39秒・20/20合格。HY4・Kimi K3・Fable・Haiku・Opusと3製品を実測。費用・成果物・失敗も、録画とKOE音声解説付きで公開します。
irm 一行でインストールして te でコーディング。声・KOE・エージェントまで使いたい人は WSL2 へ。PATH・実行ポリシー・APIキーなど、つまずきポイントも全部解説します。
394モデル・14モデルのTTFT実測・MCP還元台帳を認証なしAPIで常時公開。curl一発で契約前に確かめられます。「使う理由がある人」「まだない人」を数字で正直に仕分けした記事。
394 models, TTFT measured for 14 models, and the MCP creator payout ledger — all on a public API with no authentication. One curl verifies everything before you sign up. Who has a reason to start today, and who honestly doesn't yet.
Ollama × Sente。キーなしでローカルモデルにつなぎ、実機でファイル読込を確認しました。
LM Studioのローカルサーバーへ接続する手順。設定テストと、実機生成の未検証範囲を掲載。
OpenRouter × Sente。モデル一覧と短い実生成を確認。キー設定から最初の依頼まで。
推奨REST APIとゲートウェイIDでSenteを設定。必要権限と検証範囲も明記。
Vercel AI GatewayのOpenAI互換APIに接続するガイド。APIキーとモデルIDから開始。
会社のURLとキーから接続。teai登録不要で、既存のモデルを使いファイルを読み、修正し、テストする。LiteLLM 1.100.1と本番APIで確認した手順を公開。English guide included.
生成終了まで保持する同時実行制御と最大8台の自動起動・停止を実装。通常API枠の32〜64並列で計192件成功。応答時間・保護拒否・未測定範囲も公開します。
前回の発見をteaiのAPIに実装。整数計算と決まったJSON変換をLLM呼び出し0で返す仕組みを、本番の入力・出力・応答時間で説明します。
検算係が正しい期待値を計算していたのに、それを捨ててモデルに作り直させ、同じ誤答を返していた1問。主要16問は9→15→16問正答、全20問では検証方式と同点。AIに意図を整理させ、確定処理に渡す設計案までを実測で追います。
計算は電卓・決定的コードで確認し、JSONは構文・スキーマに加えて入力の値が保持されたかを照合。いま導入する手順と実測の限界を整理しました。クラウドモデルでの改善効果は未検証です。
最長単語の正解条件・得点の尺度・最終回答の判定を訂正。旧ランキングとプロンプト・量子化の効果の断定を撤回します。いまは電卓とJSONの保持チェックから。クラウドでの改善効果は未検証です。
teai.ioの全356モデルに変奏版なぞなぞ3問+15モデルに4ラウンド。満点27体・3問全滅71体。1モデル=1マスの可視化、価格との散布図、全生回答、8分の解説動画つき。
初回60秒→2回目4.7秒・100万トークン・入力$0.834/1K。「タイムアウトする壊れたモデル」に見えたのは受け側の30秒制限が原因でした。モデルを自分で選べる=引っ越し自由、を専門用語なしで説明。音声つき。
GLM-5.2(FP8・量子化なし)を8×H200で1日動かし、投機デコードの設定を10構成以上掃引。単一ストリーム315 tok/s・TTFT 0.05秒、同時128本で2,739 tok/s。一般的なAPI経由との同条件比較、出力1Mトークンあたりの原価、Kimi K3が載らなかった理由まで実測で公開。専用プランはお問い合わせください。
スポット調査40件(35分)・登録(3分)・公開(2分)・独自ドメイン開通(15分)。コア工程は全部sente任せで、実測ログの合計は約55分。手順と道具(launch.sh)も公開。人間の仕事は指示とGO判断だけだった。
歌詞は権利処理済みカタログ(uta.live)からだけ有償で返し、取得のたびに80%をアーティストの収益口座へ記帳。台帳に書けなければ買い手に自動返金。権利未処理の曲は歌詞を一切返さない — lyrics MCPの設計を全部書いた。
ある銀行の手続きが「書類はFAXのみ」だった。AIが自力でFAXを送れるようにした同じ日に、LINE・Telegram・Slack・物理の手紙・メールまで同じ形でMCPツール化。鍵はユーザーごとに暗号化保管(vault)、送信は本人確認済みアカウント限定。
上流残高切れで直結ルートが静かに縮退 — 障害より悔しいのは「ログから見えなかった」こと。課金ログにrequested_model列を足したら、モデル黙り替え・思考型モデルの空応答など隠れバグが同日に4つ。キャッシュ割引の課金転嫁(-86%)、teai/default、エージェント計測ラボまで実測ログ付きで公開。
StarcloudはH100衛星でLLMを稼働済み、核融合はSPARC/ARC/Helionが2020年代に初号機 — 放熱の物理(1GW=東京ドーム数十個分のラジエータ)と実タイムラインで、宇宙DCの生き残るニーズと消えるニーズを図解しました。
Kimi K3は2.8T、DeepSeek V4は1.6T — オープンモデルはどこまでGPT・Claudeに迫ったか。サイズのバブル図・派生3軸(小型化/量子化/FT)の図解・賢さ×価格の散布図で見える化しました。
自社の紙芝居サービスが画像生成停止(直叩きGeminiキーの前払いクレジット枯渇)。teai.io経由(te image --fast)で数分・数十円で復旧し、サービス本体も/gemini-proxy経由に切替した実際の障害対応記録。
Gemini 3 Pro Imageで月$800ペースだった実請求を公開。8モデルに同じ日本語筆文字を描かせて比較し、3.1 Flash Liteへ一斉切替。品質の差は実画像で判断してください。
te image / te video 登場。同じAPIキーでGemini 3.1・Seedream・Z-Image・Klingまで。既定モデルは8モデルに同じ絵を描かせて決めました — 日本語筆文字の実生成比較つき。
teai.ioは今389モデルに対応。新モデルが次々に追加され、価格は下がり速度は上がっている実態を、jp148-benchの実測スコア・料金表・社内AI Lab「Shitate」の研究成果とあわせて図解でまとめました。
GoogleのA2AがAnthropicのMCPと同じ財団(AAIF)に合流した週のニュースをteaiのMCPゲートウェイ戦略に接続して整理。Claude Codeの「伸びてるスタートアップ5原則」をSente自身の開発にどう当てているかも棚卸しした。
Magpie・Aria・MoonBitなど、LLMによるコード生成を前提に設計された言語が登場。曖昧さゼロ・トークン効率・即時フィードバックの設計思想と、訓練データ不在という最大の壁を整理。
CはLLMが最も苦手とする言語。実測で成功率の差を可視化し、Claude Sonnet 5 + AddressSanitizer検証ループやKimi K2.6/K3の使い分けなど、CをLLMに書かせる際のベストプラクティスを解説。
送信直前にこのMac上のローカルLLM(Ollama qwen3.5:4b)+正規表現で氏名・住所・電話・APIキーをプレースホルダ化してから teai.io へ送り、応答は復元。Ollamaが使えない時は平文のまま送らずエラーで止まるフェイルクローズ設計と、踏んだ罠まで。(2026-09-18 に既定を Ollama 不要の内蔵4層へ更新。続編あり)
同じteai/maxが、数学では8年未証明の予想(OEIS A196020)を独立検算済みで証明し、創薬では実在しない論文を捏造した。この1週間の4つの実験(数学・創薬・価格自己監査・オーケストレーター進化)を横断して見えた1つの法則。
teai/maxに7つの難病のドラッグリパーパシング候補を出させ一件ずつ検証。76%は正確だったが、ALS向けメトホルミンは実際は有害なのに架空の論文で「効く」と言い張っていた。AI自身の改善策(PMID数字化)を試したら精度は22%に悪化した顛末を全部公開する。
前回の反省を踏まえ、今度は公開前に自分で全部疑ってから投稿。3件(A23105・A347854・A347855)をOEISに正式投稿し編集者レビュー待ち。自分の検証スクリプトのバグも含めて正直に公開。残り3件はOEIS側の投稿数制限で待機中。
ミレニアム懸賞問題は最初から除外し、OEISの小さな未証明予想45件に挑戦。1件(2018年から8年間未証明)を正しく証明・独立検算済み。自動判定パイプラインのバグを自分で発見・修正した過程も公開。総コストは予算の2%未満。
Claude Opus 5+GPT-5.5 Pro+Gemini 3.1 Proの3体構成は99.0点止まりでSakana Fugu Ultra(99.3)に届かず不採用。Sakana Fugu Ultra+Grok 4.5の2体に絞ったら99.3で並んだ。負けた構成も公開する。
Grok 4.5とTML Inkling、単体では中位の2モデルを審議で束ねたら99.3点。単体最強クラスのSakana Fugu Ultraに並び、GPT-5.5 Proを上回った。研究元shitate.aiの実測データつきで正直に公開する。
「実費+5%」の約束をOpenRouterライブカタログ413モデルと機械照合したら、逆ザヤ15件・過大請求8件・上流廃止ゴースト4件。全部その日に直した記録。
安いモデルで回答し、コード検算と品質ヒューリスティクスで「間違い確定」のときだけ上のモデルへ。V4 Pro比コスト約70%削減・正答率の差3pt以内の実測データつき。
base_urlを1行変えるだけで、GPT-4o、Claude、Gemini等380+モデルが使える。東京サーバーで低レイテンシ、5%マークアップのみ。
LangChainのbase_urlを変更するだけで全モデルにアクセス。RAG、エージェント、ストリーミングの実践コード付き。
NVIDIA Nemotron 9Bが完全無料・無制限。チャットボット、翻訳、コードレビューBot、日次レポート生成の実践コード。
Rust + AWS Lambda + Cloudflare Workersで構築したLLM Gatewayの技術的詳細。SSEストリーミング、プロバイダルーティング、フォールバックの実装を解説。
日本語の仕事を15モデルに同一の148問で解かせて、正答率・コスト・速度を実測で比較。
安いモデルはどこまで賢いのか。価格帯ごとの実測クオリティを横断比較した記録。
MoE構造、1Mコンテキスト、推論コスト。オープンウェイト最強候補の実装を解説。
日本法の実務を11モデルで横断検証。同じ間違いをするモデル同士の関係まで見えた記録。