Blog

LLM API / AI / Architecture

@teai_io GitHub Zenn Qiita

GLM-5.2を8×H200で自前ホストしたら315 tok/sになった — 専用GPUの速さと、正直な原価

GLM-5.2(FP8・量子化なし)を8×H200で1日動かし、投機デコードの設定を10構成以上掃引。単一ストリーム315 tok/s・TTFT 0.05秒、同時128本で2,739 tok/s。一般的なAPI経由との同条件比較、出力1Mトークンあたりの原価、Kimi K3が載らなかった理由まで実測で公開。専用プランはお問い合わせください。

計測の1列が、その日のうちにバグを4つ見つけた

上流残高切れで直結ルートが静かに縮退 — 障害より悔しいのは「ログから見えなかった」こと。課金ログにrequested_model列を足したら、モデル黙り替え・思考型モデルの空応答など隠れバグが同日に4つ。キャッシュ割引の課金転嫁(-86%)、teai/default、エージェント計測ラボまで実測ログ付きで公開。

Sente に PIIスクラビングを追加した — 送る前に、このMacで隠す

送信直前にこのMac上のローカルLLM(Ollama qwen3.5:4b)+正規表現で氏名・住所・電話・APIキーをプレースホルダ化してから teai.io へ送り、応答は復元。Ollamaが使えない時は平文のまま送らずエラーで止まるフェイルクローズ設計と、踏んだ罠まで。(2026-09-18 に既定を Ollama 不要の内蔵4層へ更新。続編あり)

Stay updated

New articles, model updates, and developer tips. No spam.

Try teai.io free

100 credits on signup. Nemotron 9B unlimited. No credit card.

Get Started