契約前に、数字を全部見てから決めてください — teai.io の実測値を認証なしで公開しました
394モデル・14モデルのTTFT実測・MCP還元台帳を認証なしAPIで常時公開。curl一発で契約前に確かめられます。「使う理由がある人」「まだない人」を数字で正直に仕分けした記事。
394モデル・14モデルのTTFT実測・MCP還元台帳を認証なしAPIで常時公開。curl一発で契約前に確かめられます。「使う理由がある人」「まだない人」を数字で正直に仕分けした記事。
394 models, TTFT measured for 14 models, and the MCP creator payout ledger — all on a public API with no authentication. One curl verifies everything before you sign up. Who has a reason to start today, and who honestly doesn't yet.
opencode/Claude Code/Codex CLI等7ツールと徹底比較し10ペルソナ×5項目で自社CLIを採点。強みは音声×日本語、弱みはコスト透明性と信頼性。100点への改善計画を公開。
teai.ioの全356モデルに変奏版なぞなぞ3問+15モデルに4ラウンド。満点27体・3問全滅71体。1モデル=1マスの可視化、価格との散布図、全生回答、8分の解説動画つき。
GLM-5.2(FP8・量子化なし)を8×H200で1日動かし、投機デコードの設定を10構成以上掃引。単一ストリーム315 tok/s・TTFT 0.05秒、同時128本で2,739 tok/s。一般的なAPI経由との同条件比較、出力1Mトークンあたりの原価、Kimi K3が載らなかった理由まで実測で公開。専用プランはお問い合わせください。
Claude Codeの使い勝手はそのまま、裏のモデルだけ用途に応じて替えたい。Anthropic Messages API互換の/v1/messagesを実装し、環境変数3つで接続先を切り替える手順と、公開価格APIによる単価の実測表(Sonnet 5/Opus 5/GLM-5.2/DeepSeek V4 Flash/Kimi K3)。国産エージェントsenteの紹介も。当事者の紹介記事です。
スポット調査40件(35分)・登録(3分)・公開(2分)・独自ドメイン開通(15分)。コア工程は全部sente任せで、実測ログの合計は約55分。手順と道具(launch.sh)も公開。人間の仕事は指示とGO判断だけだった。
歌詞は権利処理済みカタログ(uta.live)からだけ有償で返し、取得のたびに80%をアーティストの収益口座へ記帳。台帳に書けなければ買い手に自動返金。権利未処理の曲は歌詞を一切返さない — lyrics MCPの設計を全部書いた。
ある銀行の手続きが「書類はFAXのみ」だった。AIが自力でFAXを送れるようにした同じ日に、LINE・Telegram・Slack・物理の手紙・メールまで同じ形でMCPツール化。鍵はユーザーごとに暗号化保管(vault)、送信は本人確認済みアカウント限定。
上流残高切れで直結ルートが静かに縮退 — 障害より悔しいのは「ログから見えなかった」こと。課金ログにrequested_model列を足したら、モデル黙り替え・思考型モデルの空応答など隠れバグが同日に4つ。キャッシュ割引の課金転嫁(-86%)、teai/default、エージェント計測ラボまで実測ログ付きで公開。
StarcloudはH100衛星でLLMを稼働済み、核融合はSPARC/ARC/Helionが2020年代に初号機 — 放熱の物理(1GW=東京ドーム数十個分のラジエータ)と実タイムラインで、宇宙DCの生き残るニーズと消えるニーズを図解しました。
Kimi K3は2.8T、DeepSeek V4は1.6T — オープンモデルはどこまでGPT・Claudeに迫ったか。サイズのバブル図・派生3軸(小型化/量子化/FT)の図解・賢さ×価格の散布図で見える化しました。
自社の紙芝居サービスが画像生成停止(直叩きGeminiキーの前払いクレジット枯渇)。teai.io経由(te image --fast)で数分・数十円で復旧し、サービス本体も/gemini-proxy経由に切替した実際の障害対応記録。
Gemini 3 Pro Imageで月$800ペースだった実請求を公開。8モデルに同じ日本語筆文字を描かせて比較し、3.1 Flash Liteへ一斉切替。品質の差は実画像で判断してください。
te image / te video 登場。同じAPIキーでGemini 3.1・Seedream・Z-Image・Klingまで。既定モデルは8モデルに同じ絵を描かせて決めました — 日本語筆文字の実生成比較つき。
teai.ioは今389モデルに対応。新モデルが次々に追加され、価格は下がり速度は上がっている実態を、jp148-benchの実測スコア・料金表・社内AI Lab「Shitate」の研究成果とあわせて図解でまとめました。
GoogleのA2AがAnthropicのMCPと同じ財団(AAIF)に合流した週のニュースをteaiのMCPゲートウェイ戦略に接続して整理。Claude Codeの「伸びてるスタートアップ5原則」をSente自身の開発にどう当てているかも棚卸しした。
世界の主要エージェント9製品を横断比較。日本発のsente(Rust)・sente-c(C言語)・KOE(音声)も紹介。どのエージェントもbaseURLを変えるだけでteai.ioの380+モデルを使える。
Magpie・Aria・MoonBitなど、LLMによるコード生成を前提に設計された言語が登場。曖昧さゼロ・トークン効率・即時フィードバックの設計思想と、訓練データ不在という最大の壁を整理。
CはLLMが最も苦手とする言語。実測で成功率の差を可視化し、Claude Sonnet 5 + AddressSanitizer検証ループやKimi K2.6/K3の使い分けなど、CをLLMに書かせる際のベストプラクティスを解説。
送信直前にこのMac上のローカルLLM(Ollama qwen3.5:4b)+正規表現で氏名・住所・電話・APIキーをプレースホルダ化してから teai.io へ送り、応答は復元。Ollamaが使えない時は平文のまま送らずエラーで止まるフェイルクローズ設計と、踏んだ罠まで。
同じteai/maxが、数学では8年未証明の予想(OEIS A196020)を独立検算済みで証明し、創薬では実在しない論文を捏造した。この1週間の4つの実験(数学・創薬・価格自己監査・オーケストレーター進化)を横断して見えた1つの法則。
teai/maxに7つの難病のドラッグリパーパシング候補を出させ一件ずつ検証。76%は正確だったが、ALS向けメトホルミンは実際は有害なのに架空の論文で「効く」と言い張っていた。AI自身の改善策(PMID数字化)を試したら精度は22%に悪化した顛末を全部公開する。
前回の反省を踏まえ、今度は公開前に自分で全部疑ってから投稿。3件(A23105・A347854・A347855)をOEISに正式投稿し編集者レビュー待ち。自分の検証スクリプトのバグも含めて正直に公開。残り3件はOEIS側の投稿数制限で待機中。
ミレニアム懸賞問題は最初から除外し、OEISの小さな未証明予想45件に挑戦。1件(2018年から8年間未証明)を正しく証明・独立検算済み。自動判定パイプラインのバグを自分で発見・修正した過程も公開。総コストは予算の2%未満。
Claude Opus 5+GPT-5.5 Pro+Gemini 3.1 Proの3体構成は99.0点止まりでSakana Fugu Ultra(99.3)に届かず不採用。Sakana Fugu Ultra+Grok 4.5の2体に絞ったら99.3で並んだ。負けた構成も公開する。
Grok 4.5とTML Inkling、単体では中位の2モデルを審議で束ねたら99.3点。単体最強クラスのSakana Fugu Ultraに並び、GPT-5.5 Proを上回った。研究元shitate.aiの実測データつきで正直に公開する。
「実費+5%」の約束をOpenRouterライブカタログ413モデルと機械照合したら、逆ザヤ15件・過大請求8件・上流廃止ゴースト4件。全部その日に直した記録。
安いモデルで回答し、コード検算と品質ヒューリスティクスで「間違い確定」のときだけ上のモデルへ。V4 Pro比コスト約70%削減・正答率の差3pt以内の実測データつき。
base_urlを1行変えるだけで、GPT-4o、Claude、Gemini等380+モデルが使える。東京サーバーで低レイテンシ、5%マークアップのみ。
LangChainのbase_urlを変更するだけで全モデルにアクセス。RAG、エージェント、ストリーミングの実践コード付き。
NVIDIA Nemotron 9Bが完全無料・無制限。チャットボット、翻訳、コードレビューBot、日次レポート生成の実践コード。
Rust + AWS Lambda + Cloudflare Workersで構築したLLM Gatewayの技術的詳細。SSEストリーミング、プロバイダルーティング、フォールバックの実装を解説。
レイテンシ、コスト、モデル数、日本語対応、B2B対応を実測値で比較。東京リージョンでの500ms高速化、円建て請求の差を検証。
日本語の仕事を15モデルに同一の148問で解かせて、正答率・コスト・速度を実測で比較。
安いモデルはどこまで賢いのか。価格帯ごとの実測クオリティを横断比較した記録。
MoE構造、1Mコンテキスト、推論コスト。オープンウェイト最強候補の実装を解説。
日本の法人が仕入税額控除を受けるには適格請求書が要る。OpenRouterとの決定的な違いを解説。
声で操作できるコーディングエージェント。Claude Code・Codexとの実測比較。
LLM応答を本人クローン声で読み上げるボイスボット。model:"koe" を渡すだけ。コールセンター・ナレーション向け実装例つき。
日本法の実務を11モデルで横断検証。同じ間違いをするモデル同士の関係まで見えた記録。