Login
Crazyrouter Blog

Practical notes on AI models, API costs, and production workflows.

Model updates, integration guides, pricing breakdowns, and tool workflows for developers and teams.

Kimi は Opus 4.8 にどこまで迫ったのか? 7次元 API 実測
July 19, 202637 views日本語Comparison

Kimi は Opus 4.8 にどこまで迫ったのか? 7次元 API 実測

精密な数学、物理モデリング、制約付き推論、統計的反誘導、コードレビュー、厳格な JSON、そして不確実性キャリブレーションの7項目で、Kimi K3 と Claude Opus 4.8 を比較。正答率、最初に見える回答、総遅延、reasoning Token 効率を検証する。

Kimi K3 と Claude Opus 4.8 の比較:研究生レベルの数学・物理・プログラミング実測
July 19, 202645 views日本語Comparison

Kimi K3 と Claude Opus 4.8 の比較:研究生レベルの数学・物理・プログラミング実測

同一の Crazyrouter OpenAI-compatible API 上で、研究生レベルのマルコフ連鎖の初到達時間、減衰付き結合振動子の周波数応答、依存関係スケジューリングアルゴリズムを用いて kimi-k3 と claude-opus-4-8 を比較し、出力の完全性、正確性、レイテンシー、独立検証結果を記録する。

Kimi K3 と GPT-5.6-SOL を比較:数学、物理、プログラミングの高難度実測
July 18, 202662 views日本語Comparison

Kimi K3 と GPT-5.6-SOL を比較:数学、物理、プログラミングの高難度実測

同一の OpenAI-compatible API と同一のプロンプト条件で、Kimi K3 と GPT-5.6-SOL を比較。モード停止時間、滑車の回転慣性を含む物理問題、依存クロージャを使う Python のプログラミング課題をテストし、正答性、途中切れ、遅延、ローカルでのコード検証を記録した。

Kimi K3 と Claude Fable 5 を実測比較:差が出たのは推論力より出力予算と検証性
July 17, 202670 views日本語Comparison

Kimi K3 と Claude Fable 5 を実測比較:差が出たのは推論力より出力予算と検証性

数学、物理、Python、制約推論の4課題で Kimi K3 と Claude Fable 5 を比較し、finish_reason、reasoning tokens、遅延、コード実行結果を検証します。

GPT-5.6-sol vs GPT-5.6-terra 実測:2倍の価格差はどれほどの性能差をもたらすのか?
July 13, 202673 views日本語Comparison

GPT-5.6-sol vs GPT-5.6-terra 実測:2倍の価格差はどれほどの性能差をもたらすのか?

Crazyrouter OpenAI-compatible API による実価格・性能テスト。確率状態機械、多段階物理、ログ集約、安定ルーティングの4課題を用いて、gpt-5.6-sol と gpt-5.6-terra の正確性、応答時間、completion tokens、reasoning tokens、ローカルでのコードテスト、および公開単価から算出したリクエスト単位の推定コストを比較します。

GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数
July 6, 202693 views日本語Comparison

GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数

Crazyrouter の OpenAI 互換 API で glm-5.2 と claude-fable-5 を数学、物理、Canvas アニメーション課題で比較し、glm-5.2 の現在の 0.8 discount も実務目線で整理します。

Claude Fable 5 vs GPT-5.5:max_tokens の見落としがモデル比較の結論を変えた理由
July 6, 202687 views日本語Comparison

Claude Fable 5 vs GPT-5.5:max_tokens の見落としがモデル比較の結論を変えた理由

Crazyrouter の OpenAI-compatible API を使い、claude-fable-5 と gpt-5.5 を数学、物理、Canvas アニメーションの長いコード生成タスクで比較した。焦点は max_tokens、finish_reason=length、completion_tokens、ブラウザ検証である。

Claude Sonnet vs Opus:Coding Agent ではどちらを使うべきか
July 5, 2026106 views日本語Claude

Claude Sonnet vs Opus:Coding Agent ではどちらを使うべきか

Coding Agent 向けに Claude Sonnet と Opus を比較し、コスト、速度、推論、レビュー、CrazyRouter でのルーティング戦略を説明します。