Kimi K2.7 Code、推論コストを30%削減し、MCPツール利用でClaude Opus 4.8を凌駕

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
Moonshot AIがローンチ Kimi K2.7 Code 2026年6月12日に、K2オープンウェイトファミリーの最新版としてローンチされました。これは長期的なエージェント型コーディング向けに構築されており、主に2つの特徴を謳っています。同等のタスクにおいてK2.6よりも推論トークンを約30%削減し、Claude Opus 4.8を上回るMCPツール呼び出しスコアを達成しています。価格は100万入力/出力トークンあたり0.95ドル/4.00ドルで変更ありません。
Moonshot AIの発表内容
Kimi K2.7 Codeは、K2.5およびK2.6と同じMoE基盤上に構築された、コーディングに特化した追加学習モデルです。総パラメータ数1兆、384のエキスパートにわたるトークンあたり320億のアクティブパラメータ、256Kのコンテキストウィンドウ、そしてテキスト、画像、動画入力に対応するMoonViT 4億パラメータのビジョンエンコーダを備えています。追加学習の焦点は、 トークン効率、 長文コンテキストにおける指示追従性、および MCPツール利用の信頼性に置かれ、中でも推論トークンを30%削減したことが主要な成果です。
デプロイ前に留意すべき2つの制約があります。思考モードは必須であり、無効にできません。また、サンプリングパラメータは固定されています(temperature 1.0, top_p 0.95)。これは出力の決定性を制限しますが、レイテンシに敏感なパイプラインにとって重要なエージェントの信頼性を高めるための意図的なトレードオフです。リリース時点では汎用的なInstructモデルは提供されていません。Moonshotは、執筆、分析、会話にはK2.6を明示的に推奨しています。
Kimi K2.7 CodeとClaude Opus 4.8、GPT-5.5の比較
K2.7が優位な点。 Notion、GitHub、Filesystem、Postgres、Playwrightにわたる人間検証済みのツール呼び出しであるMCP Mark Verifiedにおいて、K2.7は最も明確な勝利を収めています。そのスコアは81.1であり、Opus 4.8の76.4を上回ります。MCPベースのエージェントを構築するチームにとって、これは表の中で最も実用的に関連性の高い数値です。
プロプライエタリモデルが優位な点。 MCP AtlasとMCP Mark Verifiedは別々のベンチマークです。MCP Atlasでは、Claude Opus 4.8が81.3でリードし、K2.7は76.0です。純粋なコーディング品質では、Kimi Code Bench v2とProgram Benchの両方で、プロプライエタリモデルの方が高いスコアを出しています。MCP Mark Verified全体では、GPT-5.5が92.9でリードしています。K2.7は単一のベンチマークで最高のモデルではありませんが、MCPを多用し、コストに敏感なエージェント型コーディングにとって、最も費用対効果の高いオープンウェイトの選択肢です。
多言語対応。 MLS Bench Liteでは、K2.7が最大の伸びを示しています。K2.6の26.7から31.5%増の35.1で、GPT-5.5の35.5にほぼ匹敵します。Claude Opus 4.8は42.8でリードしています。
これが実際に意味すること
コスト効率は相乗効果を生みます。 100万トークンあたり0.95ドル/4.00ドルという価格は、すでにClaude Opus 4.8より約5倍安価ですが、30%の推論トークン削減により、複数ターン実行のたびにさらに差が縮まります。コンテキストを再利用するワークフローでは、100万あたり0.19ドルのキャッシュヒットにより、コストがさらに圧縮されます。
MCPによる向上は、その範囲が限定されています。 K2.7は、あらゆるオープンウェイトモデルの中で最も高いMCPツール呼び出し精度を誇りますが、その利点はMCP Mark Verifiedに特化したものです。MCP AtlasではOpus 4.8が優位であり、GPT-5.5はMCP Mark Verifiedにおいて92.9で両者よりも優れています。
切り替える前にテストを。 上記の数値はすべてMoonshot独自のものです。VentureBeatは、初期の導入者が発表された数値と実際の成果との間に乖離があることを指摘していると報じました。本番環境のトラフィックを投入する前に、K2.7を自身のレポジトリで実行して確認してください。
利用シーン
K2.7とK2.6 トークン効率が制約となる純粋なエージェント型コーディングワークロード(長時間のデバッグセッション、複数ファイルのコードリファクタリング、CIエージェントなど)に適しています。独立したベンチマークが発表されるまでは、汎用または混合ワークロードにはK2.6を使用してください。
K2.7とOpus 4.8、GPT-5.5 コーディング品質が最優先で、コストが制約でない場合、プロプライエタリモデルが依然として優位です。データ制御の柔軟性を備えた最高のオープンウェイトMCPツール呼び出しが必要な場合は、K2.7が最適です。
必須の思考モード 複雑なエージェントタスクには有用ですが、単純なクエリにはコストがかかります。本番環境で有効にする前に、エージェントハーネスで予算制限を設定してください。
結論
K2.7 Codeは、MCPを多用し、コストに敏感なエージェント型コーディングパイプラインを実行するチーム向けの、効率に特化したアップグレードです。30%のトークン削減とオープンウェイトMCP呼び出しの優位性が、これを評価する理由となります。独立したベンチマークの欠如と必須の思考制約は、まず慎重にテストすべき理由であり、この慎重なテストこそがTrueFoundry AI Gatewayがその真価を発揮する場所です。
単一のvCPUで約3~4ミリ秒のオーバーヘッドと350以上のRPS(Requests Per Second)で、このゲートウェイは単一のOpenAI互換エンドポイントを通じて1,000以上のモデルにルーティングします。Kimi K2.7 Codeは、TrueFoundry AI Gatewayを介して直接利用可能です。既存のセットアップと同じURL、同じ認証情報で、リクエストごとのコストとレイテンシがチームごとに追跡されます。データレジデンシー要件を持つチーム向けには、K2.7のオープンウェイトが完全なセルフホスティングをサポートし、TrueFoundryがオーケストレーションを処理するため、ガバナンスに手動操作は不要です。
TrueFoundry AI Gateway経由でKimi K2.7 Codeにアクセス →
関連記事
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.

















.webp)
.webp)


.png)

.png)














