<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>PiRouter ブログ</title><description>LLM ルーティング、ゲートウェイ、AI インフラのエンジニアリングノート。</description><link>https://pirouter.ai/</link><language>ja</language><item><title>Qwen3.8-Flash-Next の GGUF はどれを選ぶか——最小 4 段は「名前が違うだけ」に近い、ヘッダを読んだ実測</title><link>https://pirouter.ai/ja/blog/gguf-filename-is-a-request/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/gguf-filename-is-a-request/</guid><description>Unsloth の Qwen3.8-Flash-Next GGUF 11 段をテンソル表から実測。UD-IQ1_S（72.5GB）は公称 1.56 bpw、実測 3.28 bpw。最小 4 段は名前で 2 倍の差を謳いながら実測 3.28〜3.71 に収まり、体積差は 10GB 弱。128GB 機での選び方を整理します。</description><pubDate>Sat, 29 Aug 2026 00:00:00 GMT</pubDate><category>local-llm</category><category>models</category><author>Linden Kern</author></item><item><title>Kimi K3 ライセンスの商用条件は 3 条項で決まる——「$20M」の読み方と、Azure・AWS・Google に求めた 30% 収益分配</title><link>https://pirouter.ai/ja/blog/open-weights-still-need-a-host/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/open-weights-still-need-a-host/</guid><description>Kimi K3 の重みは無償ですが、公式 vLLM レシピの起点は 8×GB300。ホストは消えません。ロイターが伝えた Moonshot の「最大 30%」要求はレベニューシェアの向きを逆にしたもので、未解決項目に「トークン利用の監査」が並びます。ライセンス 3 条項を原文で読み、誰がトークンを数えるのかまで整理します。</description><pubDate>Sat, 29 Aug 2026 00:00:00 GMT</pubDate><category>models</category><category>providers</category><category>ecosystem</category><category>cost</category><author>Leo Kaka</author></item><item><title>GLM-5.3-Flash と Qwen3.8-Flash-Next——同じ $0.15 に、逆の削り方で着地した</title><link>https://pirouter.ai/ja/blog/glm-flash-vs-qwen-flash-next/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/glm-flash-vs-qwen-flash-next/</guid><description>8 月 26 日、76 分差でリリースされた二つの Flash モデル。定価はどちらも入力 $0.15/M でほぼ同着ですが、GLM-5.3-Flash は層とアクティブパラメータを半減させ、Qwen3.8-Flash-Next は 51B の N-gram Embedding をホストメモリに逃がすという、正反対の削り方でそこに到達しました。価格表・ベンチ脚注・ローカル実行のメモリ要件（192GB vs 75GB）を並べて読みます。</description><pubDate>Thu, 27 Aug 2026 00:00:00 GMT</pubDate><category>models</category><category>pricing</category><category>local-llm</category><author>Leo Kaka</author></item><item><title>Nvidia が Hugging Face 買収交渉——依存先が『中立の場』でなくなる日</title><link>https://pirouter.ai/ja/blog/nvidia-hf-talks/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/nvidia-hf-talks/</guid><description>Business Insider によれば、Nvidia は Hugging Face を 130 億ドル超で買収する交渉を進めています——合意には至っておらず、交渉は破談もあり得る段階。1 月に「単一の支配的投資家は要らない」と 5 億ドルの出資を断った相手が、8 月には買い手として現れました。日本の国産 LLM 8 団体・591 モデルが載っている場所の話の続報です。</description><pubDate>Thu, 27 Aug 2026 00:00:00 GMT</pubDate><category>providers</category><category>ecosystem</category><author>Linden Kern</author></item><item><title>Transaction Tokens とは何か——認可の文脈は三ホップのどこで消えるか</title><link>https://pirouter.ai/ja/blog/authorization-context-across-hops/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/authorization-context-across-hops/</guid><description>Transaction Tokens（draft -11）を精読し、LayerX の Capability Assertion と並べる。エージェント→ゲートウェイ→プロバイダの三ホップで、認可の文脈がどこで抜け落ちるかを表で示します。</description><pubDate>Tue, 25 Aug 2026 00:00:00 GMT</pubDate><category>security</category><category>gateway</category><category>agents</category><category>api-keys</category><author>Leo Kaka</author></item><item><title>FreeToken × RTX 5090——120B MoE が 127 tok/s、その請求書</title><link>https://pirouter.ai/ja/blog/moe-beyond-vram/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/moe-beyond-vram/</guid><description>holy_fox 氏の Zenn 実測（RTX 5090 32 GB + RAM 128 GB、FreeToken 0.1.2）：VRAM を超える gpt-oss-120b が decode 127.1 tok/s。電気代込みの回収日数。</description><pubDate>Tue, 25 Aug 2026 00:00:00 GMT</pubDate><category>local-llm</category><category>models</category><category>cost</category><author>Leo Kaka</author></item><item><title>semantic-router と Qdrant で LLM を呼ばずに振り分ける——11 倍速で済む判定、済まない判定</title><link>https://pirouter.ai/ja/blog/routing-without-calling-llm/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/routing-without-calling-llm/</guid><description>日本語 52 問を semantic-router + Qdrant と LLM 分類で振り分けた Zenn の実測（94 ms 対 1,048 ms、67.5% 対 100%）を三層に置き直し、どの判定をどの層に任せるかの境界を引きます。</description><pubDate>Tue, 25 Aug 2026 00:00:00 GMT</pubDate><category>routing</category><category>cost</category><author>Linden Kern</author></item><item><title>日本の国産 LLM 591 モデルは、売却検討中のプラットフォーム上にある</title><link>https://pirouter.ai/ja/blog/distribution-layer-for-sale/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/distribution-layer-for-sale/</guid><description>LLM-jp 266・Swallow 138・rinna 61——日本の 8 団体が Hugging Face に公開しているモデルは計 591。ところが 30 日ダウンロードは約 136 万回で、中国 8 社の 290 分の 1 です。8 月 23 日、その HF が 130 億ドル以上での売却を検討中と報じられました。API を自分で叩いて出した数字から、依存の向きと、調達・ガバナンスで見るべき点を整理します。</description><pubDate>Mon, 24 Aug 2026 00:00:00 GMT</pubDate><category>local-llm</category><category>models</category><category>ecosystem</category><author>Leo Kaka</author></item><item><title>Skills 静的注入 96.0% vs RAG 都度検索 87.3%——精度で選ぶ前に見る請求書</title><link>https://pirouter.ai/ja/blog/agent-context-injection-bill/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/agent-context-injection-bill/</guid><description>松尾研究所の 135 回実測（社内知識なし 33.0%／Notion 都度検索 87.3%／Skills 静的注入 96.0%）は明快ですが、注入した分は毎リクエスト課金され、損益分岐は精度ではなく呼び出しパターンとキャッシュヒット率で決まります。しかも同じ実験で、Skills でも回答の 15.6% が安全性に関わる項目を落としている。方式を決める前に測るべき三つの計測点まで。</description><pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate><category>agents</category><category>cost</category><category>caching</category><author>Leo Kaka</author></item><item><title>同じ Qwen3.8-27B、三つの言語圏で違う問い——評価が食い違う理由</title><link>https://pirouter.ai/ja/blog/same-model-different-questions/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/same-model-different-questions/</guid><description>英語圏は「どの量子化なら壊れないか」、日本語圏は「どのハーネスと組むか」、中国語圏は「どのクローズドモデルと同等か」。同じ重みへの評価が食い違うのは、どちらかが間違っているからではなく、詰まっている場所が違うからです。ただし日本語圏の問いは翌日には入れ替わっていました——モデル選定の議論は、結論より先に書き手の前提を見る。</description><pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate><category>models</category><category>ecosystem</category><category>local-llm</category><author>Linden Kern</author></item><item><title>エージェントに渡す鍵の形——短期・スコープ・上限の三点セット</title><link>https://pirouter.ai/ja/blog/agent-credentials/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/agent-credentials/</guid><description>AWS Japan の認可疲れ論、Retty の $OPENAI_API_KEY 廃止、Gemini の無制限キー拒否——同じ週の三つの話は同じ一点を指す。権限はダイアログではなく鍵の形に。600 秒・300 秒・3600 秒から設計と請求書を整理します。</description><pubDate>Fri, 21 Aug 2026 00:00:00 GMT</pubDate><category>security</category><category>api-keys</category><category>agents</category><author>Leo Kaka</author></item><item><title>編成 70.3 対 単体 62.6——編成が勝つ三つの条件と、その請求書</title><link>https://pirouter.ai/ja/blog/local-llm-ensembles/</link><guid isPermaLink="true">https://pirouter.ai/ja/blog/local-llm-ensembles/</guid><description>「ローカルLLM編成が単独のフロンティアAIを超えた」という Zenn の記事の中身を読むと、編成は純ローカルではなくハイブリッドで、「負けた」単体モデルと同じモデルが判断役として働いていました。編成が勝つのはタスク分解・異質性・検証の三条件が揃ったとき。オーケストレーション、失敗面、評価という三つのコストまで含めて整理します。</description><pubDate>Wed, 19 Aug 2026 00:00:00 GMT</pubDate><category>models</category><category>ensembles</category><category>local-llm</category><author>Linden Kern</author></item></channel></rss>