学習見積もりは小さくても、運用見積もりでは数字が変わります
オープンウェイトモデルのファインチューニングを見積もると、最初の数字は意外に小さいかもしれません。LoRAは事前学習済みの重みを固定し、小さな低ランク行列だけを学習することで、フルファインチューニングより学習対象パラメータを減らす方式です。ただし論文の大きな削減値はGPT-3 175BとAdamによるフルファインチューニングを比較した結果であり、すべてのモデルにそのまま適用できるわけではありません。
より見落とされやすい数字は、学習が終わった後から発生します。専用GPUを時間単位で借りると、リクエストが少ない時間にもコストが積み上がり、トークン単位サービスでは呼び出し量と出力長によってコストが変わります。コストを分けるのは「ファインチューニングが安いか」ではなく、自社トラフィックと課金単位が合っているかです。
Riverは2026年8月に発表したSeed・Series Aで合計11億ドルを調達し、学習と推論を使用トークン単位で計量して、アイドルGPU容量のコストをなくすと提示しました。一方、専用GPUは利用率が高ければトークン課金より有利になり得ます。調達規模はRiverの事業ビジョンへの大きな投資ですが、製品のコスト削減や性能を検証した結果ではありません。
まずインストール・認証・最初の応答まで接続します
Riverを評価するなら、価格表を比べる前にアカウントで使えるモデルと基本リクエストを確認するのがよいです。必要なのはPythonとpipが使えるローカル環境、Riverアカウント、コンソールで作成したAPIキー、サンプル呼び出し用の小さな予算です。以下の手順は公式ドキュメントを読んで構成したもので、実際のアカウントで実行した結果ではありません。
- Riverコンソールで登録し、APIキーを作成します。キーは再表示が難しい場合があるため、安全なシークレット保管場所に保存してください。サンプル呼び出しと後続の学習には料金が発生する場合があります。
- ターミナルで公式クライアントをインストールし、キーを現在のシェルに読み込みます。
rv_...の部分だけを発行された実際のキーに置き換えてください。pip install river-client export RIVER_API_KEY="rv_..." - 次のコードをそのまま実行します。インストールパッケージ名は
river-clientですが、公式importパスはriver_clientです。アカウントごとに許可モデルが異なる場合があるため、例のモデル名を固定せず、権限リストの先頭モデルを使用します。python - <<'PY' import os import river_client as river client = river.Client(api_key=os.environ["RIVER_API_KEY"]) healthy = client.health_check() print("healthy:", healthy) if not healthy: raise RuntimeError("River API health check failed") models = client.get_capabilities() print("available models:", models) if not models: raise RuntimeError("No base models are available for this API key") base = models[0] samples = client.sample( "What is 2 + 2? Answer briefly.", base_model=base, max_tokens=24, ) if not samples: raise RuntimeError("The sample request returned no results") print("base model:", base) print("response:", repr(samples[0].text)) PY - 3つの出力で成功を確認します。
healthy: True、空でないモデル一覧、4に相当する空でない応答が出れば、インストール・認証・モデル権限・最初の推論は接続されています。モデル一覧が空の場合は、ドキュメントのモデル名を勝手に入れず、まずアカウント権限を確認してください。 - ファインチューニングは接続確認後に小さなデータから始めます。公式SFT例はプロンプト・完了ペアをトークン化し、
forward_backwardとoptim_stepを繰り返した後、学習にない入力をmodel.sampleで確認します。例の成功は学習ループが接続されたことを意味し、実務品質や運用安定性を証明するものではありません。
RiverはGPU時間ではなく4種類の使用量を売っています
Riverの違いはファインチューニング機能そのものより、計量方式にあります。公式説明によるとLoRAと強化学習をサポートし、学習と推論で実際に使われたトークンに基づいて請求します。リクエストがない間も専用GPU容量に払い続けなくてよい、という提案です。
2026年9月7日に確認したプレビュー価格では、Qwen3.6-35B-A3B-FP8は100万トークン当たり、入力が$0.33、キャッシュ入力が$0.066、出力が$0.82、学習が$1.00です。チェックポイント保存には月額GB当たり$0.10が別途かかります。これらは現在の価格表にある1モデルの例であり、他モデルや今後の価格を代表するものではありません。
Riverの見積もりは4行に分けてください。
- 学習費:学習トークン数 ÷ 100万 × 該当モデルの学習単価
- 推論費:入力・キャッシュ入力・出力トークンをそれぞれ100万で割り、各単価を掛けた合計
- 保存費:チェックポイント容量(GB)× 保管月数 × 月額GB当たり単価
- 再実行費:評価呼び出し、失敗した実験、再学習に使う予備使用量
学習トークンにはデータ規模と反復回数が、推論費には入力・出力比率とキャッシュヒット量が影響します。プレビュー価格は変わる可能性があるため、長期予算を確定する前に最新価格を再確認する必要があります。
専用GPUは低利用率では高く、高利用率では事情が変わります
Togetherの専用推論は、リクエストトークンではなくready状態のレプリカのハードウェア使用時間を分単位で請求します。レプリカごとに独立して費用がかかり、レプリカを停止するか0台に減らせば、その課金も止まります。Togetherは、高利用率ではトークンベースのサーバーレスより安くなる可能性があると説明しています。
ただし現在の公式価格ドキュメント内でも、H100の単価は一致していません。対応ハードウェア表ではH100 80GBが時間当たり$3.99と表示されていますが、同じ文書の比較例では単一H100レプリカを時間当たり$5.49で計算しています。読んだ資料だけでは、プロモーション、構成差、ドキュメント更新遅延のどれが原因かは確認できません。したがって、H100 1台の月額費用を確定値として使わず、実際のデプロイ時点のコンソールまたは見積書に表示された単価を入れてください。
| 比較基準 | Riverのトークン課金 | Togetherの専用推論 |
|---|---|---|
| 主な課金単位 | 入力・キャッシュ入力・出力・学習トークン | readyレプリカごとのGPU使用分 |
| 月額費用の式 | トークン種類別使用量 × 各単価 + 保存費 | レプリカごとのGPU数 × 実行分 × 確認済みの時間当たり単価 ÷ 60の合計 |
| リクエストが少ないとき | 使用量とともに費用が下がりやすい | レプリカを維持すればリクエストがなくても請求 |
| リクエストが安定しているとき | トークン使用量に比例して増加 | GPU利用率を高めれば有利になり得る |
| 見積もり前の確認 | モデル別プレビュー単価と保存量 | 実際の適用単価、GPU数、レプリカ実行時間 |
結局、「トークン課金は安い」と「専用GPUは高い」はどちらも条件付きの文です。断続的な社内ツールならアイドル容量をなくす効果は大きいですが、一日中一定のスループットが必要なら、専用GPUの固定容量を十分に活用できます。損益分岐点の計算には、モデルのスループット、入力・出力比率、キャッシュヒット率、レイテンシ目標が必要です。
同じリクエストを入れて初めて損益分岐点が見えます
価格表の比較を終えるには、両方で同じ代表リクエストを処理し、まず品質と速度をそろえる必要があります。同じモデル名でも、サービング設定とハードウェアが異なればスループットとレイテンシは変わり得るためです。
- 代表リクエストセットを作成します。短い入力・長い入力、短い出力・長い出力、ピーク時に頻繁に入るリクエストを含めてください。各リクエストには正解、または人が判定できる業務上の合格基準を付けます。
- 比較可能な構成だけを残します。両方で同じリクエストを繰り返し、業務合格率、p95応答時間、分当たりスループットを記録します。目標品質またはレイテンシを満たさない構成は、価格が安くても除外してください。
- Togetherに必要な容量を見つけます。目標ピークスループットを満たすまでGPU数とレプリカ数を調整し、各レプリカが
ready状態だった時間を記録します。月額費用はΣ(レプリカごとのGPU数 × 実行分 × デプロイ時点の時間当たり単価 ÷ 60)で計算します。 - Riverの月間使用量を換算します。同じリクエストで集計した入力・キャッシュ入力・出力トークンに、低・平均・ピークのシナリオ別リクエスト数を掛けます。学習トークンとチェックポイント保存量は推論費と分けて加算します。
- トラフィック別に選択を記録します。低・平均・ピークごとに、目標品質とp95レイテンシを満たす構成のうち月額総費用が低い方を示してください。1つの課金方式がすべての区間で勝つ必要はありません。
比較完了の基準
各トラフィックシナリオの1行に品質合格率、p95レイテンシ、スループット、月間推論費、学習費、保存費が整理され、適用したトークン単価またはGPU時間単価の確認日まで残っていれば十分です。リクエスト量と単価は評価用の仮定ではなく、実測値と最新見積もり値に置き換えてください。
11億ドルは削減率の証明ではありません
RiverはSeedとSeries Aを合わせて11億ドルを調達しました。General CatalystとAMP PBCがラウンドを主導し、NVIDIA、AMD Ventures、Y Combinator、Temasekが参加しました。ただし、バリュエーション、投資家別の金額、投資条件は公開資料では確認できませんでした。
同社は、複雑な強化学習の実行をインフラチームなしで15〜20分で完了でき、クローズドな代替手段よりコストを2〜4倍削減できると主張しています。公式発表とTechCrunchの報道でこの数値は確認できますが、比較モデルとデータ、トークン量、品質同等性の基準、ハードウェア、第三者による再現結果は公開されていません。したがって、調達規模や会社側の削減率をプロダクション性能の証拠として読むべきではありません。
プロダクション契約前に別途確認する項目
- SLA、対応リージョン、障害履歴、プロダクションサポートの範囲
- データ保持・削除ポリシーと必要なコンプライアンス条件
- 価格変更や想定外のピークトラフィックに適用する月間支出上限
river://チェックポイントを外部へ持ち出せるか、対応フォーマット
小さな社内ツールのように呼び出しが少ないなら、River式トークン課金を先に試す理由があります。リクエストが安定しGPU利用率を高められるなら、専用推論の方が低コストになる可能性があります。正しい選択は学習費が最も安いものではなく、目標の品質と速度を満たしながら実トラフィックで最も無駄が少ないものです。
さらに深掘りしたいなら
River AI raises $1.1B in funding across Series Seed and Series A 調達規模と投資家、Riverが説明するトークン計量方式を原文で確認できます。 river.ai
River API Docs クライアントのインストール、正確なimportパス、認証確認、許可モデルの照会、最初のサンプルリクエストが整理されています。 docs.river.ai
Pricing - Together AI docs 専用レプリカの課金状態と計算式、現在のドキュメント内にあるH100単価の差を直接確認できます。 docs.together.ai



