训练报价很小,但运营报价会让数字发生变化
为开放权重模型估算微调成本时,第一个数字可能出乎意料地小。LoRA 会冻结预训练权重,只训练较小的低秩矩阵,因此比全量微调减少了需要训练的参数。不过,论文中较大的节省数字来自 GPT-3 175B 与 Adam 全量微调的比较结果,不能原样套用到所有模型。
更常被忽略的数字从训练结束后才开始出现。按小时租用专用 GPU 时,即使请求较少的时段成本也会累积;使用按 Token 计费的服务时,成本则会随调用量和输出长度变化。决定成本的不是“微调是否便宜”,而是我们的流量是否匹配计费单位。
River 在 2026 年 8 月宣布的 Seed 和 Series A 中共筹集了 11 亿美元,并提出按实际使用的 Token 计量训练和推理,以消除闲置 GPU 容量成本。相反,当利用率较高时,专用 GPU 可能比 Token 计费更有利。融资规模代表对 River 商业愿景的大笔投资,但并不是对产品节省成本或性能的验证。
先连通安装、认证和首次响应
评估 River 时,在比较价目表之前,最好先确认账户可用的模型和基本请求。需要准备可使用 Python 和 pip 的本地环境、River 账户、在控制台创建的 API 密钥,以及用于样例调用的小额预算。以下流程根据官方文档整理,并非使用真实账户执行的结果。
- 在River 控制台注册并创建 API 密钥。密钥可能难以再次查看,请保存在安全的密钥存储中。样例调用和之后的训练可能会产生费用。
- 在终端安装官方客户端,并将密钥加载到当前 Shell。仅将
rv_...部分替换为实际获取的密钥。pip install river-client export RIVER_API_KEY="rv_..." - 原样运行以下代码。安装包名称是
river-client,但官方 import 路径是river_client。由于每个账户获准使用的模型可能不同,代码不会固定示例模型名,而是使用权限列表中的第一个模型。python - <<'PY' import os import river_client as river client = river.Client(api_key=os.environ["RIVER_API_KEY"]) healthy = client.health_check() print("healthy:", healthy) if not healthy: raise RuntimeError("River API health check failed") models = client.get_capabilities() print("available models:", models) if not models: raise RuntimeError("No base models are available for this API key") base = models[0] samples = client.sample( "What is 2 + 2? Answer briefly.", base_model=base, max_tokens=24, ) if not samples: raise RuntimeError("The sample request returned no results") print("base model:", base) print("response:", repr(samples[0].text)) PY - 通过三项输出确认成功。如果出现
healthy: True、非空的模型列表,以及对应 4 的非空响应,说明安装、认证、模型权限和首次推理已经连通。若模型列表为空,不要随意填入文档中的模型名,应先检查账户权限。 - 确认连接后,再用小数据集开始微调。官方 SFT 示例会将提示词-完成对 Token 化,重复执行
forward_backward和optim_step,然后用model.sample检查未参与训练的输入。示例成功只意味着训练循环已连通,并不证明实际业务质量或运营稳定性。
River 销售的不是 GPU 时间,而是四类用量
River 的差异不在于微调功能本身,而在于计量方式。根据官方说明,它支持 LoRA 和强化学习,并按训练和推理中实际使用的 Token 计费。其主张是,在没有请求时无需持续支付专用 GPU 容量费用。
在 2026 年 9 月 7 日查看的预览价格中,Qwen3.6-35B-A3B-FP8每百万 Token 的输入价格为 $0.33,缓存输入为 $0.066,输出为 $0.82,训练为 $1.00。检查点存储还需按每 GB 每月 $0.10 单独收费。这些数字只是当前价目表中一个模型的示例,不代表其他模型或之后的价格。
请将 River 报价拆成四行。
- 训练费:训练 Token 数 ÷ 100 万 × 对应模型的训练单价
- 推理费:输入、缓存输入、输出 Token 分别除以 100 万后,乘以各自单价的总和
- 存储费:检查点容量(GB)× 保留月数 × 每 GB 月单价
- 重跑费:用于评估调用、失败实验和再训练的预备用量
训练 Token 会受数据规模和迭代次数影响,推理费则受输入输出比例和缓存命中量影响。预览价格可能变动,因此在确定长期预算前必须再次确认最新价格。
专用 GPU 在低利用率时昂贵,在高利用率时情况不同
Together 的专用推理不按请求 Token 计费,而是按处于 ready 状态的副本硬件使用时间按分钟计费。每个副本独立产生费用;停止副本或缩减至 0 个后,对应计费也会停止。Together 说明,在高利用率下它可能比基于 Token 的无服务器方案更便宜。
不过,即使在当前官方价格文档中,H100 的单价也并不一致。支持硬件表将 H100 80GB 标为每小时 $3.99,但同一文档中的比较示例按单个 H100 副本每小时 $5.49 计算。仅凭所阅读的资料,无法确认原因是促销、配置差异还是文档更新延迟。因此,不要把一张 H100 的月成本当作固定值,应使用实际部署时控制台或报价单中显示的单价。
| 比较标准 | River Token 计费 | Together 专用推理 |
|---|---|---|
| 主要计费单位 | 输入、缓存输入、输出和训练 Token | 每个 ready 副本的 GPU 使用分钟 |
| 月成本公式 | 各类 Token 用量 × 各自单价 + 存储费 | 各副本 GPU 数 × 运行分钟 × 已确认的每小时单价 ÷ 60 的总和 |
| 请求稀少时 | 成本通常会随用量下降 | 若维持副本,即使没有请求也会计费 |
| 请求稳定时 | 随 Token 用量按比例增加 | 提高 GPU 利用率后可能更有利 |
| 估算前确认事项 | 各模型预览单价与存储量 | 实际适用单价、GPU 数和副本运行时间 |
归根结底,“Token 计费便宜”和“专用 GPU 昂贵”都是有条件的说法。对于间歇使用的内部工具,消除闲置容量的效果很大;但如果全天需要稳定吞吐量,就可以充分利用专用 GPU 的固定容量。计算盈亏平衡点需要模型吞吐量、输入输出比例、缓存命中率和延迟目标。
只有输入相同的请求,才能看到盈亏平衡点
要完成价目表比较,必须在双方处理相同的代表性请求,并先对齐质量和速度。即使模型名称相同,服务设置和硬件不同也可能导致吞吐量和延迟不同。
- 建立代表性请求集。请包含短输入和长输入、短输出和长输出,以及高峰时段频繁到来的请求。为每个请求附上答案或可由人工判断的业务通过标准。
- 只保留可比配置。在两边重复运行相同请求,记录业务通过率、p95 响应时间和每分钟吞吐量。即使价格更低,未达到目标质量或延迟的配置也应排除。
- 确定 Together 所需容量。调整 GPU 数和副本数,直到满足目标峰值吞吐量,并记录每个副本处于
ready状态的时间。月成本按Σ(各副本 GPU 数 × 运行分钟 × 部署时的每小时单价 ÷ 60)计算。 - 换算 River 的月度用量。将相同请求统计出的输入、缓存输入和输出 Token,乘以低、平均和峰值情景的请求次数。训练 Token 和检查点存储量应与推理费分开相加。
- 按流量分别记录选择。对于低、平均和峰值流量,在满足目标质量和 p95 延迟的配置中标出月总成本较低的一方。一种计费方式不必在所有区间都胜出。
比较完成标准
每个流量情景的一行中如已整理质量通过率、p95 延迟、吞吐量、月度推理费、训练费和存储费,并保留所采用 Token 单价或 GPU 每小时单价的确认日期即可。请将请求量和单价从评估假设替换为实际测量值和最新报价值。
11 亿美元不是节省比例的证明
River 在 Seed 和 Series A 中合计筹集了 11 亿美元。General Catalyst 和 AMP PBC 领投,NVIDIA、AMD Ventures、Y Combinator 和 Temasek 参与。不过,公开资料中未能确认估值、各投资者的金额和投资条款。
公司宣称无需基础设施团队即可在 15 到 20 分钟内完成复杂的强化学习运行,并能比封闭式替代方案降低 2 到 4 倍成本。官方公告和 TechCrunch 报道中可以确认这些数字,但比较模型和数据、Token 数量、质量等同性标准、硬件以及第三方复现结果均未公开。因此,不应将融资规模或公司所称的节省比例解读为生产性能的证据。
签订生产合同前需另行确认的事项
- SLA、支持的区域、故障历史和生产支持范围
- 数据保留与删除政策,以及所需的合规条件
- 适用于价格变动或意外峰值流量的月度支出上限
river://检查点能否外部导出及支持的格式
如果调用较少,例如小型内部工具,就有理由先测试 River 式 Token 计费。如果请求稳定且可以提高 GPU 利用率,专用推理可能带来更低成本。正确的选择不是训练费最低的选择,而是在满足目标质量和速度的同时,在实际流量中浪费最少的选择。
如果想深入了解
River AI raises $1.1B in funding across Series Seed and Series A 可以在原文中确认融资规模、投资者以及 River 所说明的 Token 计量方式。 river.ai
River API Docs 整理了客户端安装、准确的 import 路径、认证检查、允许模型查询和首次样例请求。 docs.river.ai
Pricing - Together AI docs 可以直接确认专用副本的计费状态和计算公式,以及当前文档中 H100 单价的差异。 docs.together.ai



