AI产品库

产品情报 / 模型推理云与 GPU 算力

DeepInfra LogoDeepInfra

面向开源模型的按 token 计费推理云

官方自我描述为「高性价比、可扩展、易部署、面向生产」的机器学习模型与基础设施;首页主打「在不为账单发愁的前提下把规模做到万亿级 token」,并提供实时推理指标面板。

深度介绍

DeepInfra详细介绍

💰

按 token 三列标价,缓存另有折扣

DeepInfra 的定价页把每个模型拆成三列:每 100 万输入 token、每 100 万缓存输入 token、每 100 万输出 token,缓存命中单独给价,这对系统提示词或长前缀反复出现的场景很关键。页面上可见的档位跨度很大,例如有每百万输入 0.06 美元 / 输出 0.18 美元的档,也有每百万输入 2.85 美元 / 输出 14.25 美元的档;缓存价通常显著低于普通输入价(例如某档输入 0.06 美元、缓存 0.015 美元)。选型时的正确做法是按自己的输入输出比例算总价,而不是只比输入单价。

🖥

GPU 也可以按实例小时租

除托管推理外,官方提供 GPU 租用,导航与定价页都单列了 GPUs 一栏,首页写明「On-Demand DGX B300 GPUs」按每小时 4.89 美元/实例计费。这条线的意义在于给「模型固定、用量很大」的团队一条自建路径:与其按 token 付钱,不如直接租实例自己跑,把成本压到硬件利用率上。两条线的取舍取决于用量是否稳定——波动大走按 token,稳定且量大走租实例。

📊

实时推理指标面板

官方首页提供「Live AI Inference Metrics」面板,指标包括每秒 token 数(Tokens per second)与首 token 时间(Time to first token)等,官方描述为「对速度、规模、稳定性与花费的端到端洞察」。这类面板对选型很实用:同一个模型在不同服务上的标价可能接近,但首 token 延迟与吞吐差异会直接决定产品手感,能实测对比比只看价格表更靠谱。

🔌

面向生产的接入方式

官方把自家定位写成「易部署、面向生产」,配合模型目录与文档提供标准 HTTP 接口与常见语言的客户端,迁移时通常只需替换 base URL 与密钥。对已经在用其他推理服务的团队,这种兼容性意味着可以先用少量流量做灰度对比,再决定是否整体切换;文档站单独提供文档入口,模型目录则按用途分类,便于先按任务找模型再比价。

📚

模型目录覆盖开源主力

模型目录是这类平台的核心资产:页面上按文本、图像、语音等方向列出可调用模型,并标注每个模型的输入输出单价与上下文信息,方便直接横向比价。因为绝大多数是开放权重模型,同一份权重在别处也能自托管,所以迁移成本主要在接口改配而非重训;反过来也说明平台之间的竞争集中在单位成本、延迟与稳定性这三项。

📈

规模叙事:从创业公司到万亿级 token

首页把「Scale to trillions of tokens without breaking the bank」当作主标语,并提到公司完成 1.07 亿美元 B 轮融资以扩展推理云规模。对使用者来说,融资与规模叙事的实际含义是容量与稳定性预期:推理云的常见痛点是高峰期限流与排队,能持续扩容的供应商在大流量场景下更不容易掉链子;具体容量与 SLA 仍需按其商务条款确认。

🧮

怎么用它做成本决策

一个有代表性的用法是:先用少量真实流量跑两个候选服务,记录首 token 延迟、每秒 token 数与失败率,再把自己的输入输出比例代入两边价目表算总成本,最后按「月成本差 ÷ 迁移工作量」决定是否切换。DeepInfra 的资料结构适合这套流程——价格三列公开、指标面板公开、模型目录公开,三者都能直接取数,不必先谈商务。

🏢

适合谁、不适合谁

它适合两类人:一类是预算敏感、需要把每次调用的成本算到小数点后的应用开发者;另一类是模型固定、用量大、希望从按 token 模式过渡到租实例的团队。相对不适合的是把首 token 延迟当作唯一指标的实时语音类应用,以及需要厂商提供极强合规背书与专属支持的机构——这类需求应直接走企业沟通,而不是看公开价目表。

产品特点

核心功能与独有价值

01

缓存输入单列一列价格

定价页把「每百万缓存输入 token」独立成列,缓存命中价通常远低于普通输入价。对系统提示词很长或前缀重复率高的应用,这一列比输入单价更能决定账单,公开出来也便于事前估算。

02

同一家既有按 token 也有按实例小时

官方同时提供托管推理与 GPU 租用(例如按需 DGX B300 每小时 4.89 美元/实例)。用量小时按 token,模型固定且量大时转租实例,两种模式在同一平台内切换,结算与账号体系不拆分。

03

把实时指标当作公开资料

首页直接给出每秒 token 数与首 token 时间等实时指标面板,官方称其为对速度、规模、稳定性与花费的端到端洞察。选型阶段可以直接实测对比,而不必只依赖第三方跑分或宣传口径。

04

以开放权重模型为主,退出成本低

目录里绝大多数是开放权重模型,同一份权重在别处可自托管,因此平台锁定的风险较低。迁移主要改接口配置与推理参数,代价集中在验证与灰度上,而不是重做模型。

最近动态

重要更新

完成 1.07 亿美元 B 轮融资

官网公告条显示 DeepInfra 完成 1.07 亿美元 B 轮融资,用于扩展其推理云规模,官方同时用「自 A 轮以来处理的 token 量」作为规模佐证。对使用者而言,这类信息主要影响容量与稳定性预期,具体配额与 SLA 仍需按商务条款确认。

定价页按输入 / 缓存输入 / 输出三列列价

截至 2026 年 9 月,官方定价页对每个模型给出每 100 万输入 token、每 100 万缓存输入 token 与每 100 万输出 token 三列价格,可见档位跨度从每百万输入 0.06 美元 / 输出 0.18 美元到每百万输入 2.85 美元 / 输出 14.25 美元,缓存命中价明显更低。价格随模型更新较快,请以当期页面为准。

按需 DGX B300 GPU 对外开放

官方在首页与定价页列出 GPU 租用档位,其中「On-Demand DGX B300 GPUs」按每小时 4.89 美元/实例计价,并提供 GPUs 独立入口。对模型固定、用量大的团队,这是从按 token 计费转向按硬件计费的选项;数量与可用区域需按当期页面或商务沟通确认。

首页提供实时推理指标面板

官方首页设有 Live AI Inference Metrics 面板,列出每秒 token 数与首 token 时间等指标,官方描述为对速度、规模、稳定性与花费的端到端洞察。做选型时可结合自家负载实测对比,而不是仅参考标价或公开跑分。

产品总结

DeepInfra 是一个面向开源模型的推理云。官方自我描述为「高性价比、可扩展、易部署、面向生产」的机器学习模型与基础设施,首页主标语是「在不为账单发愁的前提下把规模做到万亿级 token」,并配有实时推理指标面板。产品线有两条:一条是托管推理 API,另一条是 GPU 租用——官方在首页与定价页列出 GPUs 档位,其中按需 DGX B300 按每小时 4.89 美元/实例计价。 计费口径是它最值得看的部分:定价页对每个模型给出三列价格,分别是每 100 万输入 token、每 100 万缓存输入 token 与每 100 万输出 token。页面上可见的档位跨度很大,例如存在每百万输入 0.06 美元 / 输出 0.18 美元的档,也存在每百万输入 2.85 美元 / 输出 14.25 美元的档;缓存输入价通常显著低于普通输入价,例如某档为输入 0.06 美元、缓存 0.015 美元,另一档为输入 1.30 美元、缓存 0.10 美元。对系统提示词较长或前缀重复率高的应用,这一列对账单的影响往往大于输入单价。 官方另提供实时推理指标面板,指标包括每秒 token 数与首 token 时间等,官方称其为对速度、规模、稳定性与花费的端到端洞察;模型目录按方向列出可调用模型并标注价格与上下文信息。接入层面主打易部署与生产可用,配套模型目录与文档,多数迁移只需替换 base URL 与密钥,便于用小流量做灰度对比。公司层面,官网公告条显示其完成 1.07 亿美元 B 轮融资,用于扩展推理云规模。 使用前需要注意:价格档位与模型更新较快,做预算应以当期定价页与自身输入输出比例计算,而不是只比较输入单价;缓存价只有在命中时生效,是否命中取决于请求前缀的重复程度与缓存策略;GPU 租用按实例小时计费,闲置时间同样计费,应先测算利用率;首 token 延迟对不同应用的重要性差异很大,语音与实时对话类场景建议先用指标面板实测再决定;开放权重模型的许可与平台条款相互独立,商用前需分别核对。整体而言,它适合预算敏感、希望把单次调用成本算清楚,并可能从按 token 逐步过渡到租用实例的团队。

产品类型
模型推理云与 GPU 算力
支持平台
推理 API / OpenAI 兼容接口 / 缓存输入 / GPU 租用(实例小时) / 实时指标面板 / 模型目录 / Python/JS 客户端 / 企业部署
资费模式
按 token 计费:每 100 万输入 / 缓存输入 / 输出 token 三列标价;GPU 侧按实例小时计费,官方列出按需 DGX B300 每小时 4.89 美元。

核验信息

参考文章与数据来源

本页事实来自 DeepInfra 官方渠道:官网首页(定位描述、主标语、实时推理指标面板的指标名、按需 DGX B300 GPU 每小时 4.89 美元、B 轮融资公告条、模型目录入口)与官方定价页(每 100 万输入 / 缓存输入 / 输出 token 三列计价格式,以及页面上可见的各档价格数值),另有模型目录与文档入口。核验时间为 2026 年 9 月 22 日。价格与模型档位更新较快,缓存价是否生效取决于实际前缀命中,请以官方当期页面为准。

  1. 官网DeepInfra 官网
  2. 官网定价与 GPU 租用
  3. 官网模型目录
  4. 官方文档官方文档
  5. 官网官方分享图

用户体验调查

DeepInfra介绍页面对您是否有帮助?