云与算力基础
呼应"算力直达":GPU 云、推理部署与 API 的取舍——自托管 vs API 怎么算账。
RunPod 自建推理 vs 直接调 API:成本平衡点怎么算
不给单价,只给算法:自建侧该把哪些成本项列进来、按什么口径折算到同一个分母,为什么利用率而不是单价决定结论,Serverless 把利用率问题转移成了什么,以及一份能直接拿去填数的对照清单。
RunPod 常见问题排查:Pod 起不来、抢不到 GPU、端口连不上
按官方文档梳理 RunPod 最常撞到的几类故障:重启后 Zero GPU 与 Pod 迁移、502 与 524 的区别、端口映射为什么连不上、JupyterLab 空白页与 token 认证、盘满了怎么定位、主机维护的口径,以及 Serverless 侧的排查入口。
RunPod 计费机制拆解:Pod 与 Serverless 分别按什么扣钱
拆开 RunPod 的账单结构——预付余额怎么实时扣、Pod 停机与终止分别停掉了哪部分费用、Serverless 计的是 worker 存在的哪三段时间、存储为什么是唯一穿透所有形态的常驻支出,以及 savings plan 与 cost center 的机制边界。
RunPod Serverless 部署推理服务:冷启动、并发与 Worker 伸缩
按官方文档拆开 RunPod Serverless 的三层结构与两类端点:冷启动的确切定义与四条缓解路径、active 与 flex worker 的差异、六种 Worker 状态哪几种计费、两种伸缩策略,以及两个会咬人的超时和排错入口。
RunPod 上手全流程:注册、充值、开出第一个 GPU Pod
按真实操作顺序走一遍 RunPod 的开机流程——预付费余额与自动充值的机制、API Key 的作用域怎么定、选机表单里哪几个字段会把后面的决定一次性锁死、四种连接方式各自的边界,以及第一台机器上量之前该先验证的那几件事。
RunPod 存储怎么选:容器盘、Volume 与 Network Volume 的取舍
按官方文档拆三种存储的持久化边界:Container Disk 停机即清空、Volume Disk 只活到 Pod 被删、Network Volume 必须创建时挂载;另讲加密覆盖到哪一层、Edit Pod 会重置什么、数据进出四种方式与存储计费机制。
RunPod 模板与自定义镜像:从官方模板到自己的 Dockerfile
拆开 RunPod 的模板究竟打包了哪些东西、官方模板替你省掉了哪几步、什么信号说明该自己做镜像;并讲清镜像仓库来源、标签纪律、权重该不该打进镜像、启动命令与环境变量怎么交接,最后算一笔自己维护镜像的真实成本。
在 RunPod 上用 vLLM 起一个 OpenAI 兼容接口
从官方文档拆解 RunPod 的 vLLM worker:环境变量与 vllm serve 命令行参数的映射规则、几个模型族各自必须设的变量、OpenAI 兼容端点的 base url 与 model 字段怎么填、原生 API 与 OpenAI 接口的分工,以及模型权重走缓存还是打进镜像对冷启动的影响。
RunPod 与 Vast.ai 怎么选:可靠性、中断风险与运维成本
按官方文档拆出几根能对齐的轴:供给结构是分层的云还是主机市场、价格是标价还是实时行情、中断风险分别从哪来、两家托管层各自托管什么、存储与带宽的计费结构差异,附按任务类型找判据的表。
RunPod 是什么:GPU 云租用的 Pod 与 Serverless 两种形态怎么选
从官方文档梳理 RunPod 的两种交付形态——Pod 是租一台归你的带 GPU 容器、Serverless 按实际计算时间跑你的 Worker;并讲清 Secure Cloud 与 Community Cloud 的可靠性差异、三种存储各自的持久化行为、计费从什么时候开始到什么时候停,以及官方明确列出的不支持项。
SGLang 前缀缓存怎么用:Agent 与多轮对话的命中率
讲清 SGLang 前缀缓存的组织与淘汰机制、什么样的请求结构才吃得到缓存、Agent 与多轮对话里最容易毁掉命中率的那个坑、调度策略与命中率的关系,以及命中率怎么观测。
SGLang 多卡部署:张量并行、流水并行与专家并行怎么配
张量并行、流水并行、专家并行、数据并行各自切的是什么、分别解决哪种瓶颈,SGLang 对应的参数名与硬约束怎么看,MoE 为什么绕不开专家并行与负载均衡,以及量化与并行度之间的相互影响和显存规划的正确做法。
SGLang 部署 OpenAI 兼容服务:启动参数与并发调优
从环境门槛与安装方式起步,走完 SGLang 起服务、判断就绪、把 OpenAI 客户端接过来的全流程,再逐个拆解并发与显存相关的启动参数各自在调什么、可观测性怎么开,以及调优该按什么顺序动手。
SGLang 结构化输出:约束解码怎么保证 JSON 一定合法
约束解码把 JSON 合法性从概率问题变成语法问题。本文讲三种约束形式与 structural tag 的写法、三个语法后端各支持什么、OpenAI 兼容端点与原生 generate 端点的传参差异,以及什么场景用后置校验更划算。
SGLang 与 vLLM 怎么选:前缀重叠比例才是判据
不比跑分,只拆机制:两者同源到什么程度、前缀重叠比例该怎么量、细粒度前缀树与固定块哈希各自的取舍、约束解码的开销来自哪里、硬件与量化格式的交叉点为什么能直接否决一个选项。
SGLang 是什么:RadixAttention 与它和 vLLM 的根本差异
SGLang 是 LMSYS 托管的高性能推理服务框架,核心是用 radix 树做前缀 KV 缓存的 RadixAttention。本文讲它的缓存复用机制、什么样的负载才吃得到这个机制的好处、结构化输出与硬件支持范围,以及它和 vLLM 的关系到底是什么。
Vast.ai 竞价实例的中断风险与应对:断点续跑与数据保全
讲清竞价实例的持续竞价机制、「暂停」与「销毁」的本质区别、抢占的触发条件,以及检查点频率、状态存放位置、恢复幂等这三件工程活怎么落,并把暂停期间存储照计费这笔反直觉的账摊开。
Vast.ai 怎么挑机器:可靠性评分、带宽与中断风险怎么看
拆解 offer 卡片上哪些字段是硬约束、哪些只是概率量,讲清可靠性评分为什么是滞后指标、带宽与存储为什么要单独算账,并给出按任务类型选租用类型的判据表。
Vast.ai 上手:搜机器、开实例、跑起第一个推理服务
按真实操作顺序走一遍 Vast.ai:账号与连接钥匙的前置准备、模板决定了什么、offer 卡片上哪些字段真影响决策、SSH/Jupyter/Instance Portal 各自的场合、Docker 端口映射这一关,以及 start/stop/destroy 对数据和账单的不同后果。
Vast.ai 是什么:去中心化 GPU 市场的机制与适用边界
拆解 Vast.ai 的市场型供给结构:独占 GPU 的容器实例、三种租用类型的优先级规则、可靠性评分为何是最该盯的筛选维度、存储的连续计费与销毁边界,以及主机掉线后为何要自己重启
国内推理平台横向:七牛云、ModelScope、PPIO 按什么维度选
把七牛云 AI 推理、ModelScope API-Inference、PPIO 派欧云三家的官方文档摊开对照,逐条列出协议兼容面、额度机制、官方对生产用途的态度、计费口径透明度、限流信息公开程度这几个维度上的真实差别,并给出三种典型场景下的判据,而不是排名次。
ModelScope API-Inference 接入:免费额度的机制与边界
讲清四件事:必须先绑定阿里云账号这个前置条件、同一个 key 下 OpenAI 与 Anthropic 两个 base url 分别怎么填、免费额度的三层限制机制,以及官方为什么明确劝你别把它用在有 SLA 要求的线上服务上。
PPIO 派欧云模型 API 接入:双协议端点、限流与计费机制
覆盖 PPIO 的 OpenAI 与 Anthropic 双端点怎么填、模型 id 与密钥的写法、限流按什么维度算、状态码与计费的对应关系,重点讲 499 客户端断连为什么全额计费,以及这对超时与重试设计的实际影响。
七牛云 AI 大模型推理服务接入:双协议端点与模型清单怎么查
按官方文档口径梳理七牛云大模型推理服务的接入路径:一个 base url 同时挂 OpenAI 与 Anthropic 两种协议端点、两种列模型的方式、请求体必填项、第三方工具里的模型名写法、按 token 计费与月初出账的机制,以及限流数值未公开时工程上该怎么兜。
能离线跑的活别在线跑:批处理怎么省钱,离线任务怎么跑稳
优化成本时人们盯着单价,很少先问任务是否真的需要实时。本文讲哪些活能转离线、离线省钱的三条路径、异步任务的工程要点,以及批处理可靠性设计与成本算例。
GPU 是租还是买:按秒、按小时与买断的成本账怎么算
GPU 有按秒、按小时、买断三种付费形态,直接比价签必错。本文换算到同一口径,讲清使用率如何决定哪种划算,以及按秒计费下更贵的卡为何更省。
基线自建、峰值上云:自建和云 API 混合部署怎么落地
自建的痛点是波谷空转,云 API 的痛点是量大了单价扛不住。这篇讲混合部署的网关结构、vLLM 侧的接入前提、四种溢出判据的取舍,以及一份能复算的三方案成本对照。
自建推理用什么框架:七个维度加一套自测方案
网上的推理框架跑分互相打架,因为模型、显卡、并发都不同。本文给出七个可迁移的选型维度和一套能在自己机器上跑出结论的自测流程。
一张卡装不下时多卡怎么切:张量并行和流水并行怎么选
模型单卡装不下,加卡只是第一步,切法才决定结果。讲清张量并行与流水并行各自的机制与代价,给出选型流程、与其他显存旋钮的先后顺序,以及实测记录表模板。
Ollama 能不能上生产:本地好用不等于扛得住线上
Ollama 一条命令跑模型太顺手,容易让人以为生产也这么来。本文讲清它擅长什么、上线前必须问的六个问题,以及何时它上生产是合理的。
模型量化怎么选:不看别人的跑分,用自己的验收标准决定上不上
量化省多少显存能算,损失多少质量只能测。讲清量化省的是权重而非 KV cache,给出评测流程和「先调框架参数、最后才量化」的决策顺序。
自建 vs API 的盈亏平衡点怎么算:一个能填参数的账本模型
把「自建划不划算」从立场之争变成一道能解的方程:列全成本项、分清买断与按需租用、给出盈亏平衡公式与完整算例,并讲透使用率这个命门。
vLLM 部署实操:起一个 OpenAI 兼容服务
用 vLLM 起一个 OpenAI 兼容服务:启动参数怎么查、官方端点怎么用、KV cache 与并发的关系,以及 OOM 的四步缓解顺序。
模型需要多少显存:权重、KV cache 与余量的三块估算法
网上「70B 要多少显存」的答案互相打架,因为都漏了前提。本文把显存拆成权重、KV cache、余量三块,给出可自算的公式与 vLLM 侧的调节参数,让你按自己的模型配置估。
跑一个模型要多少显存:先回答四个问题,再决定买哪张卡
显存需求是精度、上下文、并发、余量四个变量的函数,不给前提的答案都是错的。本文按「有卡选模型、有模型选卡、装不下、刚好够」四种场景给出决策路径。
base_url 怎么填:七家推理平台接入报 404 的四类坑
接入报 404 时先别换 key。本文逐字列出七家推理平台的 base_url 对照表,归纳四类常见的填错方式,并给出可照做的验证流程。
DeepInfra 接入实操:base URL、token 鉴权与模型 ID 的三个坑
用 OpenAI SDK 接 DeepInfra 只改三处,但路径顺序、环境变量名和 HuggingFace 风格模型 ID 的大小写各埋了一个坑。附三档计费口径拆解与限速未知时的稳妥做法。
DeepInfra 报错调不通?地址鉴权模型 ID 三层排查法
DeepInfra 调不通怎么查:按地址、鉴权、模型 ID 三层定位,讲清 404 与 401 的区别,附一份排查顺序清单。
Fireworks AI 双兼容端点迁移:OpenAI 与 Anthropic 两套代码不用重写
Fireworks AI 官方同时提供 OpenAI 与 Anthropic 两种兼容端点。本文讲清这个差异点的真实价值与边界,以及 base_url 少一段导致 404 的排查顺序、三段式模型 ID 收口与迁移必测清单。
Groq API 接入指南:拿 key 到 OpenAI 兼容避坑
手把手讲清 Groq API 的三步接入:拿 key、把 base_url 指向 OpenAI 兼容端点、发出首个请求,并逐条拆解官方列出的不支持参数和组织级限速会在什么场景把你绊倒。
Groq API 错误码逐条排查:从 401 到 499 怎么定位怎么修
按 Groq 官方错误码清单逐条拆解 400/401/403/404/413/422/424/429/498/499 与 5xx 的成因、定位手法和修复动作,并给出一份可直接抄的错误分流重试代码。
Groq、DeepInfra、Novita 怎么选?只比能查证的三件事
推理平台对比不该比"谁更快"这种查不到出处的说法。本文只比接入形态、公开定价和公开限速三样能验证的东西,比不了的直接说比不了。
模型悄悄变了怎么办:把模型版本钉死的几种做法
没改代码没改 prompt,输出格式却突然变了。这类问题最难查,因为没有任何变更记录指向它。讲版本快照与滚动别名的取舍、按环境分策略的做法,以及回归集这道防线。
Nebius Token Factory 接入实录:末尾斜杠与文档域名迁移两个坑
从 base_url、鉴权到模型 ID,讲清 Nebius Token Factory 的 OpenAI 兼容接入方式,重点拆解官方 base_url 末尾斜杠的验证方法、带日期后缀的模型版本管理,以及文档域名迁移对工程的实际影响。
Novita AI 接入:base_url 没有 /v1 后缀
从 base_url、Bearer 鉴权到 deepseek/deepseek-r1 这类模型 ID,讲清 Novita AI 的 OpenAI 兼容接入方式,并给出官方定价表与版本钉选的工程权衡。
Novita 调不通/报错:404 多半出在 base_url
Novita AI 调不通最常见的症状是 404,方向却常被误判到模型名上。本文按地址、鉴权、模型 ID 三层给出可执行的排查顺序。
OpenAI 兼容平台迁移:换一家 API 要改什么、要测什么
官方口径说迁移只改三处配置,那只覆盖「能跑通」。本文给出四家平台的 base_url 与模型 ID 写法差异,以及一份能照着走的迁移验收清单,覆盖参数、流式、函数调用与计费口径。
推理平台怎么选:别看跑分,看官方公开了什么
推理平台对比大多在比跑分,可那些数字查不到出处。本文换个能验证的维度:八家平台官方文档究竟公开了什么,公开度直接决定你的运维成本。
Replicate 怎么接入?它不是 OpenAI 兼容,是异步任务 API
Replicate 的接入范式和多数推理平台不一样:自有 predictions 接口、任务式异步调用、按秒计费。本文讲清三种 endpoint、webhook 与同步开关、以及那张单位不统一的价格表怎么读。
Ollama 本地快速跑模型:安装、拉取与 API 接入指南
Ollama 一行命令本地运行大模型,支持 macOS/Linux/Windows,兼容 OpenAI API,适合开发测试与私有化原型验证。
模型量化怎么选:GGUF、AWQ、GPTQ 对比与选型指南
大模型量化三大方案 GGUF/AWQ/GPTQ 原理对比、精度损失、显存收益与推理框架适配,帮你选对量化方案少走弯路。
Serverless 推理方案对比:按请求付费,零运维跑大模型
Serverless 大模型推理方案横评:Replicate、Modal、RunPod Serverless、together.ai 冷启动/延迟/价格对比与适用场景分析。
TGI(Text Generation Inference)部署指南:Hugging Face 推理服务器
Hugging Face TGI 部署开源模型推理服务,Docker 快速启动、Flash Attention、连续批处理与 OpenAI API 兼容配置详解。
推理吞吐与并发优化:让你的 GPU 不再空转
系统讲解推理吞吐的核心指标、瓶颈定位与并发优化手段,涵盖 TPS、TTFT、框架调优与硬件选型取舍。
vLLM 部署高并发推理:PagedAttention 原理与生产实战
vLLM PagedAttention 机制、安装部署、OpenAI 兼容 API、高并发调优参数与常见坑,快速上生产级推理服务。
自建推理成本测算:GPU 云、硬件与 API 的真实账单对比
给出自建推理服务的完整成本模型,涵盖 GPU 云租赁、自购硬件、人力运维与 API 调用的定量对比框架。
端侧与本地部署:什么场景值得把模型跑在设备上
梳理端侧/本地大模型部署的适用场景、硬件门槛、主流框架与核心取舍,帮你判断是否真的需要离线推理能力。
微调自托管 vs 用 API:怎么在两条路中做正确选择
系统对比微调自托管与直接调用 API 的适用场景、成本结构、风险与决策框架,帮开发者在两条路中选对方向。
推理 GPU 选型:RTX 4090、A100、H100 怎么选
大模型推理 GPU 选型横评:消费卡 RTX 4090 vs 专业卡 A100/H100,从显存、带宽、ECC、多卡互联维度给出选型决策框架。
API + 自托管混合推理方案:灵活性与成本的最优解
讲解如何设计 API 与自托管混合的推理架构,涵盖流量分流策略、模型分级路由、故障切换与成本控制实践。
KV Cache 与显存占用:推理加速背后的显存杀手
深入解析 KV Cache 的工作原理、显存计算方法与 PagedAttention 优化,帮你在高并发场景控制显存消耗。
LMDeploy 部署大模型推理:TurboMind 引擎与量化实战
LMDeploy TurboMind 引擎部署 Qwen/InternLM 推理,支持 W4A16 量化与连续批处理,附 OpenAI API 服务器启动配置。
批量推理与 Continuous Batching:吞吐提升的核心原理
对比静态批处理与 Continuous Batching 的工作机制与性能差距,讲清迭代级调度如何让 GPU 利用率翻倍。
云 GPU 平台盘点:国内外主流算力租用选项对比
国内外主流云 GPU 平台横评:阿里云、腾讯云、AutoDL、Vast.ai 等,从显卡型号、计费方式、网络访问与适用场景给出选型建议。
跑大模型要多少显存?显存估算公式与选卡指南
用近似公式讲清大模型推理显存需求:权重占用、KV Cache、量化降显存,附不同参数量与精度下的显存对照表和消费卡 vs 专业卡对比。
自托管大模型 vs 调用 API:怎么算账才不踩坑
从成本、运维、合规、弹性四个维度对比自托管与 API 两条路径,按调用量给出清晰的决策分界线,避免选错路走弯路。
大模型算力基础:GPU 云、推理部署与 API 取舍完全指南
系统梳理大模型推理 vs 训练算力差异、自托管 vs API 决策逻辑、显存选型与主流部署框架,帮你在成本与灵活性间找到最优路径。
静态站如何低成本上云
对象存储 + CDN 与服务器托管静态站的几种低成本上云方式。
常见问题
自己部署大模型还是用 API?
低频/小规模用 API 更省心;高频、强数据合规或需深度定制时自托管更划算,可按月调用量与硬件摊销实算。
跑大模型要多少显存?
约等于参数量×每参数字节(FP16 约 2 字节)再加 KV cache 与开销;量化到 4bit 可大幅降低显存占用。
vLLM 和 Ollama 怎么选?
vLLM 适合高并发生产推理,Ollama 适合本地快速试跑;按吞吐与易用性取舍。
在纠结自建还是用 API?
力达云聚合 API 内测开放中:一个 key 调多家模型、按量计费、稳定接入。