Skip to content

主题文章

AI Infra 工程

从运行底座、AI Backend 和模型服务走向 GPU、Kubernetes、企业平台、分布式训练与可靠交付。37 篇文章

认识 AI Infra 与运行底座

什么是 AI Infra?它为什么不只是部署模型从一次模型请求出发,解释 AI Infra 管理的计算、数据、模型、运行平台与可靠性,并划清它和算法、后端、MLOps、SRE 的关系。Linux 服务是怎样运行的?从进程、端口到正常退出沿一个模型 API 从启动到退出的生命周期,解释程序、进程、端口、权限、文件描述符、内存、磁盘与信号。DNS、TCP、TLS 和 HTTP 分别是什么?一次请求怎样到达服务器从一条 URL 开始,逐层解释域名解析、IP 与端口、TCP 连接、TLS 身份验证、HTTP 消息和反向代理。OCI 镜像、容器隔离、cgroup 与进程生命周期从镜像清单到容器进程,解释 Layer、Namespace、cgroup、PID 1、挂载和优雅退出。Docker Compose:组织本地 AI 服务栈把 API、PostgreSQL、Redis、Worker 和对象存储放入同一可恢复网络,讲清卷、探针、依赖与日志。Nginx、TLS、模型 API 与 SSE 流式入口从普通响应正常但 Token 长时间不出现的问题进入反向代理、缓冲、连接超时、TLS 和热加载。

AI Backend 基础设施

Python AI 服务运行时:typing、asyncio、线程与多进程用并发模型请求、分词和文档解析三类任务解释类型边界、事件循环、取消、线程池与进程池。FastAPI 构建 OpenAI 兼容的 LLM 服务完整实现请求校验、依赖注入、Middleware、模型路由、普通响应、SSE、Token 用量和错误契约。Redis 在 AI 系统中的缓存、Session、限流与任务角色比较缓存、会话、令牌桶、Broker 和调度状态的读写模式,解释 TTL、淘汰、持久化与故障边界。PostgreSQL、JSONB、pgvector、索引与连接池从用户、Prompt、Agent 状态和 Embedding 四类数据进入关系约束、JSONB、向量索引、事务和 PgBouncer。消息队列与 Worker:拆分在线推理和离线任务按在线 Agent、解析、Embedding、评测任务讲清 ACK、幂等、重试、死信、Prefetch、租约和停机排空。对象存储:模型、文档、Multipart 与生命周期从大文件上传进入 Bucket、对象键、预签名 URL、分段上传、校验和、版本和孤立对象清理。

LLM Serving

LLM Serving:从模型文件到稳定推理 API拆开准入、调度、推理引擎、流式传输、用量统计和观测,建立模型服务的职责边界。Hugging Face、Qwen、Llama、DeepSeek 与首次开源模型部署从模型仓库选择进入许可证、Revision、配置、Tokenizer、权重、缓存和启动前检查。Tokenize、Prefill、Decode 与流式推理生命周期沿一条生成请求解释分词、批处理、Prefill、逐 Token Decode、采样、停止和流式发送。Continuous Batching、PagedAttention 与 KV Cache比较静态批处理和连续批处理,解释 KV Block、请求调度、Prefix Cache、公平性和显存压力。vLLM 服务、OpenAI 兼容接口与故障定位从启动参数、模型加载和 Readiness 进入普通请求、流式请求、并行策略、显存配置与错误分层。模型制品、精度、量化与推理优化讲清 Config、Tokenizer、Safetensors、FP32、FP16、BF16、INT8、INT4、量化校准和性能验证。

GPU 基础

GPU 基础:是什么、怎么工作,以及 AI 为什么使用它先定义 GPU、主机与设备的数据路径,再用矩阵乘解释并行执行、显存、带宽和 AI 工作负载取舍。CUDA 执行模型:Thread、Block、Grid、Warp 与 SM沿一次 Kernel Launch 解释 Host/Device、线程层级、Warp 调度、SM 资源、同步和内存访问。GPU Driver、CUDA Runtime、HBM/VRAM 与显存诊断从 CUDA 不可用和 OOM 进入驱动兼容、权重、激活、工作区、KV Cache、数据搬运和多卡需求。

Kubernetes AI Infra

为什么 AI 平台需要 Kubernetes:控制面与核心对象从多模型、多副本和资源声明进入控制面、Pod、Deployment、Service、Ingress、配置与期望状态。Kubernetes 部署 AI 服务:GPU Operator、模型卷与探针把模型服务放入集群,解释 NVIDIA Device Plugin、GPU Operator、Runtime、模型制品卷、启动探针和滚动发布。Kubernetes GPU 调度、共享、MIG 与自动扩缩容从资源请求进入设备发现、标签、污点、亲和性、拓扑、共享、MIG、队列和扩缩容信号。

企业级 AI Platform

LLM Gateway:API Key、路由、限流、Token 与成本沿一次多模型请求解释身份、能力路由、配额、限流、预算、用量、错误映射和流式透传。多模型管理平台:注册、版本、路由、健康与切换从 GPT、Claude、Qwen、DeepSeek 和 Llama 的差异进入模型注册、能力声明、Deployment、探测和故障切换。Agent Runtime 基础设施:LangGraph、MCP、工具与恢复沿一次长任务解释 Turn、状态图、工具契约、Checkpoint、Worker Lease、并发、取消和终态。RAG Infra:从文档发布到带证据回答完整串联文件准入、解析、切片、Embedding、向量索引、知识版本、检索、重排、上下文和引用。OpenTelemetry、Prometheus、Grafana、Langfuse 与 AI SLO把入口、检索、模型、首 Token、队列、GPU、引用和终态连接成 Trace、Metric、Log 与质量信号。TTFT、TPOT、吞吐、队列、容量与成本用到达率、并发、服务时间、Little’s Law、开放负载和单位成本建立容量判断。AI Platform 安全:多租户、Secret、数据、模型与审计从恶意 Prompt、越权检索、泄露密钥和不可信模型制品进入纵深防御与责任边界。

分布式训练基础设施

分布式训练:Data、Tensor、Pipeline Parallel、DDP 与 FSDP从单卡放不下和训练过慢出发,比较数据、参数和流水线并行的状态分布、通信和检查点。DeepSpeed ZeRO:状态分片、Offload 与显存边界拆开参数、梯度和 Optimizer State,逐级解释 ZeRO-1、2、3、通信、CPU/NVMe Offload 和恢复。NCCL、Collective、AllReduce 与多机 GPU 通信沿一次梯度 AllReduce 解释 Rank、Communicator、Ring/Tree、NVLink、PCIe、RDMA、拓扑和失败传播。

交付与综合项目

CI/CD、SBOM、签名、Secret 与不可变制品从提交到已验证镜像,串联依赖锁定、测试、制品、SBOM、签名、证明、Secret 和环境提升。候选验证、迁移、切流、回滚、备份与恢复沿预检、备份、候选实例、兼容迁移、旁路验证、流量切换、即时回滚和隔离恢复设计发布。综合项目:设计 Enterprise AI Platform把 Gateway、Agent、RAG、vLLM、GPU、PostgreSQL、Redis、对象存储、观测、成本和发布连接成可演进平台。