数据中心 / 建筑与数据流
BXR / AI DATA CENTER
AI 数据中心
从建筑外部,认识算力的物理空间。
01 / 建筑外立面
园区总览
正在准备三维模型…
拖动旋转 · 滚轮缩放 · 双指缩放
01
02入口与网络接入
玻璃门厅连接主楼,对应网络进入园区的起点。
03
AI 推理请求完整数据流转图(从用户到返回)
以"用户提问 → AI 生成回答(多 GPU 集群推理)→ 返回用户"为主线
请求 / 数据流
计算 / 内部数据流
返回 / 结果流
1 用户发起请求
用户设备
用户在设备端输入文本、图片或语音,形成一次 AI 请求。
手机 App
→
PC / 浏览器
→
第三方应用API 调用
→
用户输入文本 / 图片 / 语音
↓
2 互联网传输
互联网传输
请求经过运营商网络、CDN 边缘接入点、与数据调度负载均衡进入数据中心。
运营商网络
→
光纤传输
→
CDN 边缘接入点(可选)就近接入与缓存
→
调度数据负载均衡
↓
3 数据中心网络
数据中心网络
请求经核心交换机、汇聚交换机、ToR 交换机路由分发数据至目标服务器。
核心交换机Core Switch
→
汇聚交换机Aggregation
→
ToR 交换机Top of Rack
→
服务器集群多台服务器
↓
4 服务器接入
服务器接入
光信号经光模块完成光电转换,再由 NIC 接收;DPU 可承担卸载。
目标服务器Server
→
光模块接收光纤信号
→
光电转换(O/E)光信号 → 电信号
→
NIC 网卡处理网络数据帧
→
DPU网络 / 存储 / 安全卸载
↓
5 服务器内部处理
CPU 与主机内存
CPU 解析请求、管理内存与上下文,并调度 GPU 执行推理。
CPU解析请求(变成 token)与任务调度
→
主内存 DRAM上下文、队列与中间数据
→
PCIe 总线CPU、内存与 GPU 的数据通道
→
GPU 加速卡单卡或多卡
↓
6 GPU 内部计算
GPU 内部计算
GPU 从 HBM 读取模型参数,通过缓存、SM 与 Tensor Core 计算。
HBM模型参数与 KV Cache
→
L2 / L1 Cache缓存热点数据
→
SMStreaming Multiprocessor
→
Tensor Core矩阵运算
→
生成下一个 Token
↓
7 多 GPU 通信
多 GPU 通信
同一服务器内通过 NVLink 和 NVSwitch 进行高速数据交换。
NVLinkGPU 点对点高速互联
→
NVSwitch多 GPU 全互联交换
→
更多 GPU同一服务器内并行推理
↓
8 跨服务器通信
跨服务器通信
多台服务器之间通过 InfiniBand 或 RoCE 传输中间结果。
InfiniBand低延迟、高带宽网络
→
RoCE基于以太网的 RDMA
→
其他 GPU 服务器
↓
9 结果返回
结果返回
生成的 Token 被汇总并沿网络原路返回用户设备。
GPU 输出 Token
→
CPU 汇总结果
→
NIC → ToR → Core
→
负载均衡 → 互联网
→
用户设备显示回答
数据流颜色
- 蓝色:请求进入数据中心
- 橙色:服务器与 GPU 内部计算
- 绿色:结果返回用户
关键组件作用
- 光模块:光 / 电转换
- NIC:网络数据包收发
- DPU:网络、存储、安全卸载
- CPU:解析请求、调度资源
- GPU:并行计算
- HBM:参数与 KV Cache
一次请求的完整过程
- 用户输入并发送请求
- 请求经互联网进入数据中心
- 交换机路由到目标服务器
- 光模块完成光电转换
- CPU 调度 GPU
- GPU 生成 Token
- 多 GPU / 多服务器协同
- 结果返回用户
典型硬件组成(示例)
- CPU:1–2 颗
- 主内存:512GB–2TB+
- GPU:4–8 张或更多
- HBM:80GB–192GB+ / GPU
- 存储:NVMe SSD
- 网络:200G / 400G / 800G
数据在不同层级中的形态变化
用户输入→
HTTP 请求→
TCP / QUIC→
光纤光信号→
光电转换→
NIC / DPU→
CPU 内存→
GPU Tensor→
Token→
流式响应→
用户看到回答