自托管GPU集群编排:把散落的显卡变成一台AI服务器先说个扎心的现实:手里捏着几张显卡,想自己部署大模型,事情比想象中麻烦得多。单卡还能凑合跑,装个推理工具就能跑起来。但凡有两三台机器、每台插着不同的卡,要同时跑vLLM和SGLang两套引擎,那就等着折腾吧——手动装环境、配端口、写启动脚本,模型一更新还得一台台重来。租云上GPU实例按小时计费,短期用用还行,长期跑推理服务,账单比显卡折旧还快。inferna-next就是冲着这个来的。这是一个刚冒出来的开源项目(GitHub上51颗星,Apache-2.0协议),定位是自托管GPU集群的"控制平面":你只管选模型,它自动决定跑在哪台机器、用哪张卡、上哪个引擎。系统架构整体分三层:中央服务器:基于FastAPI,负责认证、权限、模型目录、实例调度,对外提供网页界面和REST、gRPC接口。Worker代理:跑在每台GPU主机上,每5秒汇报一次显卡状态和实例健康情况。服务器下发指令后,Worker负责拉起或销毁推理容器(vLLM或SGLang),全程走Docker。数据层:PostgreSQL存数据,Prometheus+Grafana做监控。一条dockercompose命令就能把整套东西跑起来。部署体验内置模型目录,Qwen、Llama、Phi、DeepSeek、BGE、Whisper、Qwen2.5-VL都在里面。选一个模型点部署,它会自动选有空闲显存的机器、选合适的引擎、按"低延迟"或"高吞吐"档位调参。多厂商GPU也在支持范围内。NVIDIA走NVML,AMD走ROCm,没有真卡还能开模拟模式。另外还内置了JWT登录、基于角色的权限控制和监控面板。现状项目在早期,文档和稳定性都需要自己踩坑。它的方向有一定价值——把"跑模型"这项重复劳动自动化。对手里有几张卡、想绕开云厂商的团队,可以留意一下后续进展。多机调度和故障恢复做扎实之后,自托管模型服务的门槛会低一些。