v4.0.x
v4.0.4
date: 2026-9-15
版本亮点
本次版本以 AI 能力补齐为主:上线 AI 网关,推理从「实例」升级为可扩缩的「部署」,并支持 HAMI 显存共享与国产算力卡。
- 新增 AI 网关:OpenAI / Anthropic 兼容接入,路由到公有模型或平台内推理部署,支持 API Key 鉴权与多租户用量分析
- HAMI GPU 共享调度:可按显存切分;覆盖 NVIDIA、华为昇腾 NPU、海光 DCU;ocboot 会在容器节点安装 yunion-hami
- 推理主入口改为 推理部署;支持从 ModelScope 导入、SGLang 引擎、对部署做基准测试
- 镜像服务支持 NFS 后端;网络支持 IP 集;磁盘支持从文件创建备份
- MCP server支持的资源查询和操作更加全面,并且在企业版支持FinOps以及对企业版文档的查询。同时我们提供了方便Agent使用的cloudpods-skills,开源在https://github.com/yunionio/cloudpods-skills
另外,对PVE支持进行了重构,支持了对纳管PVE的IP地址管理能力,并允许通过镜像创建PVE虚拟机。但由于改动较大,无法后向兼容,升级后需要将存量PVE云账号删除再重新纳管。
新功能
- 【AI】新增 AI 网关:供应商、路由、接入点、API Key;兼容 OpenAI 与 Anthropic API格式;视觉 消息流;用量分析;推理部署可注册为网关上游
- 【AI】推理主入口改为推理部署(副本扩缩、重启、chat 测试、注册网关);旧「推理实例」菜单隐藏并重定向
- 【AI】支持sglang推理框架
- 【AI】支持从huggingface, modelscope 导入推理模板
- 【AI】支持从本地路径导入模型,并可指定优先调度宿主机
- 【AI】推理模板 GPU 支持 HAMI / 独占 / MPS / 无限制四种模式;HAMI 可限制每卡显存(可估算或手填)以及算力
- 【AI】支持华为昇腾 NPU、海光 DCU 的设备探测、HAMI 共享与 vLLM 运行时
- 【AI】新增推理基准测试(QPS / 延迟等)
- 【AI】Agent 容器桌面;桌面模板可选 GPU
- 【AI】社区镜像 catalog;套餐支持环境变量、创建前调度检查
- 【AI】mcp-server支持文档问答(企业版)
- 【镜像】Glance 支持 NFS 作为后端存储
- 【虚拟机】pve虚拟机支持本地IDC镜像部署(已有账号需要重新导入)
- 【虚拟机】支持部分平台开机调整配置(若需关机支持提交后先关机再调整)
- 【裸金属】IPMI 支持探测并持久化 RMCP+ cipher suite
- 【物理机】支持展示物理机监控
- 【多云】创建公有云资源时(虚拟机,VPC,IP子网,NAT网关,文件系统等),支持通过地图模式选择可用区,允许同时选择多个云多个区域和可用区
- 【多云】创建公有云资源时,支持跨多个云平台的区域和可用区的套餐价格对比(企业版)
- 【多云】支持同步阿里云,腾讯云,OracleCloud公告(企业版)
- 【多云】支持rockbase及h3c cas云(企业版)
- 【多云】支持腾讯云,阿里 云IP地址组
- 【费用】支持aws专用宿主机费用分摊(企业版)
- 【前端】增加网络检测与提示:检测到您的浏览器通过代理或 WAF 访问后端服务,你的请求可能被错误拦截,请检查代理或WAF配置
- 【前端】支持浏览器多个tab页之间同步登录状态
- 【前端】主机、磁盘、eip、rds/redis 等创建表单支持简单内容的草稿及回填,提交表单之后下次进入反填部分信息便于快速创建相同配置资源(企业版)
- 【系统配置】增加预置标签(企业版)
- 【部署】ocboot run.py 支持 --version 覆盖版本,以及 --user / --port 指定 SSH;容器节点安装 yunion-hami;ClickHouse 支持独立主机与自定义数据目录
功能改进
- 【AI】vLLM / SGLang 自动补齐 backend 参数;按模型估算显存;调度失败给出 GPU 预留提示
- 【容器主机】容器主机默认开启 CPU 绑核
- 【虚拟机】宿主机离线时支持强制卸载透传设备
- 【虚拟机】虚机删除时宿主机上虚机元数据放入回收站目录
- 【虚拟机】优化虚拟机关机逻辑,关机超时时间为 300 秒,超时未关机会关机失败,关机中和关机失败的机器可强制断电关机
- 【虚拟机】调整快照删除策略,缩短快照删除时间减少占用空间
- 【虚拟机】优化透传设备展示,增加多种类型与共享模式、内存大小等信息
- 【虚拟机】允许指定通过镜像创建的内置虚拟化的禁用USB键盘(disable_usb_keyboard)和PC类型(machine_type)属性
- 【多云】支持公有云指定多可用区打散创建虚拟机
- 【多云】支持gcp虚拟机创建可以指定任意网络标记,支持密码跟随镜像设置
- 【多云】隐藏云账号详情部分平台无意义的宿主机信息
- 【密钥对】支持 Ed25519
- 【负载均衡】UDP 健康检查配置;监听规则指定证书
- 【K8s】支持集群历史数据自动清理
- 【网络】支持设置IP子网的静态路由表,创建网络输入ip去除空格
- 【认证】支持过滤未设置管理员的项目
- 【认证】配置SSO认证源时,允许设置自动创建用户的默认归属项目和角色(企业版)
- 【前端】登录页支持通过云联壹云小程序等多种方式获取MFA验证码
- 【部署】升级时先升 operator 再升集群;海光 CPU 选用兼容的 Calico 版本;容器节点关闭 hugepage
问题修复
- 【虚拟机】修复 qemu 10.0.7 版本的一些兼容性问题: CPU 热插拔,tcg 虚机启动,热迁移等
- 【虚拟机】修复windows 虚机密码含特殊字符部署失败的问题
- 【虚拟机】修复虚机 e1000 型号网卡热插拔失败的问题
- 【虚拟机】修复Agent监控指标描述为普通监控指标的问题
- 【虚拟机】修复镜像类型未排除TGZ的问题
- 【虚拟机】修复 ceph 容器命令行并发执行命令失败的问题
- 【多云】修复azure创建eip失败问题
- 【多云】修复阿里云负载均衡转发规则同步不全问题
- 【认证】修复配额不生效问 题
- 【告警】修复告警策略修改时初始化错误
- 【漏洞修复】我们利用AI智能体对代码漏洞进行了一次全面摸排和修复
CHANGELOG
具体变更请参考:
v4.0.3
date: 2026-6-1
版本亮点
本次版本更新主要是修复v4.0发布后遇到的兼容性问题,包括AI计算节点不兼容部分操作系统,不支持从旧版本kubernetes集群升级,QEMU 10.0.7的兼容性问题等。同时,也有不少重磅新功能的上线:
- AI云功能新上了Hermes Agent支持,vLLM推理引擎支持,支持直接挂载宿主机推理文件目录等
- 容器主机支持使用RBD磁盘
- 计费支持AWS,Azure预留实例的费用分摊(企业版)
- 监控支持将告警消息转为告警工单(企业版)
以下为详细的v4.0.3更新介绍。
新功能
- 【AI】支持vLLM推理实例
- 【AI】支持Hermes Agent应用实例
- 【AI】支持给推理模板设 置要映射的宿主机路径
- 【AI】OpenClaw 支持手动配置模式
- 【AI】支持导入平台发布的社区镜像
- 【虚拟机】支持在列表展示监控告警原因和基础监控数据
- 【虚拟机】创建KVM虚拟机支持设置无人值守(kickstart)安装
- 【虚拟机】KVM套餐支持设置最大系统盘容量
- 【容器主机】支持容器主机挂载 RBD 存储的虚拟磁盘
- 【多云】公有云套餐支持克隆
- 【监控】支持告警消息里设置告警原因
- 【镜像】支持自动探测ISO类型系统镜像的系统信息(架构,发行版等)
- 【告警】告警策略支持差值运算符
- 【告警】告警资源支持转换为告警工单(企业版)
- 【前端】开源版增加容器密钥,容器镜像凭证,AK/SK等个人凭证信息的管理
- 【计费】支持离线下载公有云原始账单(企业版)
- 【计费】支持AWS和Azure的预留实例(RI)分摊和覆盖率/使用率统计(企业版)
- 【计费】支持主机网络流量计费(企业版)
功能改进
- 【AI】支持从Hugging Face断点续传下载模型
- 【虚拟机】支持天翼云CTyunOS系统镜像
- 【容器主机】容器主机支持绑定eip
- 【调度】重构调度中间态资源过期逻辑,提升结果精确性
- 【多云】虚拟机调整配置时,自动限制可调整规格列表
- 【网络】虚拟机和容器支持双向非对称网络限速
- 【DNS】升级region-dns依赖 的coredns版本到v1.10.1
- 【监控】告警支持设置禁用通知恢复
- 【监控】告警策略支持设置告警原因
- 【climc】climc 添加通用 feature-config 子命令用于开关功能
- 【前端】磁盘允许数值和单位分开输入
- 【前端】登录时验证码背景色改为透明
- 【前端】优化调度失败的信息展示,方便排查问题
问题修复
- 【AI】修复 llm 镜像没有根据 sku 更新的问题
- 【虚拟机】usb 设备透传时使用 hostport 避免usb插拔后需要重新识别的问题
- 【虚拟机】修复10.0.7 qemu 的一些兼容性问题(不支持--disable-kvm参数等问题)
- 【容器主机】修复挂载多张共享Nvidia GPU卡的容器主机内nvidia-smi只探测到单张卡的问题
- 【容器主机】修复镜像仓库没填密钥创建报错的问题
- 【多云】修复火山云拉取监控数据异常问题
- 【多云】修复AWS同步自定义镜像不全问题
- 【多云】修复大规模VMWare集群网络查询超时问题
- 【网络】修复虚拟机和容器出方向/上行流量限速失效问题
- 【负载均衡】修复负载均衡查询监控数据失败的问题
- 【负载均衡】修复监听规则转发策略创建失败问题
- 【监控】修复更新静默期不生效的问题
- 【监控】修改告警策略表单初始化失败导致报错问题
- 【部署】容器底座为kubernetes 1.15.12版本的集群升级为4.0.2后,host服务不能正常启动
- 【部署】rocky 8,alma 8,centos 8等操作系统无法部署容器节点的问题
- 【部署】修复CentOS 7.9的集群无法升级为4.0的问题
- 【部署】修复4.0计算节点未预拉取ceph镜像,导致添加ceph存储失败的问题
- 【前端】打包信息优化,使用更精确的打包信息方便确定部署版本排查问题
- 【工单】通过资源订单的资源申请工单可展示具体的资源订单错误信息(企业版)
- 【工单】修复因克隆资源订单的工单未新建资源订单导致工单重复失败问题(企业版)
- 【服务】系统服务改进,增加展示内容(企业版)
注意事项
- 本次为人工智能和容器主机功做了分别的功能开关,如果从 v4.0.2 私有云容器节点升级上来的环境,需要通过 climc feature-config-ai --switch on 命令打开前端人工智能菜单
CHANGELOG
具体变更请参考:
v4.0.2
date: 2026-4-3
版本亮点
4.0为一次大版本更新,最早的PR可以追溯到2024年春节前后,算下来已经迭代了将近2年,共计3695个新增提交。4.0是cloudpods适应当前技术发展大趋势做的一次大版本迭代。近几年IT基础设施领域的主要体现出两个大的变化:AI和国产替代。首先是随着AI需求井喷,基础设施也需要改变去适应AI应用。其次是国产化替代和自主可控的要求进一步落地,基础设施需要迭代去管理国产化的硬件和技术栈。
基于这些大的趋势变化,4.x的主要变化总结如下:
1 支持AI工作负载
顺应 AI 技术浪潮,4.0版本发布了两个AI相关的服务,允许用户在cloudpods管理的服务器上运行AI工作负载。
首先提供了cloudpods的MCP server,为AI Agent提供cloudpods管理的云资源的查询和操作的能力。
另外,基于cloudpods 4.0的容器主机功能特性交付即开即用的AI服务实例。提供的服务类型主要为AI应用和推理服务两类。
- AI应用支持在容器主机内运行AI应用,包括:
- OpenClaw: 随着小龙虾的迅速普及,cloudpods提供了预置OpenClaw的服务实例,可以在服务器上秒级开通小龙虾实例。支持多家模型供应商(Anthropic、月之暗面、MiniMax、Zai 等),多IM通道(QQ,飞书,Discord,Telegram等)。龙虾运行在服务器上独立隔离的Ubuntu桌面环境中,安全并且高效。
- ComfyUI: 流行的AI 图像生成平台,支持 Stable Diffusion 等图像生成模型,可使用服务器上的GPU运行模型。
- Dify: 完整的 LLM 应用开发平台,支持工作流编排,可与 ollama 服务实例联动部署。
- 推理服务提供在GPU服务器上一键部署ollama服务实例,并实现模型数据集的动态加载,支持模型导入、社区模型仓库(内置 Qwen3、Qwen2.5-Coder 等主流开源模型。
同时,本地部署的推理服务可以作为MCP server以及AI应用的LLM后端,实现完整的本地私有化AI服务。
2 支持容器主机
为了更好运行ai工作负载,4.0的一个重要更新是在虚拟化主机之外提供了容器主机。这是一个完全自研的分布式容器管理平台。底层基于 containerd 容器运行时,网络、存储及管控框架复用了 Cloudpods 现有的成熟基础设施,实现了云平台与容器的深度融合。虽然kubernetes已经是分布式容器平台的事实标准,但kubernetes是为无状态的分布式微服务架构设计。相比kubernetes的pod,cloudpods容器主机具备如下独特特性使其适合运行ai应用、云桌面、云游戏等有状态的单机工作负载:
- 有状态,容器主机分配不变IP地址,支持挂载持久的本地存储,支持系统盘overlay持久化
- 支持调整配置,垂直扩容
- 支持Pod内多容器按指定顺序启动
- 每台宿主机独立的网络端口映射规则(区别于K8s的全局NodePort实现)
- 原生支持透传、共享GPU设备,NUMA拓扑感知与自动均衡(无需额外device plugin配置)
- 原生支持 lxcfs,CPU仿真
容器主机采用 Pod 模型,通过自研的 CRI 实现层直接与 containerd 通信,无需依赖 Docker 或 Kubernetes。经过2年多的迭代,在实际使用中功能逐步完善,支持了AI应用的即开即用 的交付。核心能力包括:
- 全生命周期管理:容器创建、启停、重启、删除、配置调整、在线磁盘扩容,支持异常崩溃自动恢复
- 网络集成:复用 VPC/经典网络,支持端口映射(TCP/UDP)、弹性公网 IP 绑定
- 存储管理:宿主机目录挂载、Overlay 文件系统、CephFS 卷挂载、容器快照和镜像提交
- GPU设备透传:NVIDIA GPU、华为昇腾 NPU等设备透传至容器,支持NVIDIA MPS
- 资源隔离:CPU Set 绑定、NUMA 感知调度、内存/PID 限制、cgroup 设备权限控制
- 运维能力:容器终端 exec、日志查询、文件拷贝、健康探针、容器监控指标
- 安全特性:RunAsUser/RunAsGroup、命名空间隔离、no_new_privs
3 支持更多异构CPU架构
cloudpods在3.x版本原生支持了arm架构,实现了多CPU架构支持从0到1的飞跃,并已经在很多客户的生产环境大规模商用。在此基础上,cloudpods 4.0在软件构建基础设施以及软件架构进一步升级,为更容易地支持多CPU架构做了基础设施和工具的准备,包括:
- 支持打包多架构的rpm和deb软件包
- 支持打包任意架构组合的容器镜像
- 升级容器基础镜像版本到alpine 3.19,原生支持riscv,龙芯等CPU架构
- 升级golang版本到1.24,原生支持riscv,龙芯等架构的二进制编译
- 升级QEMU版本到10.0.7,为arm,riscv架构虚拟机,以及Windows 11提供更新的虚拟硬件特性支持
- 容器化部署openvswitch和ceph组件,减少部署的操作系统软件包依赖
在4.x的后续版本中,随着riscv,龙芯等异构CPU硬件和生态体系的成熟,cloudpods会适时推出对这些CPU架构服务器的原生支持。
4 全面支持IPv6
平台实现了从底层网络到上层业务的全面 IPv6 支持。KVM 虚拟机和容器主机均支持 IPv6双栈和 IPv6单栈模式,宿主机网络全面支持 IPv6(网桥、热迁移、Ceph、NBD)。多云层面,阿里云、华为云、AWS、腾讯云、火山引擎等主流公有云的 IPv6 地址同步已全部打通,安全组、VPC、子网、DNS、VIP 等网络资源均支持 IPv6。部署工具 ocboot 支持 IPv6 环境部署。
其他更新
新功能
- 【虚拟机】支持虚拟机TPM设备和secure UEFI,支持安装原生windows 11系统
- 【虚拟机】虚拟机和容器主机NUMA 感知调度与 CPU 绑核,默认绑定NUMA
- 【虚拟机】LVM 快照支持
- 【云管】增加完善公有云云平台云资源接入支持:火山引擎,金山云,Oracle Cloud,百度云,Cloudflare(企业版)
- 【云管】增加完善私有云平台云资源接入支持::深信服,泽塔云,H3C (企业版)
- 【云管】SSL 证书管理,支持从腾讯云、阿里云、华为云同步 SSL 证书,支 持SSL 证书的创建、删除等全生命周期操作
- 【云管】CDN 资源管理,支持 AWS,华为云 CDN 资源同步,Cloudflare CDN 域名和自定义主机名管理,CDN 缓存刷新操作
- 【云管】WAF(Web 应用防火墙),支持从腾讯云和阿里云同步 WAF 实例,Cloudflare WAF支持
- 【云管】CephFS 网络文件存储支持,作为 NAS/文件存储后端纳入管理。支持目录管理、配额设置、HTTP 访问协议,可作为容器 Pod 的挂载存储使用
- 【网络】资源拓扑视图(企业版)
- 【通知】Webhook 通知支持密钥
- 【费用】多维度账单异常检测和告警(企业版)
- 【费用】组织账单和项目共享成本分摊(企业版)
- 【费用】多币种汇率支持(新增欧元泰铢等)(企业版)
- 【费用】账单导出至对象存储桶,支持离线导出(企业版)
- 【费用】AWS CUR 2.0 账单格式支持(企业版)
- 【费用】Azure新版账单下载API支持(企业版)
- 【费用】月度账单聚合与报表模板(企业版)
- 【费用】资源订单管理(企业版)
- 【ITSM】流程实例撤回评论(企业版)
- 【ITSM】历史流程实例导入管理(企业版)
- 【ITSM】监控告警升级为告警工单(企业版)
- 【前端】新版扁平菜单布局(企业版)
- 【平台】平台服务运维,包括配置查看与修改,任务队列,HTTP请求统计等
功能改进
- 【虚拟机】GPU 白名单(IsolatedDeviceModels)
- 【虚拟机】虚拟机硬件信息聚合
- 【虚拟机】默认禁用 guest HPET 计时器(性能优化)
- 【虚拟机】虚拟机 OS 信息同步
- 【虚拟机】共享 LVM / CLVM 支持
- 【云管】华为云 API 全面升级(EIP、ELB、密钥对、监控、AK/SK 签名)
- 【云管】AWS SDK v2 升级
- 【云管】阿里云 ALB/NLB 负载均衡支持
- 【云管】Google Cloud 全局 EIP 和 LB 同步、共享 VPC 和共享镜像支持
- 【云管】Azure SDK 清理、预留实例列表、监控指标改进
- 【云管】腾讯云组织账户支持、NAT 网关 API 升级
- 【云管】天翼云 API 升级、价格查询、监控指标支持
- 【云管】OpenStack HTTPS 协议支持
- 【云管】PVE 支持 CPU 架构区分
- 【云管】VMware 克隆虚拟机时自动升级版本、支持虚拟机文件夹/资源池
- 【云管】多云安全组规则管理改进
- 【云管】负载均衡后端同步代码重构(阿里云、AWS、腾讯云、Google)
- 云管】ESXi 预分配虚拟磁盘、PMEM 存储类型支持
- 【云管】GCP PD Extreme 存储类型
- 【云管】阿里云磁盘在线扩容及存储类型切换
- 【云管】S3 签名版本支持,大文件并行上传/下载优化
- 【云管】S3 大文件流式传输与进度报告改进
- 【云管】火山引擎、金山云 IAM 支持
- 【云管】Azure IAM 策略
- 【云管】云用户启用/禁用及 MFA 多因素认证
- 【云管】云用户自动关联本地用户
- 【监控】ZStack 内存使用率指标
- 【监控】腾讯云磁盘使用率指标和 SQL Server 监控
- 【监控】Oracle Cloud 监控支持
- 【监控】容器监控指标(CPU、内存、磁盘 IO、网络)
- 【监控】多指标告警支持
- 【监控】多种GPU硬件监控采集支持,NVIDIA,AMD等
问题修复
- 【虚拟机】Ceph 连接复用优化
- 【虚拟机】LVM 磁盘删除和扩容修复
- 【虚拟机】容器崩溃恢复和自动重启修复
- 【虚拟机】宿主机 IPv6 路由和网桥迁移修复
- 【云管】华为云:修复 LB 同步 panic、磁盘同步、EIP、Redis、监控、NAT、安全组端口同步等问题
- 【云管】阿里云:修复安全组规则、磁盘突发性能、RDS 备份、EIP 关联、MongoDB、DNS、LB 后端等问题
- 【云管】AWS:修复 LB panic、EIP 未找到、磁盘类型、子账户名称、镜像导入、DNS 流量策略、监控指标、请求重试等问题
- 【云管】腾讯云:修复 LB IP/域名/后端、NAT 状态、安全组规则、Redis、MongoDB 状态、子账户同步等问题
- 【云管】Azure:修复虚拟机刷新 panic、网卡删除、Graph API、LB 同步、安全组删除、监控指标等问题
- 【云管】GCP:修复虚拟机创建重试、安全规则、磁盘名称校验、LB 同步、虚拟机删除保护等问题
- 【云管】ESXi/VMware:修复克隆模板网卡、CPU 插槽数、虚拟机删除、迁移数据存储、预分配磁盘、并发 Map 访问、宿主机 IP 同步、缓存镜像等问题
- 【云管】PVE/Proxmox:修复最小虚拟机 ID、VNC、网卡 IP 同步、虚拟机搜索超时等问题
- 【云管】ZStack:修复共享存储、认证 URL、安全组规则等问题
- 【云管】金山云(Ksyun):修复 VNC、密钥对导入、监控指标、签名、对象存储等问题
- 【云管】泽塔云(Zettakit):修复存储大小同步、设备透传、虚拟机创建磁盘、监控指标等问题(企业版)
- 【云管】深信服(Sangfor):修复网络区域、虚拟机创建、磁盘同步、监控指标等问题(企业版)
- 【云管】Apsara(阿里政务云)死循环和只读错误修复
- 【费用】修复计费精度和边界问题(企业版)
开源之夏
在2025年的开源之夏中,以下同学为cloudpods贡献了如下内容,均在4.0发布,在此感谢!
- eikohs 贡献的 cloudpods llm服务框架以及ollama和dify应用的完整后端实现
- PengJingzhao 贡献的 Cloudpods MCP Server 完整后端实现
- happy-game 贡献的 Kickstart 自动化操作系统安装完整后端实现
- Jinyu007 贡献的 cloudpods riscv架构镜像构建的初步支持
CHANGELOG
具体变更请参考: