在将工作负载迁入公有云多年之后,越来越多的企业正在将部分工作负载迁回自有基础设施,打破了一个此前看似不可逆的趋势。如今,CIO及其他IT领导者正在将特定工作负载从公有云迁回本地或私有云基础设施。
这一趋势并非源于云计算的失败,而是企业在追求优化、提升性能需求以及加强战略控制方面的主动选择。
Comcast旗下安全服务公司DataBee的CTO斯科特·米瑟伦迪诺表示,云计算虽为基础设施、数据中心及托管服务的管理带来了便利,但实际上从未真正节省过成本。"所有效率提升所带来的收益,都被超大规模云服务商以利润的形式收走了。"
他还指出,对云工作负载进行可靠的成本预估历来都很困难,但随着越来越多的工作负载使用更大规模的数据集——这些数据集往往分散在不同的云环境中——预估成本与实际成本之间的差距正在以前所未有的幅度扩大。这一问题在数据出口成本方面尤为突出,即在不同云服务商托管的工作负载之间或私有云环境内部传输数据所产生的费用。
德勤咨询副总监凯利·拉斯科维奇表示,过去十年间,"云优先"一直是默认策略。但这种情况正在改变,并非因为企业放弃了云计算,而是因为它们在工作负载的部署位置上变得更加审慎。
"我将其称为'云智选'——将每个工作负载置于能够在成本、性能、安全性与风险之间取得最佳平衡的环境中。"拉斯科维奇说。
迁回本地的经济逻辑
拉斯科维奇表示,成本可预测性(或其缺失)是工作负载迁移的重要考量因素。"许多企业都曾遭遇云运营费用超支的'价格冲击',尤其是数据出口费用,以及在动态云环境中持续运行稳态工作负载的持续性成本。"她指出,对于需求稳定的应用程序,本地基础设施能够提供更强的成本可视性与可控性。
除数据出口费用及相关成本外,还有其他障碍需要与迁回本地的长期收益进行审慎权衡。
以近期的内存和RAM短缺为例,这已导致硬件成本大幅上涨。此外还需考虑多项一次性迁移成本,包括基础设施建设或扩建、迁移过程中可能出现的停机、数据传输费用、应用改造以及IT培训等。这些因素均需要细致的规划和全面的总拥有成本分析。
专注于AI系统构建与部署的VarOps技术联合创始人兼CTO兰·阿鲁西建议,迁移工作负载时不要对其进行重新设计。"先迁移,再度量,最后优化。"他说,"将迁移与架构重写同步进行的团队,永远无法判断是哪个变更导致了哪个结果。"
阿鲁西强调,迁移前要做好完整的监测基准,因为没有基准就无法证明迁移成功。"如果你没有关于延迟、每次请求成本、错误率和实际利用率的基准数据,那么迁移之后,你不过是在争论各自的主观看法。"
迁回本地需要不同的技能
拉斯科维奇警告称,向本地回迁从根本上改变了团队所需的技能结构。过去几年,工程师们在云架构、FinOps(云财务运营)和云原生服务方面得到了大量培训。然而,工作负载回迁需要传统基础设施工程、物理网络和硬件生命周期管理等技能的复苏。这可能会令部分团队成员产生焦虑,担心脱离云计算意味着职业生涯的倒退。
"作为领导者,我们必须重新诠释这一趋势。"她说,"混合架构是未来的方向,同时掌握云原生和本地环境的工程师,如今已成为就业市场上最炙手可热的人才。"
米瑟伦迪诺表示,自托管会带来大量新工作,而基础设施管理团队已经习惯于依赖云计算提供的"一键操作"。自托管还需要在业务连续性和技术故障弹性方面投入更多思考。
"对于某些关键工作负载,弹性要求需要部署多个地理位置分散的数据中心,而这些数据中心的管理和同步协调极具挑战性。"他说。
云计算做弹性,本地做一致性,边缘做即时性
拉斯科维奇强调,工作负载回迁并不意味着云计算将走向消亡。
"这反映的是一个更加成熟的市场和更具纪律性的基础设施思维方式。"她说,"我们现在看到的是战略性混合模型的常态化——工作负载被部署在财务、技术和运营层面最合理的环境中。"
拉斯科维奇认为,未来将呈现三层模型:云计算提供弹性、本地环境提供一致性、边缘提供即时性。"CIO们不再将云计算视为自动化的终点站,而是视为一种运营模式。我们终于在将工作负载部署到技术最能支撑其使用场景的地方。"
阿鲁西表示,云计算从来都不是万能的"银弹",尽管它曾被大力鼓吹为如此。
"工作负载正在回归它本该处于的位置,而对于大量AI工作而言,那个位置从来就不是公有云。"他说。
阿鲁西认为,现在应该提出的问题不再是本地部署与云计算之间的对立,而是一套系统需要访问哪些数据。"诚实地回答这个问题,托管方案的选择通常就会自然浮现。"
Q&A
Q1:企业将工作负载迁回本地的主要原因是什么?
A:主要原因包括成本可预测性差、数据出口费用高企、云运营费用超支,以及对性能与战略控制的更高要求。对于需求稳定的应用,本地基础设施可提供更强的成本可控性。此外,公有云效率提升带来的收益往往被超大规模服务商以利润形式收走,并未真正惠及用户。
Q2:工作负载迁回本地时,有哪些常见的成本和风险需要注意?
A:除数据出口费用外,还需考虑近期内存和RAM短缺导致的硬件成本上涨,以及基础设施建设或扩建费用、迁移期间的潜在停机损失、数据传输成本、应用改造和IT培训等一次性支出。对于关键工作负载,还需部署多个地理分散的数据中心以满足弹性要求,管理难度较高。
Q3:工作负载回迁对IT团队的技能有哪些新要求?
A:回迁需要传统基础设施工程、物理网络和硬件生命周期管理等技能的复苏,而这些技能在"云优先"时代被逐渐淡化。德勤专家建议将其定位为混合架构能力的提升,同时掌握云原生和本地环境的工程师,正成为当前就业市场上最具价值的技术人才。