(原标题:算电协同工程实践!共绩科技联合清华大学实现“以算代储”)
近日,由清华大学、共绩科技与中国联通广东省分公司相关研究团队共同完成的《基于闲时算力调度的算电协同方法与实践》,在《电力系统自动化》网络首发。围绕交互型推理任务,提出了基于闲时算力的“时域—地域”联合调度,并依托真实算力调度平台进行了工程验证。在保障算力服务稳定的前提下,时域调节可使系统总功耗降低17%以上,地域调度可使计算成本降低近18%、地区绿电利用率提高近20%。

洞察一: 算力需求与能源供给存在错配
全球数据中心用电量仍在快速增长。据公开数据估计,2024年全球数据中心用电量约为415 TW·h,预计到2030年将增长至945 TW·h;截至2024年底,我国数据中心耗电量达到166 TW·h。
但算力带来的能源挑战,不只表现为用电总量增加。随着大模型进入规模化应用阶段,算力需求正逐渐从相对集中的模型训练,延伸到对话、语音识别、实时推荐、图像与视频生成等推理场景。
其中,模型训练、批量翻译和数据处理等任务,通常允许在规定期限内完成;智能对话、同声传译和实时推荐等交互型任务,则需要快速返回结果。

洞察二:推理需求存在波动,推理任务需要实时性
针对用户行为方面,交互型推理需求在一天内具有明显的波峰与波谷;在用户地域方面,需求在空间上又具有分散性。推理任务的实时性、波动性与分散性,使其难以直接套用传统面向批量任务的算电协同方式。
过去的算电协同研究,大多围绕模型训练、数据处理等批量型任务展开,这类任务可以等待低电价或绿电高峰时段再执行,也可以在不同地区之间迁移。但智能对话、语音识别、实时推荐等交互型推理任务需要即时返回结果,无法通过延来配合电价和绿电变化。因此,这类任务的算电协同必须在不增加响应延迟、不影响服务连续性的前提下完成。
更具挑战的是,现有研究多基于专用、独占的算力集群,对于节点随时可能上下线的闲时算力,如何同时完成状态预测、环境适配、不中断迁移和跨区域调度,仍缺少系统性的工程验证。此次共绩科技联合研究要解决的是如何让不稳定的闲时资源承接实时推理任务,并进一步成为可以响应电力变化的柔性负荷。

破局第一步:算电协同,让算力主动匹配能源供给
在新能源消纳场景中,常见的调节方式主要包括跨区域输电和储能。当风电、光伏出力超过本地即时需求时,可以通过电网将电力输送至其他地区,或者通过储能设施暂时储存。
随着新能源装机规模持续扩大,电力系统除了调节电力的生产、传输与储存,也需要进一步挖掘用电侧的灵活调节能力。算力是重要的用电负荷,而算力负荷由一个个计算任务形成。部分计算任务可以调整执行时间或迁移至其他地区,因此具备响应电力供给变化的条件。
算电协同由此提供了一个新的调节维度:根据不同地区的绿电出力、电价水平和算力资源状态,在不同时间和地区之间动态调度计算任务,让算力负荷主动匹配能源供给。
共绩科技在算电协同总体思路中,将这一机制概括为:
以算代储:网线代替电线,芯片代替电池。

它的核心并非让芯片真正承担物理储能功能,而是利用计算任务在时间和地域上的可调节性,让用电负荷主动适应能源供给。任务分发在一定程度上替代电力传输,既减少远距离输电压力,也让原本可能无法及时消纳的风电、光伏转化为计算产出。
这套逻辑可以理解为:哪里绿电更充足,任务就优先调度到哪里;什么时候电力供应更加宽松,具备延迟空间的任务就优先在什么时候执行。

但对于实时推理任务,这件事要复杂得多。
对于批量任务,算电协同可以通过延迟执行或跨区域迁移获得调节空间。但实时推理任务必须持续满足响应速度和吞吐量要求,任何节点退出、环境异常或迁移延迟,都可能直接转化为用户侧的服务中断。
因此,这项研究需要同时解决三道工程难题:
第一,如何预测和管理随时可能退出的闲时节点,将不确定资源组织成稳定算力;
第二,如何在不降低推理服务质量的情况下调节GPU功耗;
第三,如何在节点波动、电价变化和迁移成本等多重约束下,实现跨区域任务动态迁移。
破局第二步:把不稳定资源变成稳定算力
算电协同并不只是找到电价更低的地区,再把任务迁移过去,工程难点,在于大量闲时算力资源本身具有不确定性。
这些资源可能来自数据中心集群、企业机房或个人计算设备,设备型号、运行环境、网络状态和可用时间各不相同,部分设备还可能随时恢复原有任务并退出平台。
要把这类资源用于企业级推理服务,平台必须先判断三个问题:
• 设备能否承接任务? • 能够持续空闲多长时间? • 以及设备突然下线后服务能否不中断?
共绩科技算力调度平台并非在设备出现空闲后立即分发任务,而是根据历史负载建立节点持续空闲时间的概率模型。在研究设定中,平台将容忍接入失效率控制在5%,并设置0.5小时的最小持续空闲时间阈值;无法满足稳定性要求的节点不会进入当前任务池。
节点通过筛选后,平台进一步完成硬件识别、驱动与CUDA环境检查、模型镜像预置,并通过进程隔离和磁盘加密保障设备原有任务及计算数据安全。

平台实测显示,94%的个人计算设备可以自动完成运行环境配置。当节点突然下线时,平台可以将任务切换至其他可用设备。由于模型镜像已经提前部署,迁移过程主要传输任务指令和少量过程数据,减少了重复下载大型模型产生的时间开销。
目前,该平台已实现空间尺度上的跨区域迁移和时间尺度上的弹性扩缩容,覆盖青海、河南、福建、重庆等地区的算力集群,生产级推理服务SLA达到99.9%。
技术创新:时域调度 - - 以“慢算扩容”降低系统整体功耗
要理解时域调度,首先要看清GPU性能与功耗之间的关系。
在很多人看来,GPU性能降低10%,功耗也会相应降低10%,但研究团队对不同GPU、不同大模型及不同复杂度推理任务开展实测后发现,二者并不是简单的线性关系。
GPU功耗由动态功耗和静态功耗共同构成。其中,动态功耗会随着电压和运行频率的提高快速增长。研究中,GPU功耗与频率可近似表示为包含三次项的函数;由于GPU计算性能与运行频率接近正相关,因此最终形成了一条上凸的“性能—功耗”曲线。
这条曲线意味着:在GPU低功率运行阶段,提高性能所增加的功耗相对有限;但当GPU逐渐接近高性能、高负载运行状态后,每增加一部分性能,所需要付出的功耗会越来越高。
反过来看,当GPU处于高功率区间时,适当降低少量性能,可以释放出更大比例的功耗空间。

研究团队使用两种GPU、三类大模型以及简单、复杂两类交互型指令进行了测试。结果是当单卡性能降低10%时:
• A类GPU四组实验的功耗下降均超过23%; • B类GPU两组实验的功耗下降均超过16%; • 不同测试组合中的功耗下降幅度约为16%至29%。
这说明,高性能运行区间存在明显的“功耗溢价”:为了追求最后一部分性能,GPU需要消耗远高于同比例的电力。发现GPU性能与功耗之间的非线性关系后,研究团队进一步提出了慢算扩容策略。
其基本思路是:
| 适当降低单张GPU的运行频率和推理性能,再增加少量闲时GPU节点,用更多低功率节点共同维持原有的整体吞吐量。 |
例如,原本由5张GPU以较高功率提供的推理服务,可以调整为6张GPU以较低功率协同运行。
在这一过程中:
• 单张GPU的推理速度有所下降; • GPU数量适当增加; • 集群整体吞吐量保持基本稳定; • 由于单卡功耗下降幅度高于单卡性能下降幅度,集群总功耗反而降低。

所以,慢算是针对交互型推理任务,平台保持的是整体瞬时吞吐量,通过多节点协同补偿单卡性能下降。各GPU可以独立处理用户请求,总吞吐量可以近似看作各GPU吞吐能力的线性叠加。
在RTX 4090 GPU集群实验中,两个任务原本分别使用5张GPU满载运行。优化后,系统分别增加1张GPU,并降低每张GPU的运行功耗:
• QwQ模型总功耗降低17.27%,整体性能提高4.24%; • DeepSeek模型总功耗降低25.70%,整体性能提高7.14%。
也就是说,在整体推理性能未降低的情况下,系统获得了明显的功耗下降。
技术创新:地域调度 - - 让任务动态匹配电价、绿电与算力资源
时域调度解决的是算力系统如何运行,地域调度解决的是计算任务在哪里运行。
不同地区的风电、光伏出力、电价水平和可用算力资源持续变化。调度平台可以综合电价、绿电比例、GPU可用数量、节点稳定性和迁移成本,动态调整任务的地域分布。

共绩科技及研究团队针对重庆、福建、河南三地算力集群开展实验,使用40张RTX 4090 GPU,同时部署20个大模型交互型推理任务。
平台根据三地典型日风光发电情况模拟电价,每小时更新一次地区优先级。当某一地区电价降低或绿电供应增加时,任务优先向该地区迁移;当部分GPU突然离线时,溢出任务会被重新调度至仍有可用资源的地区。
实验结果为:
| 计算成本降低17.97%,地区绿电利用率提升19.87%。 |
在节点离线和电价变化过程中,平台能够在较短时间内完成任务重新部署。多张GPU聚合运行,还可以自然平抑单机推理过程中产生的功耗波动,未对规模化调度的稳定性和安全性产生明显影响。
实践证明:以算代储可通过调度实现算力响应电力
风电和光伏具有波动性,电力系统需要持续保持供需平衡。传统方式通常通过储能吸收富余电力,在电力紧张时再释放。但大规模储能需要额外建设电池、变流器等基础设施,也会带来投资和损耗。
算力负荷本身具有时间和地域上的调节空间。通过降低GPU运行功率、弹性扩增节点和跨区域迁移任务,算力系统可以在电力供应充足时增加当地计算负荷,在供应紧张时降低功耗或将任务转移到其他地区。
从电网视角看,这相当于获得了一种新的需求侧柔性资源。
所谓以算代储,并不是用算力取代全部储能设施,而是通过调度计算任务,减少一部分原本需要依靠输电和储能解决的供需错配。电力最终被转化为模型推理、图像生成、视频处理等计算成果,而不是先储存再释放。
未来:算力调度的边界,还将继续向能源延伸
过去,算力产业更关注GPU数量、机柜规模和数据中心建设投资。随着AI推理与Agent应用增长,算力需求将更加实时、分散和潮汐化。单纯增加设备,并不能自动解决资源闲置、供需峰谷、电价差异与绿电消纳之间的错配。
算力调度提供了另一种能力:将不同地区、时间和不同运行状态的计算资源统一感知和组织,根据任务需求与能源供给动态形成稳定的算力服务。
目前相关实验主要基于大型智算集群开展,对于个人计算设备、边缘终端等更多类型分布式算力资源,仍需要进一步研究。但随着节点数量增加、资源更加分散,算力预测、电网互动和细粒度调度策略也将面临更高要求。
但共绩科技已经验证了具有工程可行性的路径:算力不只能消耗电力,也可以响应电力。
对共绩科技而言,这项成果进一步拓展了算力调度的能力边界。当算力资源可以被统一感知、预测和跨域编排,算力调度连接的将不只是资源供给与AI需求,也包括计算系统与能源系统。
