作者:王聪彬
![]()
在山东版图中,滨州并不是一个高频被提及的名字,甚至对不少本省人来说也略显陌生。但正是在这样一座低调的城市里,走出了跻身世界500强的山东魏桥创业集团有限公司。从纺织起家,延伸至热电、铝业等关键领域,魏桥创业集团逐步成长为全球领先的特大型企业,也为这座城市奠定了深厚的产业基础。
在产业能力之上,魏桥创业集团开始将目光投向更长期的技术竞争力。
2019年,魏桥创业集团携手中国科学院大学联合设立魏桥国科,围绕新材料、新能源、生命健康与人工智能四大战略方向展开布局,向“科研+产业”体系延展。
近些年人工智能迅速发展,算力基础设施的重要性也随之被迅速前置。2022年魏桥国科开始规划用于研发的智算中心,将算力能力进行系统化建设。
如今,智算中心已经完成二期建设,不仅成为魏桥国科建设发展过程中的关键基础设施,也成为滨州市乃至鲁北地区首个以人工智能算力为核心服务的专业计算中心,在区域科技创新与产业智能化转型中承担起底座支撑角色。
![]()
科研到工业,算力基础设施的两期进阶
2022年,魏桥国科智算中心一期启动规划,定位于服务科研创新,总投资约6000万元,2023年9月正式上线运行,算力水平在国内高校及科研院所体系中已进入领先梯队,2023国际人工智能算力AIPerf-LLM排行榜中位居第五。
一期智算中心的建设,融合了超算、智算与通算多元算力体系,重点服务工业人工智能应用技术研究,覆盖工业AI应用、科学计算与仿真、工业大模型训练,以及智能制造与高端装备研发等核心计算场景。
经过两年运行,一期已为包括魏桥创业集团、中科院自动化所、国科大等在内的多家科研机构和企业提供算力支持,累计完成约40万项计算任务,覆盖通用视觉大模型、工业异常检测、数值天气预报等多个前沿领域。
随着产业对算力规模与服务能力的要求同步提升,二期建设被迅速提上日程。
2024年,魏桥国科与曙光信息产业股份有限公司(以下简称中科曙光)再度展开深度合作,进一步聚焦工业AI、科学计算与仿真、工业大模型训练等核心场景,构建自主可控、高效绿色的智算基础设施,推动产业智能化转型与区域数字经济发展。
2025年1月1日,智算中心二期正式上线,其定位大规模、高性能的算力基础设施,提供2000P的高性能规模,并预留机房空间支撑未来扩展。除了魏桥创业集团的大规模数字化项目外,部分空闲算力也面向外部开放,开展商业化服务。
魏桥国科智算中心二期为一套千卡高端算力集群,其中包括百余台国产高端AI算力服务器,以及匹配的网络设备、存储节点和安全设施,经过系统集成,形成一个高水平稳定运行的AI算力平台,具备稳定、高效、无故障的对外提供智算集群服务的能力。
“上线一年以来,二期算力资源已实现满负荷运行,整体利用率接近100%。”魏桥国科智算中心主任钟成说道。目前二期算力主要分为两类用途,一部分用于支撑垂直领域大模型的训练与优化,另一部分则面向生产系统提供推理服务。
在魏桥国科智算中心的发展脉络里,中科曙光始终是其中的深度合作伙伴。一期建设时,中科曙光便深度参与顶层设计、设备选型、网络调优等关键环节;进入二期规划阶段,当魏桥国科明确大规模算力需求后,也是第一时间找到中科曙光。
用全栈方案,回应工业AI复杂度挑战
二期规划之初,并没有被简单的定位为扩容,而是将目标明确为建设一座技术更先进、容量更充足、能效更优的智算中心,打造面向鲁北乃至全国的一流人工智能算力枢纽,契合国家“东数西算”战略布局,为培育新质生产力、巩固产业领先地位提供关键支撑。
魏桥智算中心二期呈现出鲜明的产业级应用需求,所以就需要更加注重“性能、兼容、绿色、安全”四大核心维度。
第一,性能需求:满足工业大模型训练、有机光电材料模拟筛选等高密度计算任务,需要强大的并行处理能力与高速数据吞吐效率;一期系统GPU使用率已持续维持在80%以上,二期需进一步提升算力规模与调度效率,应对持续增长的计算需求。
第二,兼容性与扩展性需求:实现与一期系统的无缝衔接,支持超算、智算、通算等多元算力协同,兼容Windows、Linux等多种操作系统及不同类型的科研与工业应用场景。
第三,绿色低碳需求:在保障高性能的前提下,通过先进技术降低数据中心PUE值,契合国家“双碳”战略,实现可持续运营。
第四,安全与服务需求:具备全生命周期的安全可靠保障,通过全冗余架构防范各类故障风险。需要7×24小时驻场服务与业务级优化支持,确保算力资源稳定输出,打通从算力供给到产业价值转化的完整链路。
中科曙光给出的是全栈式解决方案,覆盖了全精度AI算力、高性能AI存储、智能运维管理,来回应这些需求。
全精度AI算力层面,基于通用CPU与GPU架构,算力覆盖FP64、FP32与FP16多精度体系,可全面支撑高性能计算与人工智能应用需求,兼顾科学计算与AI训练、推理的多层次算力能力。
高性能AI存储层面,通过大容量、高并发I/O吞吐与低延迟集群带宽,支撑数据读、写等关键环节,保障AI算力的高效利用。具体来看,全闪存储池裸容量达2.8PB,读带宽不低于320GB/s、写带宽不低于240GB/s;大容量存储池规模达11PB,读带宽不低于120GB/s、写带宽不低于90GB/s。同时结合ParaStor分布式存储系统,使AI能力能够更高效地嵌入研发与生产流程。
智能运维管理层面,一方面,依托人工智能开发平台SothisAI,结合魏桥创业集团的工业体系,打通算力、应用与生态,兼容主流软件,提供从开发工具、基础软件、大模型与应用的完整能力,支撑工业场景下的AI创新落地;另一方面,通过集群管理GridView,面向跨区域用户提供统一的算力与数据运营服务,实现无感知的算力调度、异构管理与资源监控。
“中科曙光设计的混闪、全闪分层存储模式,很好地满足了人工智能训练和推理的需求。”钟成说道。这也让不同负载在性能与成本之间实现了更优平衡。
回到第一性原理,需求决定算力
建成只是起点,关键在于让算力真正转化为驱动产业创新的能力。现在大模型训练、AI4Science研究、高端装备研发等场景都已经在魏桥国科智算中心跑了起来。
从全球范围看,工业+AI正在迅速渗透,成为提质降本增效的刚需。根据IDC预测,到2028年,全球工业企业AI支出规模将接近2.2万亿人民币,年复合增长率达到63%。中国工业企业AI支出规模将接近900亿元人民币,年复合增长率达到38%。
政策层面也给出了最新的引导。2026年1月,工业和信息化部、中央网信办、国家发展改革委等8部门印发《“人工智能+制造”专项行动实施意见》,以加快推进人工智能技术在制造业融合应用,打造新质生产力,全方位、深层次、高水平赋能新型工业化。
对于魏桥创业集团而言,关键在于将工业制造需求与算力建设及应用节奏实现匹配。钟成以两个典型场景作了说明。第一个例子是缺陷检测,过去主要依赖深度学习,每一个具体对象都需要单独建立数据集并反复训练。现在针对金属材料表面缺陷这类具备共性的场景,可以通过一个大模型实现跨场景识别。
第二个例子是流程工业的全要素综合分析和处理,比如整条生产线,如何保证在多个工艺环节之间实现整体最优,往往需要对几十个变量进行综合分析与建模,这对数据、算法以及算力都提出了更高要求。大模型则可以将设备参数、工艺指标、环境数据等进行统一建模与动态优化。
制造业生产线的复杂度在很大程度上决定了人工智能的落地节奏,魏桥国科也在持续探索AI在具体工业场景中的应用路径。基于此,魏桥国科重点布局了三个方向:
第一,机器人与智能设备,满足大量工业需求通过一台或少数几台设备来完成;
第二,流程工业全要素、全流程综合处理,如何在多工艺、多变量条件下实现整条产线的整体优化;
第三,AI4Science,围绕魏桥创业集团的产业布局,重点聚焦新材料、科学数据等领域,通过仿真可以在前期完成大规模筛选,仅保留关键方案进入实验阶段提升研发效率。
回看两期数据中心的建设,钟成的一个体会是,必须遵循“第一性原理”,还是要回到第一性原理,从生产需求出发,才能对应到技术与算力的供给,也不会造成资源浪费。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.