北电数智郭文:AI已不是单点能力的竞争,需要“数算模用”四个方面联合优化

服贸会专题活动“2026中国AIGC创新应用交流会”于9月10日在北京举办,主题为“智启未来 应用无界——从模型创新到场景落地”,北电数智技术负责人郭文出席并演讲。

  以下为演讲实录:

  各位嘉宾,大家好!很荣幸今天能够来到服贸会的现场,向大家分享北电数智的一些实践经验。我是来自北电数智的郭文。

  今天大家更多聚焦于AI的应用及其在各行业的落地。我们看到,AI现在已经像水和电一样融入我们的生活与生产之中,但很少有人关注到“发电厂”是怎么做的。北电数智所做的,正是构建一个个AI底座,并通过这些AI底座服务各地的民生与产业。所以今天,我将向大家介绍北电数智在全栈国产化方面的一些经验。

  北电数智是北京电控旗下企业,在“十五五”规划中,是北京电控在人工智能领域布局的‌核心关键载体‌。正着力解决行业内人工智能“卡脖子”的问题。我们成立于2023年,自成立之初就以建设数字中国为愿景。经过三年发展,我们从AI领域的新势力快速成长为行业的新力量。这三年里,我们重构了AI计算的数据中心建设范式,推动了国产算力建设,也完成了新一代计算平台的实践验证。今天的分享将围绕三个方向展开:新一代AI底座是什么样的?我们如何以这样的AI底座赋能行业?以及如何以AI底座服务区域发展?

  我们的AI底座以国产算力芯片为核心,在构建这一底座的过程中,同步推动国产算力芯片真正‌落地生产、迭代发展‌。自2023年成立之初,我们就围绕国产芯片布局算力中心建设,通过搭建全栈技术体系,打通芯片到最终应用的全链路落地通道。在智算中心建设维度,我们‌重新定义了新一代智算中心的建设标准‌。随着智算中心的技术要求持续提升,传统数据中心在供电、供水以及整体架构层面,都需要面向智能计算场景完成系统性升级。我们承建的北京市数字经济算力中心,是‌北京五环内唯一千P以上的商用智算中心‌。依托这套成熟的全栈技术能力,我们以北京标杆方案为样板向全国复制,‌赋能各地AI产业高质量发展‌。

  当前AI的发展已经进入深水区。我们观察到,AI产业的发展可以概括为“数、算、模、用”四个核心维度。

  在算力方面,国产算力今年市场需求旺盛,正处于快速发展的上升阶段。面向持续增长的产业需求,我们的技术路径从单个芯片的能力拓展延伸至多芯片组合协同能力——从单芯片优化升级到系统级调优,以系统协同进一步激发国产算力的整体效能。

  在模型方面,大模型技术迭代迅速、参数体量持续增长。这意味着大量优化工作需要突破单机器边界,在集群层面完成全链路调优,尽可能释放国产算力的性能空间,让每一分算力都高效转化为最终的Token产出。因此,集群级优化已成为当前产业落地的关键核心环节。

  在数据层面,随着大模型与Agent逐步走向可用,AI不再只是通用对话工具,而是真正深入行业核心场景。我们服务的各行业中,沉淀了大量高价值关键数据。在此背景下,如何让数据充分释放价值、参与大模型训练,或是作为行业知识在Agent中落地应用,已成为核心关键命题。‌只有先打通数据层面的核心堵点,更强大的算力与模型才能顺畅进入生产环节‌。

  在应用方面,当前智算中心的算力资源仍有极大的释放空间,这就需要我们围绕当地实际产业需求打造更贴合的落地应用,让智算中心的每一分算力都真正转化为现实生产力。

  由此可见,当前AI的发展已不是单点能力的竞争,而是需要“数、算、模、用”四个方面的联合优化,才能真正推动国产算力从“可用”走向“好用”。

  成立三年来,我们实现了三次重要的产业跨越。

  2023年公司刚创立时,我们就注意到不同国产芯片具备差异化的性能表现,适配的模型场景各有侧重,在算力、带宽、容量的不同配置下,可支撑不同类型的AI应用。因此在2023年,我们首创提出了“混元异构”架构:在一个智算中心内部署多种国产芯片,利用不同芯片的差异化能力支撑广泛的应用场景。这样既让国产芯片找到了适配自身优势的落地场景,也为AI产业落地找到了稳定可靠的算力底座。

  2024年,我们承建的北京市数字经济算力中心竣工投用。这里首创部署了国内规模领先的混元异构集群,多种国产芯片汇聚于智算中心,形成了充足的普惠算力供给。在这次部署中,我们沉淀了多维度的全栈产品能力,同时依托真实行业场景的实践,助力国产芯片持续完成技术验证与迭代升级。当前国产芯片产品已迭代至三代、四代,性能正逐步向国际先进水平靠拢。

  在业务模式上,我们先以北京为基地培育标杆智算中心,再将成熟的标杆方案向全国各地区推广。与传统“先建集群再找业务”的模式不同,我们会针对各地区的产业发展需要定制构建集群:先在当地开展深度行业调研,进行“一地一策”和“一业一策”的规划,根据当地实际需求建设适配的算力资源,并配套全套技术服务支撑本地产业发展。我们为算力平台取名“星火”,希望各地落地的算力形成星星之火,最终连成一张覆盖广泛的高效算力网络,让算力普惠服务全国数字经济发展。

  在星火大平台之上,我们构建了“星火云”产品体系。正如前面提到的,在国产算力服务领域,单点能力不足以支撑产业落地,必须打通全栈技术链路,才能更好地服务行业与区域数字化转型。因此我们打造了覆盖“数、算、模、用”四个层面的完整产品矩阵。

  在“算”这一最底层,我们构建的是混元异构集群,配套研发了支持混元异构调度、国产芯片加速的底层算力平台。

  在模型层面,要服务不同行业的差异化需求,就需要开展针对性的模型训练、打造垂直领域专属模型。但垂直领域的数据使用需要受到严格的安全管控,因此我们构建了可信数据空间,保障数据在训练和推理阶段全程不出域,在隐私保护的前提下实现可训练、可推理,并在此基础上训练了一系列覆盖医疗、工业、AI4S等领域的垂域模型。

  在数的方面,当前国内通用大模型能力已达到较高水平,在日常工作场景中得到广泛应用,但行业中的核心关键数据往往具备强特殊性与高价值属性,需要更专业的处理方法才能充分释放其价值。在服务这些行业的过程中,我们沉淀了针对关键数据的成熟处理方法与技术能力,同时全程保障数据安全可靠、权属清晰明确。

  在应用层面,我们为不同行业构建了垂直领域共性技术平台,通过各行业的智能体支撑平台助力行业应用快速孵化。目前,我们已经孵化出工业、医疗、影视、教育等多个垂直平台,后续将逐一展开介绍。

  首先我们开发了前进·AI异构计算平台。这是我们打造的首个核心基础平台,核心要解决的问题是:面对多元的混元异构算力资源,需要完成统一纳管、智能调度,并为不同任务精准分配算力资源。在这个过程中我们面临一个核心挑战:传统智算中心大多采用统一芯片的集群架构,运维逻辑相对简单,可以用一套标准化模式完成全链路操作;而在混元异构、多芯片并存的环境下,集群管理的复杂度大幅提升。为此,我们创新性地引入Agent来管理智算中心,能够快速识别任务需求、定位运行问题、及时完成自动修复。在北京数字经济算力中心,我们已经把空调、供暖等一系列配套设施的管理工作交给智能体完成,由智能体自动处理各类运行告警,大幅降低了智算中心的运维成本与设备运维难度。

  基于这一平台,我们与相关部门合作建设了先进计算迭代验证平台项目。在该平台中,我们纳入了多家厂商的芯片开展体系化评测。与常规评测机构不同,我们完全围绕实际产业使用需求开展芯片评测,通过“以评促用”,找到每种芯片适配的优势领域,并针对算子与通信库完成补齐与拉通优化。早在2023年底至2024年初,我们就实现了混元异构通信,打通了不同芯片之间的互联互通,完成了大模型的异构部署落地。

  针对各类模型,我们还完成了面向不同场景的专项加速,为不同场景匹配对应的最优加速方案,让模型真正实现可用,对外提供训推一体的完整服务。目前,智算中心已接入多家厂商的不同芯片,通过统一接入层,让模型顺利进入推理与纳管体系,并通过多种智能调度方式,充分释放这些芯片的性能与能力。

  我们的服务还覆盖云、边、端的完整架构:在北京构建核心数据中心,在城市与产业园区构建边缘计算中心,在工厂生产机台上直接部署轻量化AI能力。在整体能力层面,我们实现了任务在云边端之间的协同调度。调度完成后,再开展模型推理环节——在宝塔模型推理系统中,我们完成了模型加速、芯片适配等核心工作,通过先进技术充分释放模型能力。比如当前行业广泛应用的PD分离技术:在大模型推理过程中,Prefill阶段对算力要求很高,Decode阶段对带宽要求较高。延续混元异构的技术经验,我们在不同的国产芯片上完成了PD分离能力的拉通适配。目前,我们正在承接相关课题,打造开源开放的推理框架,让不同的国产芯片能在同一套框架下协同工作。

  在长程智能体任务中,随着对话与任务链路不断延长,KV Cache的体积持续增大,如何做好KV Cache的管理与offload,也成为核心技术能力。因此,我们在这套开源框架中实现了基于KV Cache的智能调度。需要说明的是,PD分离和KV Cache技术是当前行业共同攻关的核心方向,我们的落地场景具备差异化的特殊诉求:智算中心内存在更多元的异构芯片混布、新老芯片搭配,以及不同模型针对不同芯片的最优分割策略——这些都是我们场景中需要核心解决的技术问题。

  解决算力供给问题之后,还需要构建可信的数据空间,企业才能放心将核心数据接入平台。2023年,我们率先提出可信数据空间理念,在今年的各项权威评测中均取得了优异成绩。我们的可信数据空间的核心优势在于:深度融合AI能力的应用。可信数据空间的价值,正在从传统的数据处理与分析,向数据的智能应用方向升级。结合AI能力之后,数据不再只是静态资源,而是能够转化为可用的模型与模型可调用的核心能力。依托模型与算力的双重支撑,我们才能高效训练出高质量的垂直领域模型。

  在应用领域,我们以AIGC平台为例,展示我们如何从最底层的算力延伸至最上层的落地应用。在AIGC内容创作、视频创作领域,使用通用AIGC模型生成短视频本身会产生一定的推理成本,而高质量成片的市场报价远高于基础成片。优质视频作品的价格差距,并不来自模型本身的生成能力,而是源于背后创作者的专业创作能力,同时市场上能稳定产出这类高品质视频的人才十分稀缺。在这样的产业背景下,我们开发了“长缨·AIGC平台”。在该平台上,我们通过智能体的方式,让用户能够更加便捷、简洁地完成一键式视频生成。在文旅、广告、营销等场景中,用户只需简单操作,就能创作出影视级的宣传视频,让更多用户能在更短时间内生成更高质量的作品。

  类似的产业需求还有很多,覆盖医疗、工业、AI for Science等多个领域。在医疗领域,我们与顶尖医院通过可信数据空间开展合作,在重点科室打造专科模型,再汇聚形成全科模型助手,并通过相关医疗服务体系辅助家庭医生服务个人用户,全面提升就医体验。在AI for Science领域,我们为顶尖生物医学实验室提供科研分析与科研发现支撑,目前能帮助科研人员将原本需要数十小时的工作大幅压缩,并辅助他们完成科研假设的提出。

  最后,是依托算力与行业能力开展在地运营。虽然日常消费场景中AI的应用已经十分广泛,但进入工业与实体产业内部,落地逻辑仍存在显著差异。因此,要在各地推广AI落地,我们采取“一业一策”和“一地一策”的方法:每到一个地方,先开展深度行业调研,找到当地最具优势的主导产业,打造落地样板,沉淀行业数据,打磨行业专属模型与落地能力,再将这种成熟能力复制推广到下一个城市。通过不同城市的行业能力互补,最终形成覆盖广泛的全国性服务能力,实现规模化落地推广。

  回到最初的愿景:北电数智以建设数字中国为使命,致力于构建自主可控的AI Infra。最后,我们希望科技善存、数智共享,期待更多伙伴与我们一道,在国产算力的产业道路上携手前行。

  谢谢大家!