• 首页
  • 关于超聚变
  • 新闻公告
  • vLLM Meetup深圳站:从算力到Token,超聚变用软硬协同打通推理落地全链路

    vLLM Meetup深圳站:从算力到Token,超聚变用软硬协同打通推理落地全链路

    vLLM Meetup深圳站:从算力到Token,超聚变用软硬协同打通推理落地全链路

    2026年09月04日 阅读 1

    近日,vLLM Meetup 深圳站在深圳湾万丽酒店举行。本次活动由 vLLM 社区发起,超聚变与 Red Hat、MiniMax、NVIDIA、LMCache 共同主办,围绕“从权重到稳定服务”这条大模型推理工程链路,来自开源社区和产业一线的团队展开了深度交流。

    活动开场,超聚变AIOS架构师王有康发表致辞。他表示,从开源模型权重发布,到对外提供稳定、低成本、可扩展的服务,中间隔着一整条工程链路——模型架构、引擎适配、算子优化、整机部署、KV Cache 管理、规模化编排,每一环都不可或缺;今天把这条”大模型推理落地全栈”放在同一个下午拆解,正是 vLLM 社区工程实干精神的体现。

    超聚变 FusionXpark 推理优化工程师程志明分享了《基于 FusionXpark随身智能体开发平台的模型推理服务实践和优化》,重点介绍了多模态视频生成和大模型长上下文推理两类场景的软硬协同优化实践。

    软硬协同,释放“1+1>2”的核心竞争力

    推理服务的竞争,正在从单点硬件性能转向系统级效率。

    超聚变的核心判断是:只有让软件与硬件相互感知、相互优化,才能把算力真正转化为更高的 Token 吞吐与业务收益,形成“1+1>2”的核心竞争力。

    FusionOne AI 聚焦模型部署、服务编排与运行监控等统一管理调度;FusionOS 则深耕软硬协同的性能释放与调优加速,通过 PD 分离、算子加速等技术打破显存与传输瓶颈。二者协同,构成了超聚变面向大模型推理场景的系统级优势。

    实践一:FusionOS + ComfyUI 优化多模态视频生成

    针对 MiniMax-H3 等全模态模型本地化部署中“生成慢、成本高、难商用”等问题,超聚变基于 FusionOS + ComfyUI 完成图像和视频生成工作流优化,并对文生视频(T2V)进行软硬协同调优。测试结果显示:

    性能提升的价值,不止体现在指标上:

    • 同等算力下,企业可以生成更多视频,缩短内容制作周期;

    • 本地部署减少对云端 API 的依赖,保护企业数据与创意资产;

    • 结合多尺寸输出能力,视频生成可进一步服务于广告、影视、电商和企业宣传等业务场景。

    这意味着,企业可在FusionXpark随身智能体开发平台上一键实现 2K 视频模型直出、快速交付,以高性价比输出多尺寸视频并形成定价优势,让每一个企业都拥有自己的“AI 内容工厂”。

    实践二:双 FusionXpark随身智能体开发平台级联部署 DeepSeek V4-Flash

    长上下文大模型对显存容量、节点互联和推理效率提出更高要求。超聚变基于两台 FusionXpark随身智能体开发平台级联部署 DeepSeek V4-Flash,并开展专项调优,典型短上下文和长上下文场景推理吞吐均最高实现8+倍的提升:


    • 业务承载:验证了双 FusionXpark 随身智能体开发平台级联场景下对权重大模型的卓越部署承载能力;

    • 体验改善:长上下文最高实现8+倍的吞吐提升,为 Agent、长文档分析、代码库理解等场景提供高效本地算力支撑;

    • 一键部署:DeepSeek V4-Flash 标准化一键部署能力即将发布,降低企业运维门槛。

    从深圳出发,与开源社区共建推理全栈

    两套实践指向同一个结论:推理优化不是简单的硬件堆叠,而是围绕真实业务场景的系统工程。 当 FusionOne AI 解决“管得好”的问题,FusionOS 解决“跑得快”的问题,FusionXpark随身智能体开发平台提供澎湃的算力底座,超聚变正帮助更多企业将大模型从“部署起来”推进到“稳定运行并产生价值”。

    分享至