显著性能提升
支持 FP32、FP16、FP8、INT8 及 FP4 等多种计算精度,面向大模型推理实现更高效能;仿真实测显示,GEMM 算子 TensorCore 和 FlashAttention 算子计算效率约达 99%和 98%,逼近理论上限;AI 引擎核心架构突破,FP4 算力达到 P 级,单卡性能密度提升数倍。
产品概况
启望 S3 是曦望面向多模态大模型与 AI 智能体推理打造的新一代高性价比推理 GPU , 支持大容量显存与低精度计算,并具备灵活的集群扩展能力,致力于持续提高单位经济性与降低 TCO ,推动 AI 推理算力的普惠化落地。

支持 FP32、FP16、FP8、INT8 及 FP4 等多种计算精度,面向大模型推理实现更高效能;仿真实测显示,GEMM 算子 TensorCore 和 FlashAttention 算子计算效率约达 99%和 98%,逼近理论上限;AI 引擎核心架构突破,FP4 算力达到 P 级,单卡性能密度提升数倍。
S3 采用 LPDDR6 内存(向下兼容 LPDDR5X)和 PCIe Gen6 ,以更大显存容量、更优互联带宽和更低成本支持大模型推理,并通过对 Prefill / Decode 等关键阶段优化,提升吞吐与响应效率,实现推理性价比的飞跃。
依托大容量内存减少 GPU 与系统内存之间的数据交换,支持低延迟的长上下文工作负载推理,并提升复杂多轮、多模态任务的稳定性,对 AI 智能体核心任务进行算子级优化。为适应 AI 智能体任务以及多模态大模型进行定向优化,支撑百万级 Token 超长上下文,显著减少数据在显存与系统内存之间的反复交换,大幅提升 Agent 的执行效率与稳定性。
S3 围绕真实推理负载,采用统一芯片架构与软件栈,可实现云边端一体化部署;并通过架构、IP 设计多点突破,达到算力访存比的甜点,不浪费一分算力和带宽,实现计算性能、显存与能效的显著提升。
产品形态

Rise SC3-256 SuperPOD
SIRE
兼容第三方 GPGPU 计算软件平台,支持零代码无缝迁移
悬浮探索每一层