智谱推出GLM-5.3-FlashX 推理速度最高达200 tokens/s

商业品牌
2026 09-18 14:58:34
分享

  【CNMO科技消息】9月18日,智谱正式推出大模型GLM-5.3-FlashX,该模型最高推理速度可达200 tokens/s,将为企业和开发者提供更快、更流畅的模型体验。目前,GLM-5.3-FlashX API已上线。据介绍,为应对快速增长的用户需求,智谱在原有国产芯片算力基础上,进一步加大了对Infra侧的投入与推理优化。GLM-5.3-Flash长期保持同尺寸最强智能水平,并具备极高性价比,本次提速进一步形成智能、价格、速度的全面竞争力。

智谱
智谱

  据CNMO科技了解,智谱此前推出了GLM-5.3-Flash,该模型在正式发布前,曾以匿名模型“Ox Alpha”面向全球开发者进行了大规模测试,获得广泛认可,上线后调用量持续攀升,曾登顶OpenRouter平台使用量排行榜第一,同时创下OpenCode、OpenRouter双平台调用量新高。智谱表示,处理GLM-5.3-Flash全部线上调用请求共投入了10万颗国产芯片。虽未公开具体芯片厂商,但有行业分析师推测其大概率采用华为昇腾系列芯片。

  在集群层面,智谱采用生产级EPD分离式架构,将多模态编码、prompt预填充和逐token解码拆分为独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。智谱方面表示,此次优化验证了国产芯片可在大规模场景下高效、经济地支撑前沿模型的推理需求。

来源:手机中国
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。