|
智谱发布新模型GLM-5.3-FlashX,官方称其最高推理速度达每秒200个token。该模型基于GLM-5.3-Flash,后者在海外有一定调用量。目前,GLM-5.3-FlashX的API已上线,开发者可用Model Key:GLM-5.3-FlashX调用。 这背后,智谱依托10万张国产芯片的推理算力,优化Infra基建与推理,提升了模型推理速度。这有望吸引更多开发者调用,未来或推动国产芯片在AI模型领域的应用拓展。 |
AI INSIGHT
智谱新模型GLM - 5.3 - FlashX上线,每秒推理200 tokens助力国产芯片应用
AI 摘要
智谱发布新模型GLM-5.3-FlashX,官方称其最高推理速度达每秒200个token。该模型基于GLM-5.3-Flash,后者在海外有一定调用量。目前,GLM-5.3-FlashX的API已上线,开发者可用Model Key:GLM-5.3-FlashX调用。这背后,智谱依托10万张国产芯片的推理算力,优化Infra基建与推理,提升了模型推理速度。这有望吸引更多开发者调用,未