GLM-5.3与Claude Fable 5代码能力对决:成本优势明显

Together AI·12 天前

Together AI近日发布了GLM-5.3与Anthropic Claude Fable 5在DeepSWE基准测试中的对比结果。测试共进行了904次代码生成任务评估,结果显示两款模型在单次生成准确率(pass@1)上表现相当,但GLM-5.3在四次生成最佳准确率(pass@4)指标上更胜一筹。

成本方面差异显著:GLM-5.3每次任务成本仅为3.99美元,而Claude Fable 5高达21.63美元,前者成本仅为后者的18.5%。这意味着在获得相近代码质量的前提下,使用GLM-5.3可节省超过80%的计算开销。

DeepSWE作为新兴的软件工程评估基准,专注于测试大模型解决实际编程问题的能力。此次对比不仅展示了开源模型在性能上已能媲美顶级闭源模型,更凸显了其在成本效益方面的巨大优势,为开发者提供了更具性价比的选择。

大语言模型代码生成性能基准成本对比开源模型

原文来源:https://www.together.ai/blog/glm-5-3-vs-claude-fable-5-on-deepswe-cost-coding-and-routing

相关阅读

GLM-5.3 Flash成本效益显著:仅牺牲少量性能,成本骤降17倍
GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 基准测试中成本与性能对比
DeepSeek V4 Pro 与 Claude Fable 5 在 DeepSWE 基准测试中展开成本与性能较量
DeepSeek V4 Pro与GPT-5.6 Sol代码能力对比:成本与性能的博弈
生产环境模型A/B测试新策略:端侧分流更精准

← 返回