GLM-5.3与Claude Fable 5代码能力对决:成本优势明显
Together AI近日发布了GLM-5.3与Anthropic Claude Fable 5在DeepSWE基准测试中的对比结果。测试共进行了904次代码生成任务评估,结果显示两款模型在单次生成准确率(pass@1)上表现相当,但GLM-5.3在四次生成最佳准确率(pass@4)指标上更胜一筹。
成本方面差异显著:GLM-5.3每次任务成本仅为3.99美元,而Claude Fable 5高达21.63美元,前者成本仅为后者的18.5%。这意味着在获得相近代码质量的前提下,使用GLM-5.3可节省超过80%的计算开销。
DeepSWE作为新兴的软件工程评估基准,专注于测试大模型解决实际编程问题的能力。此次对比不仅展示了开源模型在性能上已能媲美顶级闭源模型,更凸显了其在成本效益方面的巨大优势,为开发者提供了更具性价比的选择。
原文来源:https://www.together.ai/blog/glm-5-3-vs-claude-fable-5-on-deepswe-cost-coding-and-routing