GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 基准测试中成本与性能对比
Together AI 近日发布了一项针对 GLM-5.3 和 GPT-5.6 Sol 两款大语言模型的对比测试。测试基于 904 次 DeepSWE(深度软件工程)任务展开,评估了模型在代码生成与问题解决方面的表现。结果显示,GPT-5.6 Sol 在单次通过率(pass@1)上以 3.7 个百分点的优势领先。然而,在考虑四次尝试通过率(pass@4)时,GLM-5.3 不仅表现更优,且其计算成本仅为对手的一半,展现出更高的性价比。此外,测试中还探索了模型级联策略:若优先使用 GLM-5.3 处理任务,仅在需要时切换至 GPT-5.6 Sol,整体任务通过率可达 85.9%。这一发现为实际部署中平衡性能与成本提供了重要参考,凸显了在不同场景下灵活选用或组合模型的潜在价值。
原文来源:https://www.together.ai/blog/glm-5-3-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing