GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 基准测试中成本与性能对比

Together AI·12 天前

Together AI 近日发布了一项针对 GLM-5.3 和 GPT-5.6 Sol 两款大语言模型的对比测试。测试基于 904 次 DeepSWE(深度软件工程)任务展开,评估了模型在代码生成与问题解决方面的表现。结果显示,GPT-5.6 Sol 在单次通过率(pass@1)上以 3.7 个百分点的优势领先。然而,在考虑四次尝试通过率(pass@4)时,GLM-5.3 不仅表现更优,且其计算成本仅为对手的一半,展现出更高的性价比。此外,测试中还探索了模型级联策略:若优先使用 GLM-5.3 处理任务,仅在需要时切换至 GPT-5.6 Sol,整体任务通过率可达 85.9%。这一发现为实际部署中平衡性能与成本提供了重要参考,凸显了在不同场景下灵活选用或组合模型的潜在价值。

大语言模型性能评测成本效益代码生成Together AI

原文来源:https://www.together.ai/blog/glm-5-3-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing

相关阅读

GLM-5.3 Flash成本效益显著:仅牺牲少量性能,成本骤降17倍
GLM-5.3与Claude Fable 5代码能力对决:成本优势明显
DeepSeek V4 Pro 与 Claude Fable 5 在 DeepSWE 基准测试中展开成本与性能较量
DeepSeek V4 Pro与GPT-5.6 Sol代码能力对比:成本与性能的博弈
生产环境模型A/B测试新策略:端侧分流更精准

← 返回