DeepSeek V4 Pro与GPT-5.6 Sol代码能力对比:成本与性能的博弈
Together AI近日发布了一项针对两大主流AI模型的代码生成能力对比测试。在904次DeepSWE基准测试中,GPT-5.6 Sol在首次尝试准确率(pass@1)上以10个百分点的优势领先于DeepSeek V4 Pro 0813版本。然而这一性能优势伴随着高昂的成本代价——GPT-5.6 Sol的调用成本达到DeepSeek V4 Pro的35倍。
值得注意的是,当评估标准转为四次尝试准确率(pass@4)时,DeepSeek V4 Pro实现了反超,展现出更强的迭代优化能力。测试团队还探索了混合使用策略:采用DeepSeek优先、GPT-5.6 Sol备用的级联方案,最终实现了83.0%的综合准确率。这一结果揭示了在实际应用中,用户可以根据不同场景在性能与成本之间做出灵活权衡。
本次对比为开发者选择AI编码助手提供了重要参考,特别是在预算敏感的项目中,DeepSeek V4 Pro展现出优异的性价比优势。
原文来源:https://www.together.ai/blog/deepseek-v4-pro-0813-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing