DeepSeek V4 Pro 与 Claude Fable 5 在 DeepSWE 基准测试中展开成本与性能较量
近日,Together AI 发布了一项针对两大前沿模型——DeepSeek V4 Pro 0813 和 Claude Fable 5——在 DeepSWE(深度软件工程)基准测试上的对比分析。研究团队共执行了 904 次测试任务,以评估两者在代码生成与问题解决方面的性能与成本效率。
结果显示,Claude Fable 5 在首次尝试成功率(pass@1)上表现最佳,但其计算成本高达 DeepSeek V4 Pro 的约 90 倍。而 DeepSeek V4 Pro 则在四次尝试成功率(pass@4)指标上反超,展现出更强的迭代优化潜力。
值得注意的是,研究提出了一种“Pro 优先级联”策略:先使用成本较低的 DeepSeek V4 Pro 进行处理,仅在其失败时调用高成本的 Claude Fable 5。该混合方案在测试中实现了 82.7% 的整体成功率,在控制成本的同时显著提升了任务完成率。这一发现为实际部署中平衡性能与开销提供了有价值的参考。