DeepSeek-V4 Flash 与 GPT-5.6 Luna 成本与性能对比:编程效率谁更胜一筹?
Together AI 近日公布了一项针对 DeepSeek-V4 Flash 和 GPT-5.6 Luna 的编程性能对比测试。测试基于 DeepSWE 编程基准,共进行了 900 次评估。结果显示,GPT-5.6 Luna 在首次尝试通过率(pass@1)上表现更优,领先 DeepSeek-V4 Flash 约 14 个百分点,显示出其在解决复杂编程任务时可能具备更强的准确性和一次性成功率。然而,在成本效益方面,DeepSeek-V4 Flash 展现出了显著优势。据测算,在同等花费下,DeepSeek-V4 Flash 能够解决的问题数量是 GPT-5.6 Luna 的 4.8 倍。这一对比突显了当前大模型领域在性能与成本之间存在的权衡,为开发者和企业在选择模型时提供了重要的参考维度,即需要在绝对性能与部署经济性之间做出平衡。
原文来源:https://www.together.ai/blog/deepseek-v4-flash-0731-vs-gpt-5-6-luna-on-deepswe-cost-and-coding