DeepSeek-V4 Flash 与 GPT-5.6 Luna 成本与性能对比:编程效率谁更胜一筹?

Together AI·27 天前

Together AI 近日公布了一项针对 DeepSeek-V4 Flash 和 GPT-5.6 Luna 的编程性能对比测试。测试基于 DeepSWE 编程基准,共进行了 900 次评估。结果显示,GPT-5.6 Luna 在首次尝试通过率(pass@1)上表现更优,领先 DeepSeek-V4 Flash 约 14 个百分点,显示出其在解决复杂编程任务时可能具备更强的准确性和一次性成功率。然而,在成本效益方面,DeepSeek-V4 Flash 展现出了显著优势。据测算,在同等花费下,DeepSeek-V4 Flash 能够解决的问题数量是 GPT-5.6 Luna 的 4.8 倍。这一对比突显了当前大模型领域在性能与成本之间存在的权衡,为开发者和企业在选择模型时提供了重要的参考维度,即需要在绝对性能与部署经济性之间做出平衡。

大模型性能评测成本效益编程能力DeepSeek

原文来源:https://www.together.ai/blog/deepseek-v4-flash-0731-vs-gpt-5-6-luna-on-deepswe-cost-and-coding

相关阅读

GLM-5.3 Flash成本效益显著:仅牺牲少量性能,成本骤降17倍
GLM-5.3与Claude Fable 5代码能力对决:成本优势明显
GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 基准测试中成本与性能对比
DeepSeek V4 Pro 与 Claude Fable 5 在 DeepSWE 基准测试中展开成本与性能较量
DeepSeek V4 Pro与GPT-5.6 Sol代码能力对比:成本与性能的博弈

← 返回