ParallelKernelBench评测:前沿大模型尚难编写高效多GPU计算内核
Together AI团队近日推出ParallelKernelBench基准测试平台,专门评估大语言模型编写多GPU并行计算内核的实际能力。该测试涵盖87个真实计算场景,要求模型生成高效的CUDA并行计算代码。结果显示,目前表现最佳的模型仅能成功解决不到30%的任务,暴露出大模型在复杂并行编程领域的局限性。值得注意的是,尽管整体成功率不高,但模型生成的少数内核代码在性能上超越了现有公开实现方案,展现出AI辅助编程的潜在价值。这项研究揭示了当前大模型在专业计算编程领域仍面临挑战,同时也为未来AI代码生成工具的发展方向提供了重要参考。