耶鲁大学推出新基准ML-Bench,对大语言模型的调包现象进行评估 本篇文章介绍了耶鲁提出的新代码生成基准:ML-Bench。传统的代码生成数据集过于强调从零开始编写代码,而ML-Bench基于14个流行的开源GitHub机器学习仓库构建了一个新的机器学习任务数据集,模型可以根据用户需求生成Python代码或Bash脚本。这个数据集反映的编程场景更接近于实际应用情况... AI工具箱3年前