Ai Model Benchmarks HELM – 斯坦福大学大模型评测体系 HELM 是斯坦福大学开发的一套标准化大模型评测框架,旨在通过多维度的量化分析,解决当前 AI 模型评估缺乏统一标准的问题。