Go Benchmark报告allocs/op并定位临时对象来源的方法
用 go test -benchmem 和 testing.B.Repo
HELM(Holistic Evaluation of Language Models,即语言模型整体评估)是由斯坦福大学研发的一套系统化大模型评测框架。该体系主要由场景(Scenario)、适配(Adapter)和指标(Metric)三大核心模块构成。在执行每次评测时,用户需指定具体的应用场景、针对模型的提示词适配策略,以及一个或多个评估指标。HELM主要聚焦于英语环境下的模型表现,通过准确率、不确定性校准、鲁棒性、公平性、偏差、毒性内容以及推断效率等多个维度进行综合打分。它广泛适用于问答系统、信息检索、文本分类等多种任务,旨在为研究人员和开发者提供一套全面、标准的评估方法,从而更深入地理解并优化语言模型的性能。


pip install helmgit clone https://github.com/stanford-crfm/helm.git
cd helm
pip install -e .helm run --config <path_to_config_file> --model <model_name><path_to_config_file>:指定配置文件的具体路径。<model_name>:输入待评估的语言模型名称(例如gpt-3、bert-base-uncased等)。