GBNP-2026:面向畜禽遗传、育种、营养与生产的大语言模型专业问答能力评测基准OA
GBNP-2026:A benchmark for evaluating large language models'professional question-answering capabilities in animal genetics,breeding,nutrition,and production
[目的]畜禽领域问答往往术语密集、推理链条长,且常涉及指标、参数与方案的权衡;本文从主观题作答与评分细则出发,考查大语言模型在畜禽领域场景中的专业可用性.[方法]构建中文垂直测评基准,即畜禽遗传、育种、营养与生产测评基准(Genetics,breeding,nutrition,and production benchmark,GBNP-2026),收录主观题510道(简答363道、论述147道);每题配有标准答案、可核查给分点与领域标签.在零样本、无上下文条件下,对9个开源与闭源模型统一评测,采用"给分点覆盖率+质量分"双维度自动评分,并对低分样本作错误归因与跨领域比较.[结果]模型总体得分呈梯度分布,平均分64.03~83.99,覆盖率70.6%~91.9%;论述题得分整体高于简答题;育种领域在多数模型中得分最低.低分样本628例中,知识遗漏占37.3%,幻觉编造占25.0%;知识遗漏比例在领域间差异显著(x²=8.42,P=0.038).[结论]与单纯依赖选择题准确率相比,融合覆盖率与质量分的主观题评测有助于区分模型在畜禽专业场景中的能力差异与薄弱环节,但对严格数值推导类任务仍需另行设计题型加以验证.
[Objective]Livestock-related QA is terminology-heavy and often involves indicators,parameters,and trade-offs in breeding and production plans.This study evaluates LLM professional usability using subjective responses and explicit scoring rubrics.[Methods]We built a Chinese vertical benchmark,the Genetics,Breeding,Nutrition,and Production Benchmark(GBNP-2026),with 510 subjective items(363 short-answer and 147 essay)spanning the same four domains,each with a reference answer,checkable scoring points,and domain tags.Nine open-and closed-source models were tested under a unified zero-shot,context-free protocol,scored by coverage and quality,followed by error attribution on low-score cases.[Results]Mean scores ranged from 64.03 to 83.99 and coverage from 70.6%to 91.9%.Essay items scored higher than short-answer items on average;breeding was the weakest domain for most models.Among 628 low-score samples,missing knowledge(37.3%)and hallucinations(25.0%)dominated.Missing-knowledge rates differed across domains(x²=8.42,P=0.038),highest in breeding(47.1%).[Conclusion]Compared with multiple-choice accuracy alone,coverage-plus-quality scoring helps separate capability gaps in this setting;strictly numerical or proof-style tasks still need a dedicated sub-benchmark.GBNP-2026 and the pipeline support reproducible comparison,error diagnosis,and data planning for SFT/RAG.
肖成朋;金炜炜;孙桂荣;罗艳;顾兴健;陆明洲;康相涛;李文婷;李成林;雷艳茹;蔡钊;谢伯斐;王克君;郭玉洁;宫玉杰;李东华
河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046南京农业大学人工智能学院,江苏 南京 210000南京农业大学人工智能学院,江苏 南京 210000南京农业大学人工智能学院,江苏 南京 210000河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||南京农业大学人工智能学院,江苏 南京 210000河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046河南农业大学动物科技学院,河南 郑州 450046||神农种业实验室,河南 郑州 450046
农业科技
大语言模型题库评估遗传育种自动评分领域评测
Large language modelQuestion bank assessmentGenetic breedingAutomatic scoringDomain evaluation
《中国畜禽种业》 2026 (7)
17-27,11
国家自然科学基金(32422081)中原英才计划(育才系列):青年拔尖人才.
评论