Базы знаний, интеллектуальные системы, экспертные системы, системы поддержки принятия решений
|
Оформленная ссылка на статью:
Панкратов Э.Р., Якимов А.Б. Сравнительное тестирование open-source LLM на задачах профессиональных предметных областей: многодоменный бенчмарк с мультисудейской и экспертной оценкой // Программные системы и вычислительные методы. 2026. № 3. С. 40-60. DOI: 10.7256/2454-0714.2026.3.80458 EDN: NAGOPN URL: https://nbpublish.com/library_read_article.php?id=80458
|
EDN: NAGOPN
|
Аннотация:
Предметом исследования являются возможности современных открытых больших языковых моделей (LLM) при решении задач профессиональных предметных областей и их пригодность для практического применения в отраслях. В работе представлены результаты сравнительного тестирования 15 open-source моделей с числом параметров от 8 до 120 млрд. Тестирование проводилось на оригинальном русскоязычном бенчмарке, охватывающем 16 отраслевых доменов: энергетика, право, финансы, клинические процессы здравоохранения, терапевтическая практика, фармацевтика, строительство, DevOps, логистика, маркетинг, HR, охрана труда, сельское хозяйство, продажи, закупки/тендеры, производственный инжиниринг. Для каждого домена сформирован набор из 90 вопросов, распределённых по трём уровням сложности; общий объём бенчмарка составляет 1 440 вопросов. Рассматриваются устойчивость моделей к повышению сложности заданий, их доменная специализация и чувствительность к параметрам генерации. Методом исследования служит сравнительное тестирование моделей на едином наборе вопросов. Оценка ответов выполнена в два этапа: автоматическая оценка тремя независимыми моделями-судьями по методологии LLM-as-a-Judge (по критерию смыслового соответствия эталонным ответам) и независимая экспертная оценка специалистами-практиками с последующей сверкой согласованности. Научная новизна работы состоит в создании оригинального русскоязычного бенчмарка объёмом 1 440 вопросов трёх уровней сложности для 16 профессиональных предметных областей (от энергетики и здравоохранения до DevOps и производственного инжиниринга), а также в двухэтапной верификации результатов, сочетающей автоматическую оценку с независимой экспертной проверкой. Проведён анализ согласованности оценок моделей-судей, а также их сверка с оценками специалистов-практиков. По результатам тестирования установлено, что современные модели размерности 27–31 млрд параметров, включая архитектуры Mixture-of-Experts и модели с оптимизацией FP8, сопоставимы по качеству ответов с моделями со 120 млрд параметров или превосходят их при многократно меньшем потреблении вычислительных ресурсов. Предложена система рекомендаций по выбору открытых языковых моделей для отраслевых приложений.
Ключевые слова:
большие языковые модели, LLM, бенчмарк, LLM-as-a-Judge, Открытый исходный код, предметные области, профессиональные знания, мультисудейская оценка, экспертная валидация, сравнительное тестирование
Abstract:
The subject of the study is the capabilities of modern open large language models (LLM) in solving tasks in professional subject areas and their suitability for practical application in industries. The paper presents the results of comparative testing of 15 open-source models with the number of parameters ranging from 8 to 120 billion. The testing was conducted on an original Russian-language benchmark covering 16 industry domains: energy, law, finance, healthcare clinical processes, therapeutic practice, pharmaceuticals, construction, DevOps, logistics, marketing, HR, labor protection, agriculture, sales, procurement/tenders, and manufacturing engineering. For each domain, a set of 90 questions was formed, distributed across three levels of difficulty; the total volume of the benchmark is 1,440 questions. The study examines the models' resilience to increasing task complexity, their domain specialization, and sensitivity to generation parameters. The research method involves comparative testing of models on a single set of questions. Evaluation of the answers was performed in two stages: automatic assessment by three independent judging models using the LLM-as-a-Judge methodology (based on the criterion of semantic correspondence to reference answers) and independent expert evaluation by practitioner specialists with subsequent verification of consistency. The scientific novelty of the work lies in the creation of an original Russian-language benchmark comprising 1,440 questions of three difficulty levels for 16 professional subject areas (from energy and healthcare to DevOps and manufacturing engineering), as well as in the two-stage verification of results, combining automatic assessment with independent expert validation. An analysis of the consistency of the judges' models' evaluations and their comparison with assessments from practitioner specialists was conducted. The testing results indicate that modern models with 27–31 billion parameters, including Mixture-of-Experts architectures and models with FP8 optimization, provide quality of answers comparable to models with 120 billion parameters or exceed them while consuming significantly fewer computational resources. A recommendation system for selecting open language models for industry applications is proposed.
Keywords:
large language models, LLM, benchmark, LLM-as-a-Judge, open-source, domain knowledge, professional evaluation, multi-judge evaluation, expert validation, comparative testing