Standard

Экспериментальное исследование моделей на основе инструкций для извлечения предметно-ориентированных сущностей из студенческих отчетов. / Мельникова, Антонина Владимировна; Воробьева, Марина Сергеевна; Glazkova, Anna V. et al.

In: Труды Института системного программирования РАН, Vol. 38, No. 2, 11, 2026, p. 165-182.

Research output: Contribution to journalArticlepeer-review

Harvard

APA

Vancouver

Мельникова АВ, Воробьева МС, Glazkova AV, Morozov DA. Экспериментальное исследование моделей на основе инструкций для извлечения предметно-ориентированных сущностей из студенческих отчетов. Труды Института системного программирования РАН. 2026;38(2):165-182. 11. doi: 10.15514/ISPRAS-2026-38(2)-11

Author

Мельникова, Антонина Владимировна ; Воробьева, Марина Сергеевна ; Glazkova, Anna V. et al. / Экспериментальное исследование моделей на основе инструкций для извлечения предметно-ориентированных сущностей из студенческих отчетов. In: Труды Института системного программирования РАН. 2026 ; Vol. 38, No. 2. pp. 165-182.

BibTeX

@article{555ba1d6094b43ba88f7c87d04e98d34,
title = "Экспериментальное исследование моделей на основе инструкций для извлечения предметно-ориентированных сущностей из студенческих отчетов",
abstract = "В работе исследовалась задача извлечения из студенческих отчетов ИТ-направлений предметно-ориентированных сущностей (ПОС), являющихся ключевыми терминами, навыками, именованными сущностями, отражающими тематическую специфику текста. В качестве решений рассматривались инструмент извлечения ключевых слов rutermextract, дообученная языковая модель mBART, большие языковые модели, управляемые инструкциями (YandexGPT, Saiga, Tlite). Дообучение mBART эффективно при достаточном объеме данных. Модели на инструкциях превзошли rutermextract, перспективны при малых объемах данных, особенно Saiga, выявляющая ядро сущностей. Выявлено, что стратегия выделения ПОС в тексте точнее, чем извлечение в виде списка. Однако задача требует дополнительных исследований: ошибочное извлечение ПОС (67-89%), проявляющееся в отсутствии пересечений с эталонными ПОС, указывает на трудности моделей в отделении ядра сущности от контекста. Основные ограничения - малый корпус (2933 текста) и простые инструкции. Перспективы исследования: детализированные инструкции, оценка подходов в других областях и типах текстов.",
keywords = "предметно-ориентированные сущности, извлечение сущностей, обработка естественного языка, предварительно обученные языковые модели, модели на основе инструкций, генеративные языковые модели, анализ отчетных документов, обучение на основе инструкций, domain-specific entities, entity extraction, natural language processing, pre-trained language models, instruction-based models, generative language models, report document analysis, instruction tuning",
author = "Мельникова, {Антонина Владимировна} and Воробьева, {Марина Сергеевна} and Glazkova, {Anna V.} and Morozov, {Dmitry A.}",
note = "Экспериментальное исследование моделей на основе инструкций для извлечения предметно-ориентированных сущностей из студенческих отчетов / А.В. Мельникова, М.С. Воробьева, А.В. Глазкова, Д.А. Морозов // Труды Института системного программирования РАН. – 2026. – Т. 38. - № 2. – С. 165-182. – DOI 10.15514/ISPRAS-2026-38(2)-11. – EDN VKFCKA. Исследование выполнено при поддержке Министерства науки и высшего образования Российской Федерации в рамках государственного задания (FEWZ-2024-0052).",
year = "2026",
doi = "10.15514/ISPRAS-2026-38(2)-11",
language = "русский",
volume = "38",
pages = "165--182",
journal = "Труды Института системного программирования РАН",
issn = "2220-6426",
publisher = "Институт системного программирования им. В. П. Иванникова РАН",
number = "2",

}

RIS

TY - JOUR

T1 - Экспериментальное исследование моделей на основе инструкций для извлечения предметно-ориентированных сущностей из студенческих отчетов

AU - Мельникова, Антонина Владимировна

AU - Воробьева, Марина Сергеевна

AU - Glazkova, Anna V.

AU - Morozov, Dmitry A.

N1 - Экспериментальное исследование моделей на основе инструкций для извлечения предметно-ориентированных сущностей из студенческих отчетов / А.В. Мельникова, М.С. Воробьева, А.В. Глазкова, Д.А. Морозов // Труды Института системного программирования РАН. – 2026. – Т. 38. - № 2. – С. 165-182. – DOI 10.15514/ISPRAS-2026-38(2)-11. – EDN VKFCKA. Исследование выполнено при поддержке Министерства науки и высшего образования Российской Федерации в рамках государственного задания (FEWZ-2024-0052).

PY - 2026

Y1 - 2026

N2 - В работе исследовалась задача извлечения из студенческих отчетов ИТ-направлений предметно-ориентированных сущностей (ПОС), являющихся ключевыми терминами, навыками, именованными сущностями, отражающими тематическую специфику текста. В качестве решений рассматривались инструмент извлечения ключевых слов rutermextract, дообученная языковая модель mBART, большие языковые модели, управляемые инструкциями (YandexGPT, Saiga, Tlite). Дообучение mBART эффективно при достаточном объеме данных. Модели на инструкциях превзошли rutermextract, перспективны при малых объемах данных, особенно Saiga, выявляющая ядро сущностей. Выявлено, что стратегия выделения ПОС в тексте точнее, чем извлечение в виде списка. Однако задача требует дополнительных исследований: ошибочное извлечение ПОС (67-89%), проявляющееся в отсутствии пересечений с эталонными ПОС, указывает на трудности моделей в отделении ядра сущности от контекста. Основные ограничения - малый корпус (2933 текста) и простые инструкции. Перспективы исследования: детализированные инструкции, оценка подходов в других областях и типах текстов.

AB - В работе исследовалась задача извлечения из студенческих отчетов ИТ-направлений предметно-ориентированных сущностей (ПОС), являющихся ключевыми терминами, навыками, именованными сущностями, отражающими тематическую специфику текста. В качестве решений рассматривались инструмент извлечения ключевых слов rutermextract, дообученная языковая модель mBART, большие языковые модели, управляемые инструкциями (YandexGPT, Saiga, Tlite). Дообучение mBART эффективно при достаточном объеме данных. Модели на инструкциях превзошли rutermextract, перспективны при малых объемах данных, особенно Saiga, выявляющая ядро сущностей. Выявлено, что стратегия выделения ПОС в тексте точнее, чем извлечение в виде списка. Однако задача требует дополнительных исследований: ошибочное извлечение ПОС (67-89%), проявляющееся в отсутствии пересечений с эталонными ПОС, указывает на трудности моделей в отделении ядра сущности от контекста. Основные ограничения - малый корпус (2933 текста) и простые инструкции. Перспективы исследования: детализированные инструкции, оценка подходов в других областях и типах текстов.

KW - предметно-ориентированные сущности

KW - извлечение сущностей

KW - обработка естественного языка

KW - предварительно обученные языковые модели

KW - модели на основе инструкций

KW - генеративные языковые модели

KW - анализ отчетных документов

KW - обучение на основе инструкций

KW - domain-specific entities

KW - entity extraction

KW - natural language processing

KW - pre-trained language models

KW - instruction-based models

KW - generative language models

KW - report document analysis

KW - instruction tuning

UR - https://www.elibrary.ru/item.asp?id=89233159

U2 - 10.15514/ISPRAS-2026-38(2)-11

DO - 10.15514/ISPRAS-2026-38(2)-11

M3 - статья

VL - 38

SP - 165

EP - 182

JO - Труды Института системного программирования РАН

JF - Труды Института системного программирования РАН

SN - 2220-6426

IS - 2

M1 - 11

ER -

ID: 82775404