Standard

Применимость больших языковых моделей в задаче пословного выравнивания русско-английских битекстов. / Morozov, Dmitry A.; Makhova, Aleksandra A.; Dyachenko, Pavel V. и др.

в: Modeling and Analysis of Information Systems, Том 33, № 1, 3, 2026, стр. 48-61.

Результаты исследований: Научные публикации в периодических изданияхстатьяРецензирование

Harvard

APA

Vancouver

Morozov DA, Makhova AA, Dyachenko PV, Kozerenko AD. Применимость больших языковых моделей в задаче пословного выравнивания русско-английских битекстов. Modeling and Analysis of Information Systems. 2026;33(1):48-61. 3. doi: 10.18255/1818-1015-2026-1-48-61

Author

Morozov, Dmitry A. ; Makhova, Aleksandra A. ; Dyachenko, Pavel V. и др. / Применимость больших языковых моделей в задаче пословного выравнивания русско-английских битекстов. в: Modeling and Analysis of Information Systems. 2026 ; Том 33, № 1. стр. 48-61.

BibTeX

@article{330f6d29872e484cbba90162dc4b68d9,
title = "Применимость больших языковых моделей в задаче пословного выравнивания русско-английских битекстов",
abstract = "В настоящей статье исследуется задача автоматического пословного выравнивания параллельных текстов, являющаяся фундаментальным этапом для обучения систем машинного перевода, сопоставительного исследования языков и создания лингвистических ресурсов. В условиях дефицита аннотированных данных для многих языковых пар особую актуальность приобретает вопрос применимости больших языковых моделей (LLM), обладающих высокими обобщающими способностями и способных решать многие задачи без длительного обучения на целевой выборке. Работа посвящена сравнительному анализу эффективности современных LLM общего назначения и специализированных алгоритмов выравнивания на материале русско-английской языковой пары. Проведённое исследование включало тестирование десяти передовых моделей (в том числе Gemini 3 Pro, GPT-5.2, Claude Sonnet 4.5) с использованием различных стратегий промптирования (zero-shot, few-shot), а также пяти базовых подходов: от статистических методов (fast-align, eflomal) до нейросетевых архитектур (AwesomeAlign, AccAlign, BinaryAlign). Оценка качества производилась на основе метрик точности, полноты, F-меры и AER с использованием размеченных данных Национального корпуса русского языка. Результаты экспериментов показали, что специализированный алгоритм BinaryAlign сохраняет лидерство по совокупному качеству разметки (F-мера 0.883, AER 0.113). Однако ведущие LLM, в частности Gemini 3 Pro Preview и GPT-5.2, продемонстрировали результаты, превзошедшие большинство классических и ранних нейросетевых решений. Примечательно, что для наиболее эффективных моделей добавление примеров в контекст часто снижало качество по сравнению с режимом zero-shot. Таким образом, современные LLM могут служить надежным инструментом для высокоуровневого выравнивания в условиях отсутствия обучающих выборок, что открывает новые перспективы для обработки малоресурсных языковых пар.",
keywords = "пословное выравнивание, большие языковые модели, параллельные корпусы, обработка естественного языка, машинный перевод, русско-английская языковая пара, word alignment, large language models, parallel corpora, natural language processing, machine translation, Russian-English language pair",
author = "Morozov, {Dmitry A.} and Makhova, {Aleksandra A.} and Dyachenko, {Pavel V.} and Kozerenko, {Anastasia D.}",
note = "Применимость больших языковых моделей в задаче пословного выравнивания русско-английских битекстов / Д.А. Морозов, А.А. Махова, П.В. Дяченко, А.Д. Козеренко // Моделирование и анализ информационных систем. – 2026. – Т. 33. - № 1. – С. 48-61. – DOI 10.18255/1818-1015-2026-1-48-61. – EDN XAPWET. При поддержке: Министерство науки и высшего образования Российской Федерации (соглашение №075-03-2026-305 от 16 января 2026 г., проект «Прикладные исследования по внедрению технологий искусственного интеллекта в высшее образование», шифр: FSMG-2025-0086).",
year = "2026",
doi = "10.18255/1818-1015-2026-1-48-61",
language = "русский",
volume = "33",
pages = "48--61",
journal = "Моделирование и анализ информационных систем",
issn = "1818-1015",
publisher = "Ярославский государственный университет им. П.Г. Демидова",
number = "1",

}

RIS

TY - JOUR

T1 - Применимость больших языковых моделей в задаче пословного выравнивания русско-английских битекстов

AU - Morozov, Dmitry A.

AU - Makhova, Aleksandra A.

AU - Dyachenko, Pavel V.

AU - Kozerenko, Anastasia D.

N1 - Применимость больших языковых моделей в задаче пословного выравнивания русско-английских битекстов / Д.А. Морозов, А.А. Махова, П.В. Дяченко, А.Д. Козеренко // Моделирование и анализ информационных систем. – 2026. – Т. 33. - № 1. – С. 48-61. – DOI 10.18255/1818-1015-2026-1-48-61. – EDN XAPWET. При поддержке: Министерство науки и высшего образования Российской Федерации (соглашение №075-03-2026-305 от 16 января 2026 г., проект «Прикладные исследования по внедрению технологий искусственного интеллекта в высшее образование», шифр: FSMG-2025-0086).

PY - 2026

Y1 - 2026

N2 - В настоящей статье исследуется задача автоматического пословного выравнивания параллельных текстов, являющаяся фундаментальным этапом для обучения систем машинного перевода, сопоставительного исследования языков и создания лингвистических ресурсов. В условиях дефицита аннотированных данных для многих языковых пар особую актуальность приобретает вопрос применимости больших языковых моделей (LLM), обладающих высокими обобщающими способностями и способных решать многие задачи без длительного обучения на целевой выборке. Работа посвящена сравнительному анализу эффективности современных LLM общего назначения и специализированных алгоритмов выравнивания на материале русско-английской языковой пары. Проведённое исследование включало тестирование десяти передовых моделей (в том числе Gemini 3 Pro, GPT-5.2, Claude Sonnet 4.5) с использованием различных стратегий промптирования (zero-shot, few-shot), а также пяти базовых подходов: от статистических методов (fast-align, eflomal) до нейросетевых архитектур (AwesomeAlign, AccAlign, BinaryAlign). Оценка качества производилась на основе метрик точности, полноты, F-меры и AER с использованием размеченных данных Национального корпуса русского языка. Результаты экспериментов показали, что специализированный алгоритм BinaryAlign сохраняет лидерство по совокупному качеству разметки (F-мера 0.883, AER 0.113). Однако ведущие LLM, в частности Gemini 3 Pro Preview и GPT-5.2, продемонстрировали результаты, превзошедшие большинство классических и ранних нейросетевых решений. Примечательно, что для наиболее эффективных моделей добавление примеров в контекст часто снижало качество по сравнению с режимом zero-shot. Таким образом, современные LLM могут служить надежным инструментом для высокоуровневого выравнивания в условиях отсутствия обучающих выборок, что открывает новые перспективы для обработки малоресурсных языковых пар.

AB - В настоящей статье исследуется задача автоматического пословного выравнивания параллельных текстов, являющаяся фундаментальным этапом для обучения систем машинного перевода, сопоставительного исследования языков и создания лингвистических ресурсов. В условиях дефицита аннотированных данных для многих языковых пар особую актуальность приобретает вопрос применимости больших языковых моделей (LLM), обладающих высокими обобщающими способностями и способных решать многие задачи без длительного обучения на целевой выборке. Работа посвящена сравнительному анализу эффективности современных LLM общего назначения и специализированных алгоритмов выравнивания на материале русско-английской языковой пары. Проведённое исследование включало тестирование десяти передовых моделей (в том числе Gemini 3 Pro, GPT-5.2, Claude Sonnet 4.5) с использованием различных стратегий промптирования (zero-shot, few-shot), а также пяти базовых подходов: от статистических методов (fast-align, eflomal) до нейросетевых архитектур (AwesomeAlign, AccAlign, BinaryAlign). Оценка качества производилась на основе метрик точности, полноты, F-меры и AER с использованием размеченных данных Национального корпуса русского языка. Результаты экспериментов показали, что специализированный алгоритм BinaryAlign сохраняет лидерство по совокупному качеству разметки (F-мера 0.883, AER 0.113). Однако ведущие LLM, в частности Gemini 3 Pro Preview и GPT-5.2, продемонстрировали результаты, превзошедшие большинство классических и ранних нейросетевых решений. Примечательно, что для наиболее эффективных моделей добавление примеров в контекст часто снижало качество по сравнению с режимом zero-shot. Таким образом, современные LLM могут служить надежным инструментом для высокоуровневого выравнивания в условиях отсутствия обучающих выборок, что открывает новые перспективы для обработки малоресурсных языковых пар.

KW - пословное выравнивание

KW - большие языковые модели

KW - параллельные корпусы

KW - обработка естественного языка

KW - машинный перевод

KW - русско-английская языковая пара

KW - word alignment

KW - large language models

KW - parallel corpora

KW - natural language processing

KW - machine translation

KW - Russian-English language pair

UR - https://www.elibrary.ru/item.asp?id=89054738

U2 - 10.18255/1818-1015-2026-1-48-61

DO - 10.18255/1818-1015-2026-1-48-61

M3 - статья

VL - 33

SP - 48

EP - 61

JO - Моделирование и анализ информационных систем

JF - Моделирование и анализ информационных систем

SN - 1818-1015

IS - 1

M1 - 3

ER -

ID: 82774475