ВЕРИФИКАЦИЯ КОЛИЧЕСТВЕННЫХ РЕЗУЛЬТАТОВ МЕРОПРИЯТИЙ НАЦИОНАЛЬНЫХ ПРОЕКТОВ НА ОСНОВЕ БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ
Аннотация и ключевые слова
Аннотация:
Рассмотрена задача автоматизированной проверки исполнения мероприятий национальных проектов по их количественным результатам. Источником информации служит пакет отчётных документов, поступающий от исполнителя в контролирующий орган. Состав пакета заранее не известен, документы разнородны по типу и информационной природе. Простое суммирование числовых значений из таких документов даёт завышенный результат, поскольку одна транзакция, как правило, отражена в нескольких документах сразу. В статье предложена архитектура количественной проверки, использующая три последовательных пути: суммирование по серии однотипных первичных документов, сравнение с максимумом значений из агрегатных документов, дедуплицированная сумма с привлечением языковой модели. Пути расположены по убыванию степени доверия к результату. Архитектура реализована в составе программного пайплайна и апробирована на реальных пакетах. Научная новизна состоит в иерархической организации путей, при которой вероятностный метод применяется только тогда, когда другие способы не сработали.

Ключевые слова:
автоматизированный аудит, национальные проекты, большие языковые модели, верификация количественных показателей, дедупликация транзакций, on-premise large language model
Список литературы

1. LayoutLM: Pre-training of Text and Layout for Document Image Understanding / Y. Xu [et al.] // Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. 2020. P. 1192–1200.

2. OCR-Free Document Understanding Transformer / G. Kim [et al.] // Proceedings of the European Conference on Computer Vision. 2022. P. 498–517.

3. Language Models are Few-Shot Learners / T.B. Brown [et al.] // Advances in Neural Information Processing Systems. 2020. Vol. 33. P. 1877–1901.

4. Llama 2: Open Foundation and Fine-Tuned Chat Models / H. Touvron [et al.] // arXiv preprint arXiv:2307.09288. 2023.

5. Дудихин В.В., Кондрашов П.Е. Методология использования больших языковых моделей для решения задач государственного и муниципального управления по интеллектуальному реферированию и автоматическому формированию текстового контента // Государственное управление. Электронный вестник. 2024. № 105. С. 5–18.

6. Натарова Е.В. Цифровая трансформация в системе государственного аудита // Научный вестник: финансы, банки, инвестиции. 2024. № 4 (69). С. 76–88.

7. Christen P. Data Matching: Concepts and Techniques for Record Linkage, Entity Resolution and Duplicate Detection. Heidelberg: Springer, 2012. 270 p. DOI:https://doi.org/10.1007/978-3-642-31164-2

8. Köpcke H., Rahm E. Frameworks for entity matching: A comparison // Data & Knowledge Engineering. 2010. Vol. 69. № 2. P. 197–210. DOI:https://doi.org/10.1016/j.datak.2009.10.003

9. Лиманова Н.И., Селезнев И.А. Анализ эффективности клиент-серверной архитектуры // Бюллетень науки и практики. 2022. Т. 8. № 7. С. 392–396. DOI:https://doi.org/10.33619/2414-2948/80/37

10. vLLM. Official documentation. URL: https://docs.vllm.ai/en/latest/ (дата обращения: 21.05.2026).

11. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models / J. Wei [et al.] // Advances in Neural Information Processing Systems. 2022. Vol. 35. P. 24824–24837.

12. Self-Consistency Improves Chain of Thought Reasoning in Language Models / X. Wang [et al.] // Proceedings of the International Conference on Learning Representations. 2023.

13. Efficient Memory Management for Large Language Model Serving with PagedAttention / W. Kwon [et al.] // Proceedings of the 29th Symposium on Operating Systems Principles. 2023. P. 611–626. DOI:https://doi.org/10.1145/3600006.3613165

14. Задорнов А.А., Никонов С.С., Федотов М.В. Влияние единого информационного пространства на автоматизацию процесса получения и обработки информации // Вестник экономических и социологических исследований. 2024. № 1. С. 21–27.

Войти или Создать
* Забыли пароль?