Об утверждении Правил формирования и ведения Национального корпуса казахского языка
ҚАЗҚазақ тілінің Ұлттық корпусын қалыптастыру және жүргізу қағидаларын бекіту туралы
ЭКБ деректері 31.07.2026 жаңартылды
Деректемелер және дереккөз
- Толық атауы
- Об утверждении Правил формирования и ведения Национального корпуса казахского языка
- Атауы (қаз.)
- Қазақ тілінің Ұлттық корпусын қалыптастыру және жүргізу қағидаларын бекіту туралы
- Акт түрі
- Бұйрық
- Заңдық күші
- Қолданыста
- Тізілімдегі мәртебе коды
- new
- Нөмірі
- 227
- Қабылданған күні
- 30.04.2025
- Көрсетілген редакция
- 30.04.2025 · қолданыстағы 211738_765918.rus
- Базадағы редакциялар
- 1
- Соңғы өзгеріс
- 30.04.2025
- Мәтін тілі
- орысша
- НҚА мемлекеттік тіркеу нөмірі
- G25HN000227
- ЭКБ идентификаторы
- 211738
- Редакция идентификаторы
- 211738_765918
- Бастапқы дереккөз
- ЭКБ zan.gov.kz (API)
- Деректер жаңартылды
- 31.07.2026 04:42
0 Об утверждении Правил формирования и ведения
Национального корпуса казахского языка
В соответствии с пунктом 5 статьи 24-4 Закона Республики Казахстан «О культуре» и подпунктом 161-1) пункта 15 Положения о Министерстве науки и высшего образования Республики Казахстан, утвержденного постановлением Правительства Республики Казахстан от 19 августа 2022 года № 580 «О некоторых вопросах Министерства науки и высшего образования Республики Казахстан», ПРИКАЗЫВАЮ:
1 1. Утвердить прилагаемые Правила формирования и ведения Национального корпуса казахского языка.
2 2. Комитету языковой политики Министерства науки и высшего образования Республики Казахстан в установленном законодательством порядке Республики Казахстан обеспечить:
1 1) государственную регистрацию настоящего приказа в Министерстве юстиции Республики Казахстан;
2 2) размещение настоящего приказа на интернет-ресурсе Министерства науки и высшего образования Республики Казахстан.
3 3. Контроль за исполнением настоящего приказа возложить на курирующего вице-министра науки и высшего образования Республики Казахстан.
4 4. Настоящий приказ вводится в действие после дня его первого официального опубликования.
0 Правила формирования и ведения Национального корпуса казахского языка
Утверждены приказом
Министра науки и
высшего образования
Республики Казахстан
от 30 апреля 2025 года
№ 227
Правила формирования и ведения
Национального корпуса казахского языка
1 Глава 1. Общие положения
1
1. Настоящие Правила формирования и ведения Национального корпуса казахского языка (далее – Правила) разработаны в соответствии с пунктом 5 статьи 24-4 Закона Республики Казахстан «О культуре» и подпунктом 161-1) пункта 15 Положения о Министерстве науки и высшего образования Республики Казахстан, утвержденного постановлением Правительства Республики Казахстан от 19 августа 2022 года № 580 «О некоторых вопросах Министерства науки и высшего образования Республики Казахстан», и устанавливают общие требования и процедуры для создания, пополнения, обработки, хранения и использования Национального корпуса казахского языка (далее – Национальный корпус), который служит основой для научных, образовательных и практических исследований в области казахского языка и лингвистики.
2 2. Администратор Национального корпуса – Министерство науки и высшего образования Республики Казахстан.
3 3. Работу по координации Национального корпуса осуществляет Республиканское государственное предприятие на праве хозяйственного ведения «Институт языкознания имени Ахмета Байтурсынулы» Комитета науки Министерства науки и высшего образования Республики Казахстан (далее – Институт).
4 4. В настоящих Правилах используются следующие понятия:
1
1) аннотация – описание данных в корпусе, включающее информацию о источнике заданного элемента поиска, такую как автор текста, его тема, жанр, контекст, структура и содержание, а также фонетические, морфологические, просодические, лексические, семантические, синтаксические и другие лингвистические характеристики;
2 2) разметка – метод кодирования и систематизации лингвистической и структурной информации в текстах корпуса, обеспечивающий их анализ и обработку;
3 3) научные стандарты качества – совокупность критериев, которым соответствуют тексты и их аннотации в корпусе для обеспечения точности, достоверности и пригодности для лингвистических исследований;
4 4) унифицированные форматы данных – стандартные структуры и правила, которые делают данные совместимыми и удобными для обработки и объединения, устанавливая требования к кодировке, структуре и разметке, что упрощает обмен и анализ данных, снижая риск ошибок и потребность в доработках;
5 5) жанр – категория текста, определяющая его тип, назначение и устоявшуюся форму обладающую определененными стилистическими чертами, что помогает классифицировать материалы для анализа и исследования;
6 6) частотность – числовой показатель, отражающий, как часто языковые элементы встречаются в определенном тексте или корпусе;
7 7) интерфейс – программно-аппаратная система корпуса, позволяющая пользователю искать, извлекать, просматривать результаты, фильтровать и анализировать данные;
8 8) система кодирования и классификации – упорядоченная структура, позволяющая присваивать текстам уникальные коды и классифицировать их по ключевым характеристикам, обеспечивая удобство поиска, хранения и анализа данных в корпусе;
9 9) корпус – часть Национального корпуса, состоящая из отдельных подкорпусов и сформированная по определённым критериям для проведения целенаправленного лингвистического или статистического анализа;
10 10) база данных корпуса – электронные версии письменных и устных текстов на естественном языке, которые предварительно обработаны и размечены для включения в корпус;
11 11) национальный корпус казахского языка – информационно-справочная система, содержащая тексты во всех стилях и жанрах казахского языка, оснащенная системой поиска и другими средствами работы с текстом;
12 12) тексты – языковые единицы, которые составляют основу корпуса;
13 13) метаразметка – краткое источниковедческое описание текста, включенного в корпус и его содержания, которое предоставляет ключевую информацию о его тематике, авторе, жанре, цели, стиле и других характеристиках;
14 14) морфологическая разметка – процесс автоматического или ручного снабжения текстов в корпусе морфологическими характеристиками и определения их грамматических признаков;
15 15) синтаксическая разметка – процесс снабжения и описания синтаксической структуры предложений в тексте, включая определение связей между словами и их грамматических ролей, для изучения грамматической структуры языка и его правил;
16 16) семантическая разметка – процесс аннотирования смысла, значений, контекстуальных оттенков слов, выражений и предложений в тексте, а также их взаимосвязей, с целью создания инструмента для естественно-языковой обработки, корпусной лингвистики, машинного обучения и цифровых технологий;
17 17) словоупотребление – совокупность характеристик использования слова в текстах, входящих в корпус;
18 18) стиль – способ выражения в языке, который определяется такими характеристиками, как тон, словарный запас, грамматическая структура и другие особенности, отражающие цель и особенности текста.
2 Глава 2. Формирование Национального корпуса
5 5. Все работы, связанные с формированием, ведением и использованием Национального корпуса, проводятся в рамках единого национального подхода с обеспечением высокого уровня качества, безопасности и доступности данных.
6 6. Национальный корпус формируется в соответствии с настоящими Правилами за счет корпусов и подкорпусов.
7 7. Формирование Национального корпуса начинается с тщательного сбора и отбора текстов, представляющих все аспекты его функционирования – от письменных источников до устных материалов, которые отражают особенности языка, используемый в различных сферах и временных срезах.
8 8. Все материалы Национального корпуса соответствуют научным стандартам качества, имеют метаданные и источниковедческую информацию, проходят проверку на грамматические и орфографические ошибки, а также редактируются и упорядочиваются в соответствии с единой системой кодирования и классификации.
9 9. Национальный корпус отражает разнообразие языковых практик, включая различные жанры, типы текстов, диалекты и стили, а также учитывает региональные и исторические особенности.
10 10. Все собранные тексты систематизируются и аннотируются по жанру, стилю, времени, источнику, по лексическим и грамматическим уровням.
11
11. После сбора и аннотирования текстов с учётом энциклопедического и источниковедческого анализа применяются методики лингвистической обработки и анализа данных, что позволяет создавать целевые эмпирические языковые базы для научных исследований и модели языка, используемые для разработки языковых технологий и лексикографических проектов.