ЛИНГВИСТИЧЕСКИЕ МЕХАНИЗМЫ ПРОТИВОДЕЙСТВИЯ ФЕЙКОВОМУ КОНТЕНТУ В ЦИФРОВОЙ МЕДИАСРЕДЕ

Иван Дмитриевич Диреев *
Южно-Уральский государственный университет (национальный исследовательский университет) (Челябинск, Российская Федерация).
Email: tifey@udm.ru ORCID 0009-0008-3669-7774

* — корреспондирующий автор

РУБРИКА: РЕЧЕВЫЕ МОДЕЛИ И СТРАТЕГИИ МЕДИАДИСКУРСА

DOI: 10.47475/2070-0695-2026-59-1-120-129

№ 1 (59), с. 120–129

Поступила: 10.03.2025 | Исправлена: 02.10.2025 | Принята: 11.11.2025 | Опубликована: 13.04.2026

© 2026 Иван Диреев. CC BY-NC-ND 4.0

Аннотация

Целью исследования является разработка и эмпирическая верификация лингвистической модели выявления фейкового контента в цифровом медиапространстве. В работе предложен комплексный подход, интегрирующий методы корпусной лингвистики, критического дискурс-анализа и психолингвистики. Методологическая рамка включает корпусный анализ текстовых материалов из социальных сетей и региональных СМИ, психолингвистический эксперимент для оценки восприятия маркеров манипуляции, а также сравнительное тестирование эффективности модели против современных алгоритмов искусственного интеллекта. Результаты исследования выявили устойчивую триаду лингвистических индикаторов фейкового дискурса: аномально высокую эмоциональную нагрузку, системные нарушения дискурсивной связности и противоречия в модальных конструкциях. Разработанная модель продемонстрировала значительное превосходство над нейросетевыми аналогами в точности идентификации недостоверного контента. Практическая значимость подтверждена успешной имплементацией модели в образовательные программы медиаграмотности, где зафиксировано существенное снижение доверия к дезинформации, а также во встроенные алгоритмы редакционных систем, обеспечивающие сокращение времени верификации новостей. Основной вывод работы заключается в том, что лингвистические методы не только обеспечивают высокоточную детекцию фейков, но и формируют когнитивные барьеры против манипулятивных стратегий, создавая основу для цифровой устойчивости в условиях экспоненциального роста синтетического контента. Результаты исследования вносят вклад в развитие медиалингвистики, цифровой журналистики и образовательных практик.

Ключевые слова

лингвистические маркеры, фейковый контент, индекс эмотивности, когезия, модальный дисбаланс, медиаобразование, генеративный ИИ, корпусный анализ, критическое мышление, цифровая устойчивость

LINGUISTIC MECHANISMS FOR COUNTERING FAKE CONTENT IN DIGITAL MEDIA

Ivan D. Direev *
South Ural State University (National Research University) (Chelyabinsk, Russian Federation).
Email: tifey@udm.ru ORCID 0009-0008-3669-7774

* — corresponding author

SECTION: SPEECH MODELS AND MEDIA DISCOURSE STRATEGIES

DOI: 10.47475/2070-0695-2026-59-1-120-129

No. 1 (59), pp. 120–129

Received: 10.03.2025 | Revised: 02.10.2025 | Accepted: 11.11.2025 | Published: 13.04.2026

© 2026 Direev, I.. CC BY-NC-ND 4.0

Abstract

This study aims to develop and empirically verify a linguistic model for detecting fake content in digital media environments. The research proposes a comprehensive approach integrating corpus linguistics, critical discourse analysis, and psycholinguistic methods. The methodological framework encompasses corpus analysis of textual materials from social networks and regional media, a psycholinguistic experiment assessing the perception of manipulative markers, and comparative testing of the model’s effectiveness against state-of-the-art artificial intelligence algorithms. The results reveal a consistent triad of linguistic indicators of fake discourse: abnormally high emotional load, systemic coherence violations, and contradictions in modal constructions. The developed model demonstrated significant superiority over neural network counterparts in identifying unreliable content. Practical significance is confirmed through successful implementation in media literacy education programs, which recorded substantially reduced trust in misinformation, and in editorial system algorithms that decreased news verification time. The study concludes that linguistic methods not only ensure high-precision fake detection but also establish cognitive barriers against manipulative strategies, creating a foundation for digital resilience amid exponential growth of synthetic content. The findings contribute to media linguistics, digital journalism, and educational practices, offering tools to counteract information threats in the generative AI era.

Keywords

linguistic markers, fake content, emotiveness index, cohesion, modal imbalance, media education, generative AI, corpus analysis, critical thinking, digital resilience

1. Введение

Цифровая медиасреда столкнулась с беспрецедентным вызовом: экспоненциальным ростом синтетического контента и алгоритмически генерируемых фейков, ведущих к системной эрозии информационной безопасности. Эмпирические исследования фиксируют, что свыше 67 % дезинформационных материалов используют гибридные манипулятивные стратегии, сочетающие лингвистические аномалии и психологическое воздействие (Vosoughi, Roy, Aral 2018; Grinberg, Joseph, Friedland, Swire-Thompson, Lazer 2019). При этом традиционные методы детекции, основанные на метаданных или бинарной классификации, демонстрируют ограниченную эффективность (Accuracy < 70 %) против современных генеративных моделей (GPT-4, RuGPT-3.5), что актуализирует потребность в лингвоцентричных решениях. Целью данного исследования стала разработка и эмпирическая валидация комплексной лингвистической модели выявления фейкового контента, интегрирующей количественный анализ текстовых аномалий с адаптацией к культурным и технологическим вызовам. Под лингвистической моделью выявления фейкового контента в данной работе понимается формализованная система диагностических правил и количественных метрик, описывающих лексико-стилистические, дискурсивные и прагматические аномалии текста. Модель реализована как алгоритм интегральной оценки, принимающий на вход текст и возвращающий бинарную классификацию с вероятностной оценкой, а также значения ключевых индикаторов (индекс эмотивности, показатель когезии, модальный дисбаланс).

Научная новизна работы заключается в первой формализации триады диагностических маркеров для русскоязычного контента: индекса эмотивности (ИЭ) > 12 %, показателя когезии < 0.4 по шкале Coh-Metrix и модального диссонанса (распространенность 63 % в фейках), а также в создании алгоритма динамической калибровки порогов для AI-генерируемых текстов. Методология исследования объединила корпусный анализ 2 000 текстов из Telegram, «ВКонтакте» и региональных СМИ (2024–2025 гг.), контролируемый эксперимент с участием 480 студентов и слепое тестирование эффективности против GPT-4. Практическая значимость подтверждена снижением доверия к фейкам на 41 % в образовательных программах и сокращением времени верификации контента на 40 %. При этом фокус настоящего исследования – текстовое ядро мультимодальных сообщений; анализ аудиовизуальных признаков рассматривается как пилотное направление и представлен ограниченным набором акустических показателей.

Работа вносит вклад в развитие цифровой лингвистики, предлагая инструменты для противодействия информационным угрозам в эпоху нейросетевых технологий.

2. Лингвистические аспекты фейкового дискурса: обзор и контекст

Фейковый дискурс, понимаемый как целенаправленно сконструированная коммуникация, направленная на искажение реальности и манипуляцию восприятием аудитории (Wardle, Derakhshan 2017), представляет собой сложный объект лингвистического анализа. Его структурные и прагматические особенности формируются под влиянием когнитивных уязвимостей реципиентов, технологических возможностей генерации контента и специфики социополитического контекста распространения (Pennycook, Rand 2019; Chesney, Citron 2021). Исследования последних лет выделяют устойчивые лингвистические паттерны, характерные для недостоверного контента, которые можно систематизировать по уровням анализа.

На лексико-стилистическом уровне ключевым маркером фейкового дискурса выступает гиперболизация. Эмпирические исследования обширных корпусов фейковых новостей, таких как анализ 10 000 сообщений (Grinberg, Joseph, Friedland, Swire-Thompson, Lazer 2019), демонстрируют высокую частотность метафор катастрофизма (например, «вирусный апокалипсис», «вакцинный геноцид») в темах повышенной социальной значимости, таких как пандемия COVID-19 или климатические изменения (Lazer, Baum, Benkler et. al. 2018). Интенсификация эмоционального воздействия достигается и за счет систематического использования адвербиальных модификаторов («катастрофически», «абсолютно», «невероятно»), что существенно повышает общую эмоциональную нагрузку текста (Tandoc, Lim, Ling 2018).

Синтаксический и дискурсивный уровни характеризуются нарушениями когезии и модальным дисбалансом. Анализ синтаксических структур в рамках системно-функциональной грамматики (Halliday, Matthiessen 2014) выявляет частые случаи контрапунктных тематических переходов, когда обсуждение, например, температурных аномалий резко смещается к конспирологическим теориям без адекватных логических связок или обоснований (Bovet, Makse 2019). Важным диагностическим признаком является также модальный диссонанс, проявляющийся в сочетании эпистемической уверенности («несомненно», «доказано») с деонтической неопределенностью или предположительностью («следует предположить», «возможно») в рамках одного высказывания или смежных предложений, что создает эффект псевдообоснованности (Fairclough, 2013).

Прагматическая составляющая фейкового дискурса реализуется преимущественно через имитацию эпистемического авторитета и эксплуатацию эмоциональных архетипов. Тактики псевдонаучного дискурса включают вставку ложных или искаженных ссылок на авторитетные источники (например, журналы «The Lancet» или «Nature» в контексте дискуссий о технологиях 5G), а также использование квази-экспертной лексики («квантовая биология», «нанотоксины») вне корректного научного контекста, что статистически значимо повышает доверие аудитории к сообщению (Allcott, Gentzkow 2017; Pennycook, Rand 2019). Эмоциональное манипулирование часто строится на эксплуатации базовых архетипов страха, гнева или надежды, актуализируемых через специфический подбор лексики и риторических конструкций.

Современный фейковый контент все чаще приобретает мультимодальный характер, интегрируя вербальные, визуальные и аудиальные компоненты в единый семиотический комплекс (Kress, van Leeuwen 2006). Исследования распространения deepfake-видео (Vosoughi, Roy, Aral 2018) указывают на наличие паралингвистических диссонансов (например, неконгруэнтность мимики говорящего и семантики произносимого текста) как на важный индикатор искусственности контента, хотя его автоматическая детекция остается технологически сложной задачей. Культурный контекст также играет значимую роль в формировании фейкового дискурса, определяя выбор специфических метафор, нарративных стратегий и визуальных кодов, что требует учета лингвокультурных особенностей при анализе (Piller 2011). Однако, несмотря на растущую сложность форм фейкового контента, его текстовое ядро сохраняет ряд диагностируемых лингвистических аномалий, что делает их анализ перспективным направлением для разработки методов детекции

Настоящее исследование сосредоточено на верификации и уточнении ключевых текстовых маркеров фейкового дискурса, выявленных в работах указанных авторов, на актуальном материале русскоязычного цифрового медиапространства. Особое внимание уделяется лексико-стилистическим аномалиям (гиперболизация, клишированность) и нарушениям дискурсивной связности (когезия, модальность), которые могут служить основой для построения эффективной модели лингвистического аудита. Мультимодальные аспекты рассматриваются в ограниченном объёме; основным объектом анализа выступает вербальный компонент, тогда как визуальные индикаторы искусственности (несоответствие артикуляции и мимики, артефакты синтеза) отнесены к перспективам дальнейшей работы.

3. Методология исследования

Настоящее исследование направлено на разработку и апробацию лингвистической модели выявления фейкового контента в цифровой медиасреде, с фокусом на текстовые аномалии. Для достижения поставленной цели был реализован комплексный методологический подход, интегрирующий методы корпусной лингвистики, психолингвистический эксперимент и сравнительный анализ с современными алгоритмами искусственного интеллекта. Методология базируется на принципах, изложенных в работах по критическому дискурс-анализу (Fairclough 2013; Wodak, Meyer 2016, Wodak 2021), исследованию распространения ложной информации (Vosoughi, Roy, Aral 2018; Grinberg, Joseph, Friedland, Swire-Thompson, Lazer 2019) и анализу медиадискурса (Kress, van Leeuwen 2006).

Корпус данных. Основу исследования составил специально сформированный корпус цифрового медиаконтента на русском языке, охватывающий период с 2024 по 2025 год. Общий объем корпуса – 2 000 единиц, включающих текстовые новостные сообщения и посты социальных сетей (1 500 единиц), а также транскрипты аудиодорожек видео-новостей и видеоблогов (500 единиц). Для дополнительной валидации результатов на заключительном этапе исследования была сформирована расширенная выборка из 2 140 текстов, включающая материалы 2024–2025 гг. Отбор материала проводился с платформ, характеризующихся высокой виральностью контента и потенциальной уязвимостью к распространению дезинформации, преимущественно Telegram и «ВКонтакте» (Vosoughi, Roy, Aral 2018). Магистральным критерием включения служила виральность: в базу попадали материалы, преодолевшие порог ≥ 1000 репостов/упоминаний за первые 72 часа. Тематические домены (политика, здравоохранение, социальные конфликты, наука и технологии) использовались как стратификационный фильтр для обеспечения репрезентативности. При конфликте критериев приоритет отдавался виральности; в пределах доменов тексты отбирались случайной выборкой с балансом «фейк/не‑фейк». Для обеспечения репрезентативности и баланса, корпус был структурирован таким образом, что 50% единиц составили верифицированные фейки, а 50 % – достоверные материалы. Аннотация корпуса включала пометки о наличии ключевых лингвистических маркеров, выявленных в теоретическом обзоре (раздел 2), и результаты фактчекинга. Сбор данных осуществлялся полуавтоматически: с использованием Python‑парсеров (Telegram API, VK API) и последующей ручной верификацией. Автоматизированный сбор фиксировал метаданные (время публикации, канал/сообщество, охват/репосты/упоминания), после чего выполнялись дедупликация, нормализация и анонимизация источников; статус «фейк/достоверно» задавался по итогам фактчекинга либо независимой экспертной оценки (3 лингвиста).

Методы лингвистического анализа. Для выявления и количественной оценки текстовых аномалий, характерных для фейкового дискурса, был применен набор лингвистических инструментов и метрик. Центральное место занял анализ лексико-стилистических особенностей с использованием программного пакета LIWC-22 (Linguistic Inquiry and Word Count) (Pennebaker, Boyd, Jordan, Blackburn 2015). Основное внимание уделялось расчету Индекса Эмотивности (ИЭ), определяемого как процентное отношение слов с выраженной негативной эмоциональной коннотацией (категории negemo, anx, anger в LIWC-22) к общему количеству слов в тексте (Boyd, Ashokkumar, Seraj, Pennebaker 2022). Этот метод, валидированный в многочисленных исследованиях медиадискурса (Tandoc, Lim, Ling 2018; Bovet, Makse 2019), позволяет объективно измерить уровень эмоциональной нагруженности. Дополнительно проводился частотный анализ клишированных метафор катастрофизма и конфликта (например, «война», «апокалипсис», «катастрофа», «жертва», «агрессор») с помощью конкордансера AntConc (https://www.laurenceanthony.net/software), что позволило выявить специфические лексические паттерны. Частотный анализ клишированных метафор выполнялся в рамках количественного контент‑анализа с заранее определённой кодировочной схемой и операционализированными категориями («катастрофизм», «конфликт», «милитаризм»), что обеспечило сопоставимость результатов между доменами. Для оценки дискурсивной связности (когезии) применялся инструмент Coh-Metrix (Graesser, McNamara, Louwerse, Cai 2004), который рассчитывает комплексные показатели связности текста на основе плотности референциальных связей, коннекторов и лексического разнообразия. Когезия операционализировалась как интегральный показатель, объединяющий три группы индексов: референциальную связность, плотность дискурсивных коннекторов и лексическую близость соседних предложений. Референциальная связность оценивалась по доле общих лемм содержательных слов между соседними предложениями с учётом совпадений именованных сущностей и анафорических местоимений. Плотность коннекторов рассчитывалась как количество причинно‑следственных, уступительных, временных и перечислительных связок на каждые сто слов из предварительно составленного словаря с нормировкой на длину предложений. Лексическая близость определялась по сходству векторных представлений соседних предложений, полученных одной и той же процедурой векторизации для обучающей и тестовой выборок. Каждый индекс нормировался на обучающей подвыборке до единого интервала от нуля до единицы с отсечением крайних значений на уровне девяносто пятого перцентиля. Интегральный показатель вычислялся как среднее трёх нормированных индексов; порог для фиксации нарушенной когезии подбирался по кривой «чувствительность-специфичность» на валидационной подвыборке. В итоговой конфигурации текст относился к группе с нарушенной когезией при значении интегрального показателя ниже 0,40; для тематических доменов применялись корректировки порога, установленные по результатам перекрёстной проверки. Особое внимание уделялось выявлению модального дисбаланса - противоречий между эпистемической (уверенность/знание) и деонтической (долженствование/необходимость) модальностью в рамках одного дискурсивного фрагмента, что анализировалось методом ручной разметки с последующей верификацией (Fairclough 2013). Межразметочная согласованность для признака «модальный дисбаланс» оценивалась по коэффициенту каппа Коэна на рандомизированной подвыборке 600 предложений. Итоговое значение составило 0,78 с девяносто пятипроцентным доверительным интервалом 0,74–0,82, что соответствует уровню от существенного до почти идеального согласия. Для подтипов модальности согласованность составила: эпистемическая уверенность – 0,81; деонтическое долженствование – 0,73; смешанные конфликты – 0,69. Разметка выполнялась двумя экспертами «вслепую» по единому кодировочному справочнику; расхождения разрешались по процедуре третей аннотации и согласительного обсуждения с обязательной фиксацией правила и повторной перекодировкой спорных фрагментов. Контроль дрейфа критериев проводился пакетно после каждых 100 единиц разметки; минимально допустимое значение коэффициента для продолжения серии устанавливалось на уровне 0,70. Для анализа паралингвистических особенностей в транскрибированных видеоматериалах (тон, паузы, акцентуация) использовались возможности спектрального анализа в Adobe Audition и ручного аннотирования по заданным параметрам. Паралингвистический анализ носил пилотный характер и не входил в финальный классификатор; рассчитывались количественные признаки, отражающие темпо‑ритмику и голосовые параметры речи, признанные информативными в компьютерной паралингвистике. Оценивались скорость речи в слогах в секунду и артикуляционный темп с учётом микропауз, что позволяет отделить собственно темп артикуляции от паузации как самостоятельного канала влияния на восприятие. Доля времени пауз вычислялась относительно суммарной длительности речевого фрагмента при нижнем пороге детекции пауз 200 миллисекунд и отдельном учёте микропауз от 50 до 199 миллисекунд, что обеспечивает сопоставимость с распространёнными практиками супрасегментного анализа. Для основного тона регистрировались средний уровень и разброс, а также нормализованный диапазон высоты относительно медианного значения говорящего, что учитывает индивидуальные различия и снижает влияние тембра. Интенсивность характеризовалась вариативностью амплитуды по всему фрагменту, поскольку колебания громкости связаны с экспрессивностью и могут выступать маркерами эмоциональной нагруженности. Микропросодические показатели джиттер и шиммер вычислялись на коротком скользящем окне порядка 30 миллисекунд с шагом около 10 миллисекунд, что соответствует типовым настройкам для анализа стабильности периодичности и колебаний амплитуды. Сегментация речевых участков выполнялась автоматическим детектором голосовой активности с последующей ручной верификацией на части корпуса; участки с низким отношением сигнал-шум (SNR, дБ) исключались для минимизации артефактов измерений. В рамках ограничений данной работы визуальные признаки синтетического видео, включая артикуляционную рассинхронизацию и артефакты генерации, не анализировались; их интеграция запланирована в будущей версии модели с мультимодальным объединением аудио‑ и видеопоказателей.

Психолингвистический эксперимент. Для оценки влияния выявленных лингвистических маркеров на восприятие и доверие аудитории был проведен эксперимент с участием 200 респондентов (студенты гуманитарных и технических специальностей ВУЗов г. Челябинска, возраст 18–25 лет, сбалансированное гендерное распределение). Респондентам последовательно предъявлялись 50 текстовых единиц, отобранных из корпуса (25 фейков, 25 достоверных), в рандомизированном порядке. После прочтения каждого текста участники оценивали по 7-балльной шкале Ликерта: 1) уровень доверия к информации; 2) степень эмоционального воздействия; 3) субъективную оценку достоверности; 4) способность идентифицировать возможные манипулятивные приемы. Эксперимент также включал открытые вопросы о причинах доверия/недоверия к конкретным фрагментам текста. Процедура эксперимента была разработана с учетом методологии, применявшейся в исследованиях восприятия дезинформации (Pennycook, Rand 2019; Vosoughi, Roy, Aral 2018). Целью было установить корреляцию между объективно измеренными лингвистическими аномалиями (ИЭ, модальный дисбаланс, низкая когезия) и субъективными оценками аудитории.

Сравнительный анализ эффективности. Для оценки практической значимости разрабатываемой лингвистической модели был проведен сравнительный анализ ее эффективности с современными алгоритмами детекции фейков на основе искусственного интеллекта. В качестве эталона сравнения выступила модель GPT-4 (OpenAI). На тестовой выборке, сформированной случайным образом из общего корпуса (20 % от общего объема, n=400, с сохранением баланса фейк/не-фейк), проводилась параллельная верификация контента:

Лингвистическая модель: Применялся алгоритм, основанный на комбинации пороговых значений выявленных маркеров (например, ИЭ > 12 %, наличие ≥ 2 клишированных метафор катастрофизма на 100 слов, показатель когезии Coh-Metrix < 0.4, фиксация модального дисбаланса). Окончательная классификация (фейк/не-фейк) выносилась на основе интегральной оценки.

GPT-4: Модели задавался прямой запрос на верификацию представленного текста («Является ли следующий текст фейковой новостью? Ответь только 'да' или 'нет': [текст]»). Использовался стандартный API без дополнительной тонкой настройки. Эффективность обеих моделей оценивалась по стандартным метрикам бинарной классификации: точность (Accuracy), полнота (Recall), F1-мера (F1-score), а также площадь под ROC-кривой (AUC) (Gutierrez-Vasques, Bentz, Samardžić 2023). Статистическая значимость различий в эффективности определялась с использованием критерия хи-квадрат.

Сравнение с моделью искусственного интеллекта проводилось при фиксированных условиях. Дата инференса: 15–18.09.2025; версия интерфейса: gpt‑4‑0613. Параметры генерации: детерминированный режим (температура равна нулю, верхняя вероятность без ограничений, коэффициенты штрафов за повторения отключены), максимальная длина ответа – 256 токенов, число прогонов – один. Формулировка запроса: «Является ли следующий текст фейковой новостью? Ответь только «да» или «нет»». Язык подсказки соответствовал языку анализируемого текста; метаданные и ссылки удалялись. Тестовая выборка объёмом 400 документов была сбалансирована по классам и стратифицирована по тематическим доменам; пересечений с обучающими поднаборами не было. Для оценки использовались точность, полнота, точность предсказания позитивного класса, F1‑мера и площадь под ROC‑кривой; девяносто пятипроцентные доверительные интервалы рассчитывались бутстрэп‑процедурой на уровне документов, для долей – интервалом Уилсона. Различия между моделями проверялись критерием хи‑квадрат с поправкой на множественные сравнения. Для контроля устойчивости выполнена повторная прогонка на десятипроцентной подвыборке при нулевой и малой температуре; ранжирование классов не изменилось на статистически значимом уровне.

Этические соображения. Исследование проводилось с соблюдением этических норм. Участники психолингвистического эксперимента были проинформированы о его целях и дали информированное согласие. Персональные данные не собирались. Материалы корпуса, содержащие потенциально опасную или оскорбительную дезинформацию, использовались исключительно в исследовательских целях с соблюдением конфиденциальности источников их распространения.

Для обработки данных и реализации алгоритмов использовались Python-библиотеки (spaCy 3.7, scikit-learn 1.3) и адаптированные версии лингвистических инструментов, что позволило автоматизировать расчет комплексных показателей.

4. Результаты и обсуждение

Проведенное исследование позволило получить эмпирически верифицированные данные о лингвистических характеристиках фейкового дискурса в русскоязычном цифровом пространстве и эффективности предложенной модели детекции. Результаты корпусного анализа подтвердили наличие статистически значимых различий между верифицированными фейковыми и достоверными текстами по ключевым лингвистическим параметрам. Наиболее диагностически значимым маркером продемонстрировал себя индекс эмотивности (ИЭ): в выборке фейковых текстов его среднее значение составило 15,3 % (SD = 4.2), что существенно превышает показатель в достоверных материалах (5,1 %, SD = 2,8; t (1998) = 38,7, p < 0.001). Данный результат согласуется с выводами предыдущих исследований о гиперболизации как ключевой стратегии манипулятивного дискурса (Tandoc, Lim, Ling 2018; Grinberg, Joseph, Friedland, Swire-Thompson, Lazer 2019), однако выявленный порог (> 12 %) оказался выше, чем в англоязычных корпусах, что может отражать культурно-специфическую интенсивность эмоционального воздействия в русскоязычной медиасреде.

Систематический частотный анализ клишированных метафор выявил устойчивые паттерны. Метафоры катастрофизма («крах», «апокалипсис», «война») встречались в 78 % фейковых текстов (против 18 % в достоверных; χ²(1) = 412,5, p < 0.001) со средней плотностью 8,7 случаев на 1 000 слов. При этом наблюдалась тематическая кластеризация: в политических фейках доминировала милитаристская лексика («информационный фронт», «санкционный удар» – 22,3 / 1000 слов), в материалах о здоровье – медицинско-катастрофическая («генетическая бомба», «вакцинный геноцид» – 15,1 / 1000 слов). Этот паттерн коррелирует с данными исследований о эксплуатации архетипических страхов (Pennycook, Rand 2019), но демонстрирует специфическую лексическую реализацию в русскоязычном контенте.

Анализ дискурсивной связности с использованием Coh-Metrix выявил значимое снижение показателей когезии в фейковых текстах (mean = 0,31, SD = 0,11) по сравнению с достоверными (mean = 0.49, SD = 0,09; t (1998) = 25,4, p < 0,001). Особенно выраженными были нарушения на уровне локальной связности (референциальная и причинно-следственная), что проявлялось в частых логических разрывах и немотивированных тематических сдвигах. Модальный дисбаланс (противоречия между эпистемической и деонтической модальностью) был зафиксирован в 63 % фейков (против 9 % в контрольной группе; χ²(1) = 351,2, p < 0.001), подтверждая его роль как важного индикатора искусственной аргументации, что согласуется с положениями критического дискурс-анализа (Fairclough 2013).

Результаты психолингвистического эксперимента (N = 200) показали значимое влияние выявленных маркеров на восприятие аудитории. Тексты с ИЭ > 15 % и модальным дисбалансом получали на 37 % более высокие оценки доверия (по 7-балльной шкале) по сравнению с текстами без этих маркеров при сопоставимой фактической сложности (F (1,198) = 42,3, p < 0.001). При этом лишь 29 % респондентов смогли верно идентифицировать модальный дисбаланс как признак манипуляции в открытых вопросах, что свидетельствует о низкой осознанности этого лингвистического механизма. Анализ обратной связи выявил парадокс: несмотря на высокое доверие к эмоционально насыщенным текстам, 65 % респондентов отмечали их «навязчивость» или «избыточную драматизацию», однако это не снижало общего уровня доверия, что подтверждает гипотезу о когнитивном диссонансе при восприятии фейков (Pennycook, Rand 2019).

Сравнительный анализ эффективности разработанной лингвистической модели с алгоритмом GPT-4 на тестовой выборке (n = 400) продемонстрировал ее существенное преимущество. Интегральная модель, основанная на комбинации пороговых значений (ИЭ > 12 %, Coh < 0,4, наличие модального дисбаланса), достигла точности (Accuracy) 89,5 % и F1-score 92,3 %. GPT-4 показал значительно более низкие результаты – Accuracy 64,8 % и F1-score 67,2 % (χ²(1) = 78,4, p < 0,001). Качественный анализ ошибок GPT-4 выявил системную проблему: модель часто классифицировала сатирические или полемические тексты с высокой эмотивностью как фейки (ложноположительные срабатывания – 28 %), а хорошо структурированные фейки с умеренной эмоциональной нагрузкой – как достоверные (ложноотрицательные – 39 %). Это свидетельствует о недостаточной чувствительности ИИ-алгоритмов к нюансам лингвистической аномальности в сравнении с комплексной лингвистической моделью (Gutierrez-Vasques, Bentz, Samardžić 2023).

Обсуждение полученных результатов позволяет констатировать, что предложенная триада маркеров – эмоциональная гиперболизация (ИЭ > 12 %), нарушения дискурсивной связности (Coh < 0,4) и модальный дисбаланс – образует надежную диагностическую основу для выявления текстовых фейков в русскоязычном сегменте. Выявленная культурная специфика (интенсивность метафор, порог эмотивности) подчеркивает необходимость адаптации лингвистических моделей к региональным особенностям, что соответствует выводам исследований культурной вариативности дискурса (Piller 2011). Ограничением исследования является фокус преимущественно на текстовые форматы, что требует дальнейшего изучения взаимодействия вербальных маркеров с мультимодальным контекстом в духе работ Kress и van Leeuwen (2006).

5. Лингвистическая модель детекции фейкового контента: эмпирические основания и архитектура

Эмпирические результаты, полученные в ходе комплексного анализа корпуса и психолингвистического эксперимента, послужили фундаментом для разработки трехуровневой лингвистической модели выявления фейкового контента. Данная модель интегрирует микро-, макро- и прагматический уровни анализа в рамках единой диагностической системы, что обеспечивает верификацию текстовых аномалий с учетом их коммуникативного контекста. Теоретической основой модели выступили принципы критического дискурс-анализа (Fairclough 2013), акцентирующего социальную обусловленность дискурса, и коммуникативно-речевого подхода, трактующего язык как инструмент конструирования реальности.

Микролингвистический уровень модели фокусируется на количественно верифицированных лексико-грамматических аномалиях. Ключевым диагностическим критерием является индекс эмотивности (ИЭ) > 12 %, рассчитываемый как доля слов с негативной коннотацией (категории negemo, anx в LIWC-22). Статистический анализ подтвердил, что превышение данного порога встречается в фейковых текстах в 2,4 раза чаще, чем в достоверных (t (1998) = 38,7, p < 0,001), причем в политических фейках средний ИЭ достигает 17,2 %. Вторым значимым маркером выступает плотность клишированных метафор катастрофизма ≥ 8,7 на 1 000 слов (например, «санкционный удар», «вакцинный геноцид»), при этом в подгруппе политических фейков частота милитаристской лексики («фронт», «атака», «оборона») достигает 22,3 / 1 000 слов, что в 4,3 раза превышает показатель достоверных материалов (χ²(1) = 412,5, p < 0,001).

Дискурсивный уровень модели направлен на выявление системных нарушений связности и аргументации. Эмпирически установлено, что показатель когезии < 0,4 по шкале Coh-Metrix (Graesser, McNamara, Louwerse, Cai 2004) служит надежным индикатором логических разрывов: среднее значение когезии в фейках (0,31, SD = 0,11) на 37 % ниже, чем в достоверных текстах (0,49, SD = 0,09; t (1998) = 25,4, p < 0,001). Важную роль играет и модальный дисбаланс, выявленный в 63 % фейков (против 9 % в контрольной группе; χ²(1) = 351,2, p < 0,001), где сочетание эпистемической уверенности («несомненно») и деонтической неопределенности («следует предположить») создает эффект псевдообоснованности.

Прагматический уровень модели анализирует контекстуальные манипуляции, включая эксплуатацию культурных архетипов. Корпусный анализ подтвердил доминирование милитаристского дискурса в 78 % русскоязычных фейков, что отражает историко-культурную специфику восприятия конфликтов (Piller 2011). Экспериментальные данные также выявили эффективность имитации эпистемического авторитета: вставка псевдонаучных терминов («квантовая биология», «нанотоксины») повышала доверие респондентов на 33 % по сравнению с нейтральными формулировками (F (1,198) = 28,1, p < 0,001).

Алгоритм верификации реализует четырехэтапную процедуру, оптимизированную по результатам тестирования. На этапе первичного скрининга автоматически рассчитывается ИЭ через LIWC-22, причем тексты с ИЭ ≤ 5 % классифицируются как достоверные без дальнейшего анализа. Корпусная верификация включает сопоставление метафор с базой клише (AntConc) и оценку когезии (Coh-Metrix). Для текстов с пограничными значениями (ИЭ = 10–12 %) активируется экспертная проверка модальности и прагматических стратегий. Финальная интегральная оценка присваивает весовые коэффициенты ключевым маркерам (ИЭ: 0,4; когезия: 0,3; модальность: 0,3), а порог классификации установлен на уровне 0,75 по шкале достоверности.

Научная новизна модели заключается в синтезе количественных и качественных методов, где инструменты корпусной лингвистики (LIWC-22, Coh-Metrix) дополнены дискурсивным анализом, что соответствует современным трендам цифровой гуманитаристики. Ее адаптация к культурному контексту (учет высокой частотности военных метафор в Рунете) снизила долю ложных срабатываний на 22 % по сравнению с англоцентричными аналогами. Валидация на выборке из 400 единиц контента подтвердила высокую эффективность: точность (Accuracy) достигла 89,5 %, F1-score – 92,3 %, AUC – 0,94. Преимущество перед GPT-4 (F1 = 67,2 %) объясняется фокусом на лингвистических аномалиях, которые игнорируются ИИ-алгоритмами, такими как модальный дисбаланс и культурно-специфичные клише.

Ограничения модели связаны с зависимостью от качества транскрипции для аудиовизуального контента (ошибки распознавания речи снижают точность на 15 %) и динамикой медиаландшафта, требующей ежегодной калибровки пороговых значений. Ограничением исследования является отсутствие алгоритмической обработки визуальных признаков deepfake‑видео (кадровые артефакты, несоответствие позы и мимики, рассинхронизация артикуляции с речью), что сужает переносимость результатов на мультимодальные случаи. В дальнейшем планируется расширение модели до мультимодальной версии с интеграцией визуальных и акустических индикаторов в единую интегральную оценку. Для оптимизации предложены динамические пороги ИЭ, адаптирующиеся к тематическим кластерам (например, 15 % для политики, 10 % для науки), и интеграция с NLP-моделями (BERT) для анализа синтаксических аномалий, таких как двойные отрицания и пассивные конструкции.

Таким образом, модель демонстрирует, что комбинация эмпирически верифицированных лингвистических маркеров с многоуровневым анализом обеспечивает воспроизводимую точность детекции фейков. Ее внедрение в редакционные системы (например, FactLingua) сократило время верификации новостей на 40 % за счет автоматизации скрининга лексико-стилистических аномалий, что подтверждает практическую значимость разработки. Перспективы развития связаны с расширением модели на мультимодальные форматы в рамках парадигмы «дискурс как коммуникативное событие», где вербальные маркеры будут соотнесены с визуальными и аудиальными компонентами контента.

6. Практическое применение и эмпирическая валидация модели

Эффективность лингвистической модели подтверждена серией контролируемых экспериментов, соответствующих стандартам доказательной науки. Результаты демонстрируют воспроизводимую эффективность модели в трех ключевых аспектах: формирование критического восприятия, оптимизация верификации контента и адаптация к эволюции дезинформации.

Образовательная валидация

В исследовании с участием 480 студентов (возраст 18–25 лет) проведена оценка влияния модели на медиакомпетенции. Процедура включала претестирование (базовая оценка доверия к фейкам по 7-балльной шкале), 16-часовой тренинг с практикумом по выявлению лингвистических маркеров (ИЭ > 12 %, модальный дисбаланс, метафоры катастрофизма), и посттестирование на верифицированных материалах. Результаты показали:

·       Снижение доверия к фейкам на 41 % (Δmean = 2,87; t (479) = 12,34, p < 0,001);

·       Рост точности идентификации гиперболизации с 31 % до 82 % (χ²(1) = 97,25, p < 0,001);

·       Улучшение распознавания модальных конфликтов с 19 % до 77 % (χ²(1) = 85,41, p < 0,001);

·       Сохранение 74 % навыков через 3 месяца (F (2,478) = 41,6, p < 0,001). Корреляционный анализ подтвердил связь между усвоением модели и критическим мышлением (r = 0,71, p < 0,001), что согласуется с механизмами когнитивной иммунизации к дезинформации (Pennycook, Rand 2019).

Операционная эффективность

На корпусе из 2 140 текстов (Telegram, «ВКонтакте», региональные СМИ; 2024–2025 гг.) проведено слепое тестирование алгоритма модели против экспертной верификации. Результаты:

·       Точность классификации: 89,5 % (95 % ДИ: 87,1–91,7 %);

·       Сокращение времени анализа на 40 % (с 25,3 ± 4,1 до 15,1 ± 3,2 мин/текст; t (2139) = 18,73, p < 0,001);

·       Снижение ложных срабатываний до 6,8 % против 22,1 % у GPT-4.
Эффективность обусловлена автоматизацией ресурсоемких операций: расчет ИЭ (Python-реализация LIWC-аналога) сократил экспертные трудозатраты на 52 %, а алгоритм детекции модальных конфликтов (на базе spaCy) повысил точность верификации нарративов на 37 %.

Адаптация к генеративным угрозам

Для оценки устойчивости модели к AI-фейкам создан субкорпус из 420 текстов, сгенерированных RuGPT-3.5 и ChatGPT-4. Анализ выявил:

·       Сохранение диагностической значимости маркеров: средний ИЭ = 10,2 ± 2,1 % (против 15,3 ± 4,2 % в ручных фейках); когезия = 0,38 ± 0,07 (порог 0,4).

·       Необходимость калибровки: 18.4 % ложных срабатываний для AI-текстов.

·       Культурную устойчивость: плотность военных метафор в русскоязычных AI-фейках (15,7 / 1 000 слов) соответствовала ручным аналогам. Динамическая адаптация порогов (ежеквартальный пересмотр на основе мониторинга 10 000 AI-текстов) снизила ошибки до 8,3 %.

Ограничения и решения

Выявленные вызовы и корректирующие меры:

1.    Дефицит лингвистических компетенций: Внедрение интерактивных тренажеров в учебные модули снизило ошибки идентификации маркеров с 23 % до 7 % (F (1,478) = 29,4, p < 0,001).

2.    Эволюция нарративов: Локализация словарей метафор (добавление 120 неологизмов 2024 г. типа «нейро-колониализм») повысила точность детекции на 12 %.

3.    Контекстуальная вариативность: Разработка отраслевых порогов ИЭ (политика: 15 %; наука: 9 %; медицина: 11 %) снизила ложные срабатывания на 17 %.

Эмпирические данные подтверждают, что модель:

·       Формирует устойчивые когнитивные барьеры против дезинформации (41 % снижение доверия).

·       Обеспечивает ресурсную эффективность верификации (40 % экономия времени).

·       Сохраняет диагностический потенциал в условиях генеративного ИИ (Accuracy = 84,2 % для AI-фейков). Статистическая значимость результатов (p < 0,001) во всех тестах обосновывает применимость модели в образовательных, медийных и аналитических системах.

Заключение

Проведенное исследование эмпирически подтвердило диагностическую ценность лингвистических маркеров для борьбы с цифровой дезинформацией. Установлено, что триада текстовых аномалий – гиперболизация (ИЭ > 12 %, чувствительность 89 %, специфичность 94 %), нарушение когезии (Coh-Metrix < 0,4, AUC = 0,91) и модальный дисбаланс (OR = 14,7, p < 0,001) – служит универсальным индикатором фейков в русскоязычном медиапространстве. Разработанная модель продемонстрировала образовательную эффективность, выразившуюся в 41 % снижении доверия к фейкам и сохранении 74 % навыков верификации через 3 месяца, а также операционное превосходство над алгоритмами ИИ (Accuracy = 89,5 % против 67,2 % у GPT-4). После динамической калибровки порогов модель достигла точности 84,2 % для AI-генерируемых фейков, что подтверждает ее адаптивность к эволюции угроз. Практическая реализация в формате алгоритма FactLingua обеспечила сокращение трудозатрат на верификацию на 52 % и снижение ложных срабатываний до 6,8 %. К ограничениям модели относятся необходимость регулярной калибровки под новые генеративные технологии (требуется ежеквартальное обновление словарей) и зависимость от уровня лингвистической подготовки пользователей. Отдельным ограничением является отсутствие алгоритмической обработки визуальных признаков deepfake‑видео, что будет учтено при расширении модели до мультимодального формата. Перспективные направления включают интеграцию с мультимодальными системами детекции (анализ диссонанса текст/визуал), разработку кросс-культурных адаптаций для стран СНГ и создание открытого API для верификации контента в социальных сетях. Полученные результаты доказывают, что лингвистические методы формируют основу для системного противодействия дезинформации в условиях технологической трансформации медиасреды.

Список литературы

Allcott H., Gentzkow M. Social Media and Fake News in the 2016 Election // Journal of Economic Perspectives. 2017. Vol. 31, No. 2. P. 211–236. https://doi.org/10.1257/jep.31.2.211.

Bovet A., Makse H. A. Infl uence of Fake News in Twitter during the 2016 US Presidential Election // Nature Communications. 2019. Vol. 10, No. 1. P. 1–14. https://doi.org/10.1038/s41467-018-07761-2.

Boyd R. L., Ashokkumar A., Seraj S., Pennebaker J. W. The Development and Psychometric Properties of LIWC-22. Austin: University of Texas at Austin, 2022. https://doi.org/10.13140/RG.2.2.23890.43205.

Chesney R., Citron D. Deep Fakes: A Looming Crisis for Privacy, Democracy, and National Security // California Law Review. 2019. Vol. 107, No. 6. P. 1753–1819. https://doi.org/10.15779/Z38RV0D15J.

Fairclough N. Critical Discourse Analysis: The Critical Study of Language. London: Routledge, 2013. 608 p.

Graesser A. C., McNamara D. S., Louwerse M. M., Cai Z. Coh-Metrix: Analysis of Text on Cohesion and Language // Behavior Research Methods, Instruments, & Computers. 2004. Vol. 36, No. 2. P. 193–202. https://doi.org/10.3758/BF03195564.

Grinberg N., Joseph K., Friedland L., Swire-Thompson B., Lazer D. Fake News on Twitter during the 2016 U.S. Presidential Election // Science. 2019. Vol. 363, No. 6425. P. 374–378. https://doi.org/10.1126/science.aau2706.

Gutierrez-Vasques X., Bentz C., Samardžić T. Languages Through the Looking Glass of BPE Compression // Computational Linguistics. 2023. Vol. 49, No. 4. P. 943–1001. https://doi.org/10.1162/coli_a_00489.

Halliday M., Matthiessen C. Halliday’s Introduction to Functional Grammar. London: Routledge, 2014. 786 p.

Kress G., van Leeuwen T. Reading Images: The Grammar of Visual Design. London: Routledge, 2006. 291 p.

Lazer D. M. J., Baum M. A., Benkler Y., Berinsky A. J., Greenhill K. M., Menczer F., Metzger M. J., Nyhan B., Pennycook G., Rothschild D., Schudson M., Sloman S. A., Sunstein C. R., Thorson E. A., Watts D. J., Zittrain J. L. The Science of Fake News // Science. 2018. Vol. 359, No. 6380. P. 1094–1096. https://doi.org/10.1126/science.aao2998.

Pennycook G., Rand D. G. Fighting Misinformation on Social Media Using Crowdsourced Judgments of News Source Quality // Proceedings of the National Academy of Sciences. 2019. Vol. 116, No. 7. P. 2521–2526. https://doi.org/10.1073/pnas.1806781116.

Pennebaker J. W., Boyd R. L., Jordan K., Blackburn K. The Development and Psychometric Properties of LIWC2015. Austin: University of Texas at Austin, 2015. 27 p.

Piller I. Intercultural Communication: A Critical Introduction. Edinburgh: Edinburgh University Press, 2011. 208 p.

Tandoc E. C., Lim Z. W., Ling R. Defi ning «Fake News» // Digital Journalism. 2018. Vol. 6, No. 2. P. 137–153. https://doi.org/10.1080/21670811.2017.1360143.

Vosoughi S., Roy D., Aral S. The Spread of True and False News Online // Science. 2018. Vol. 359, No. 6380. P. 1146–1151. https://doi.org/10.1126/science.aap9559.

Wardle C., Derakhshan H. Information Disorder: Toward an Interdisciplinary Framework for Research and Policy. Strasbourg: Council of Europe, 2017. 109 p.

Wodak R. The Politics of Fear: The Shameless Normalization of Far-Right Discourse. 2nd ed. London: Sage, 2021. 337 p.

Wodak R., Meyer M. Methods of Critical Discourse Studies. London: Sage, 2016. 272 p.

References

Allcott, H., Gentzkow, M. (2017). Social Media and Fake News in the 2016 Election. Journal of Economic Perspectives, 31 (2), 211–236. https://doi.org/10.1257/jep.31.2.211.

Bovet, A., Makse, H. A. (2019). Infl uence of Fake News in Twitter during the 2016 US Presidential Election. Nature Communications, 10 (1), 1–14. https://doi.org/10.1038/s41467-018-07761-2.

Boyd, R. L., Ashokkumar, A., Seraj, S., Pennebaker, J. W. (2022). The Development and Psychometric Properties of LIWC-22. Austin, TX: University of Texas at Austin. https://doi org/10.13140/RG.2.2.23890.43205.

Chesney, R., Citron, D. (2019). Deep Fakes: A Looming Crisis for Privacy, Democracy, and National Security. California Law Review, 107 (6), 1753–1819. https://doi.org/10.15779/Z38RV0D15J.

Fairclough, N. (2013). Critical Discourse Analysis: The Critical Study of Language . London: Routledge. 608 p.

Graesser, A.C., McNamara, D.S., Louwerse, M.M., & Cai, Z. (2004). Coh-Metrix: Analysis of text on cohesion and language. Behavior Research Methods, Instruments, & Computers, 36 (2), 193–202. https://doi.org/10.3758/BF03195564.

Grinberg, N., Joseph, K., Friedland, L., Swire-Thompson, B., Lazer, D. (2019). Fake News on Twitter during the 2016 U.S. Presidential Election. Science, 363 (6425), 374–378. https://doi.org/10.1126/science.aau2706.

Gutierrez-Vasques, X., Bentz, C., Samardžić, T. (2023). Languages Through the Looking Glass of BPE Compression. Computational Linguistics, 49 (4), 943–1001. https://doi.org/10.1162/coli_a_00489.

Halliday, M., Matthiessen, C. (2014). Halliday’s Introduction to Functional Grammar. London: Routledge. 786 p.

Kress, G., van Leeuwen, T. (2006). Reading Images: The Grammar of Visual Design. London: Routledge. 291 p.

Lazer, D. M. J., Baum, M.A., Benkler, Y., Berinsky, A. J., Greenhill, K. M., Menczer, F., Metzger, M. J., Nyhan, B., Pennycook, G., Rothschild, D., Schudson, M., Sloman, S. A., Sunstein, C. R., Thorson, E. A., Watts, D. J., Zittrain, J. L. (2018). The Science of Fake News. Science , 359 (6380), 1094–1096. https://doi.org/10.1126/science.aao2998.

Pennebaker, J. W., Boyd, R. L., Jordan, K., Blackburn, K. (2015). The development and psychometric properties of LIWC2015. Austin, TX: University of Texas at Austin, 27 p.

Pennycook, G., Rand, D. G. (2019). Fighting Misinformation on Social Media Using Crowdsourced Judgments of News Source Quality. Proceedings of the National Academy of Sciences, 116 (7), 2521–2526. https://doi.org/10.1073/pnas.1806781116.

Piller, I. (2011). Intercultural Communication: A Critical Introduction. Edinburgh University Press. 208 p.

Tandoc, E. C., Lim, Z. W., Ling, R. (2018). Defi ning “Fake News”. Digital Journalism, 6 (2), 137–153. https://doi.org/10.1080/21670811.2017.1360143.

Vosoughi, S., Roy, D., Aral, S. (2018). The Spread of True and False News Online. Science, 359 (6380), 1146–1151. https://doi.org/10.1126/science.aap9559.

Wardle, C., Derakhshan, H. (2017). Information Disorder: Toward an Interdisciplinary Framework for Research and Policy. Strasbourg: Council of Europe. 109 p.

Wodak, R. (2021). The Politics of Fear: The Shameless Normalization of Far-Right Discourse (2nd ed.). London: Sage. 337 p.

Wodak, R., Meyer, M. (2016). Methods of Critical Discourse Studies. London: Sage. 272 p.

И. Д. Диреев – преподаватель кафедры связи военного-учебного центра

Ivan D. Direev – Lecturer at the Department of Communications of the Military Training Center

Знак: проблемное поле медиаобразования. № 1 (59). 2026

Znak: problemnoe pole mediaobrazovanija. No. 1 (59). 2026

This HTML was created using MetaGalley 1.3