Международная
дата-журналистика
Как данные и корпусы текстов превращаются
в увлекательные истории о мире
Ссылка на сайт
Алгоритм
  1. Идея + Данные​
  2. Очистка и обработка данных
  3. Анализ
  4. Внешняя валидация гипотез: ищем доказательства вне данных (эксперты, медиа и т.д.), что наши выводы разумны и возможны
  5. Визуализация
  6. Текст
  7. Вёрстка и публикация
Данные (data) — представление информации в формализованном виде, пригодном для передачи, интерпретации и обработки людьми или компьютерами.

Информационная иерархия:
Сигнал → Данные → Информация → Знание → Понимание



Данные — формализованный сигнал.
Информация — полученное в ходе обработки и анализа данных, понятное человеку сообщение; данные с содержательным контекстом.
Знание — осмысленная информация, позволяющая сформировать представление о предмете. Мы обладаем знанием, когда знаем, как поступить с информацией.
Понимание — возможность увидеть логическую взаимосвязь в полученном знании и применить её для понимания окружающего мира. Когда мы учитываем возможности и границы применимости знания, мы переходим на уровень понимания.
Мудрость — знание и понимание пускаются в дело: благодаря полученным инсайтам, мы решаем, как поступить лучшим образом.
Идея + Данные
  1. От идеи к данным.
​Сначала возникает идея, например:
«Я хочу написать историю о том, сколько люди зарабатывают. Может, посмотреть, как изменились доходы людей за последние 5 лет? Доходы выросли или упали?»​

А затем ищем подходящий источник данных

2. От данных к идее.
Сначала мы находим интересный датасет — например, сколько в среднем зарабатывают люди в разных регионах России.

А затем, тщательно изучая данные, мы находим инсайты и идею для статьи, например:
«Где живут самые богатые россияне: в Москве, Магадане или Мурманске?»

Ответ: вагадане — золотодобыча, рыбная ловля, энергетика.
3. Стратегия супа: соединение разных тем.​​

Тема 1: Фольклор​
Тема 2: ДТП

Статья: «Зловещие перекрёстки: почему в местах, где, согласно фольклору, ведьмы проводят обряд инициации, ДТП случаются чаще всего?»

🌻 ВАЖНО! Не стоит приступать к работе над статьёй, пока вы не убедитесь, что нужные вам данные существуют. Неважно, большие данные или малые: их должно быть достаточно.
Форматы
  • xlsx — табличный формат документов для Microsoft Excel
  • csv/ tsv — Comma-Separated Values/ Tab-Separated Values — текстовый файл, где данные разделены запятыми, табуляцией или другими символами
  • web table — таблицы из интернета, например, из Википедии (см. Нобелевские премии по году вручения)
  • pdf таблица — таблицы в пдф-файлах

Ответ: вагадане — золотодобыча, рыбная ловля, энергетика.
  • xml — Εxtensible Μarkup Language — данные древовидной структуры, содержат угловые скобки
  • json — JavaScript Object Notation — древовидная структура с парами ключ–значение и фигурными скобками
  • geojson — то же самое, что и json, но с геокоординатами
  • неструктурированные данные — всё, что нуждается в предобработке перед анализом
Можно просмотреть любой файл с помощью Блокнота.

🌻 ВАЖНО! Готовая инфографика (картинки с какими-то числами или графиками) — это НЕ данные!
Большие и открытые ❤️
Большие данные — 7 Vs:
  • Volume — Объём — большой размер​.
  • Variety — Разнообразие — различные типы и природа данных.
  • Velocity — Скорость — данные автоматически генерируются и обрабатываются с высокой скоростью.
  • Veracity — Достоверность — надёжность источника данных и их ценности.
  • Value — Ценность — эти данные стоит анализировать, они не бесполезны.
  • Variability — Изменяемость — связь данных и описываемой ими реальности непостоянна, так как сама реальность непостоянна. Одни и те же предметы могут по-разному записываться в данных, и наоборот: одна и та же запись может описывать разные предметы.
  • Visualisation — Визуализация — ключевые инсайты можно отразить на изображении.



Ответ: вагадане — золотодобыча, рыбная ловля, энергетика.
Открытые данные — общедоступные машиночитаемые данные, которые все могут скачивать и изучать.

Ваши данные — селф-трекинг, изучение собственных данных — см. Quantified Self​ (+ r/QuantifiedSelf) —например:
  • доходы и расходы;​
  • число шагов в день.
Проекты-примеры:
Возможен ли показатель, который в разных ситуациях может быть
и качественным, и количественным?
Да
Туториалы
Также доступны видео на английском языке.
Нужные датасеты
Папка со всеми нужными нам датасетами
Как открыть CSV
Как открыть JSON
В Google-таблицы файлы json or xml можно загрузить напрямую.
1) Переформатируйте файл в CSV, например, на этих сайтах — JSON to CSV, XML to CSV.
2) Импортируйте результат в Google-таблицы как csv-файл.

Если у вас старая версия Microsoft Office (2013 и раньше), используйте ту же стратегию: переконвертируйте файл в csv, а затем импортируйте в Excel.

Иногда файлы с древовидной структурой, такие как json или xml, содержат много ошибок, и загрузить данные в табличку не получается. Скорее всего, это не ваша вина, а битый файл с ошибками структуры.
Проверьте «валидность» json-файла здесь и xml-файла здесь.
Как открыть XML
Как вытащить таблицы из PDF
Если у вас новый Office, функция встроена в Excel. Если у вас Office 2013 года и старше, скачайте Tabula и Java
Источники данных
Обычно нужные данные можно найти, просто загуглив «тема данные» или «статистика», например environmental data, но вот несколько ключевых сайтов, где можно найти много полезных датасетов.

Открытые данные — всемирный уровень
  1. UNData — ООН.
  2. World Health Organization — Всемирная организация здравоохранения.
  3. World Bank — Всемирный банк.
  4. UNCTADStat — Конференция ООН по торговле и развитию.
  5. UNESCO: Общая статистика и Всемирная база данных о неравенстве в образовании.
  6. Eurostat Database — Евросоюз.
  7. Отчёты консалтинговых компаний, например, McKinsey & Company.

Негосударственные агрегаторы данных — всемирный уровень
  1. Dateno — поисковик по данным мира, создан российскими разработчиками.
  2. Our World in Data.
  3. Gapminder.
  4. Statista.com — 🌻 Важно! Для просмотра некоторых данных нужна платная подписка; у таких данных будет бело-зелёный крестик в правом верхнем углу картинки. Статистика без такого крестика доступна бесплатно.
  5. OCCRP Aleph — данные Центра по исследованию коррупции и организованной преступности, доступ с VPN, подходят для расследовательской журналистики.
  6. Data.world.
  7. Kaggle — можно наткнуться на необычные датасеты, например "Best Books Ever", "Reddit Dad Jokes", "Naughty or Nice List 2021", "French Second Hand Cars", "List of Colours" — посмотрите на популярные датасеты.
  8. Аналитика поисковых трендов: Google Trends и Яндекс Вордстат.





Российские данные
  1. Росстат — можно как скачивать статистику напрямую, так и запрашивать информацию.
  2. DataCatalogs — каталог каталогов данных, агрегатор различных источников.
  3. Стат ГИБДД — статистика аварийности Госавтоинспекции.
  4. Если быть точным — данные, собранные авторами проекта о социальных проблемах в России. 🌻 Важно! Использовать с осторожностью и по возможности самостоятельно искать данные в первоисточника, используя материалы Если быть точным только как подсказку.

Московские данные
  1. Портал открытых данных Москвы — официальные открытые данные Москвы, сгруппированные по темам.
  2. Единое хранилище данных — официальные открытые данные Москвы, сгруппированные по ответственным ведомствам.
  3. ПРОдвижение — немашиночитаемые, но ежедневно обновляемые данные о поездках на такси, каршеринге и арендных самокатах.
  4. Компас Тинькофф — агрегированные данные о тратах москвичей по категориям.
  5. Яндекс Геоаналитика — есть данные по портрету населения, пешеходным потокам и по автомобильному трафику. Показатели по автомобильный трафику занижены, однако лучшего в открытом доступе нет, поэтому можно ориентироваться.

Данные отдельных стран
Во многих странах есть свои сайты открытых данных. Обычно они имеют gov в домене (то есть в адресе ссылки), например, https://www.data.gov.gr/ — открытые данные Греции.​
Источники вдохновения
Мой фаворит — пиксельный скроллителлинг:

Компьютерная лингвистика (анализ текста) как метод

Линейные графики

Точки

Классные дата-команды





Забавный формат

Наш разнообразный мир

Не знаю, какая категория, но всё же

Премии по дата-журналистике и визуальному искусству
Примеры
из Греции
1. Бурные воды: множественные разрушительные последствия наводнений в Европе — MIIR (Средиземноморский институт расследовательской журналистики) — на греческом и на английском.

2. Купля-продажа пустых домов в Эвросе — iMEdD (Инкубатор медиаобразования и развития) — на греческом и на английском.

3. Самые холодные дома в Европе находятся в Западной Греции — Solomon (СМИ, исследующее конфликт интересов при движении людей и средств между государственным и частным секторами) — на греческом и на английском.
Необязательно делать масштабные работы
Иногда одной картинки достаточно
Самый простой инструмент для визуализации данных — DataWrapper
Инфографика нужна не всегда
Иногда текст выигрышнее. Экспериментируйте с подачей
  • Для подбора музыки использовалась нейросеть DeepSeek.
  • Запрос: «Подскажи, какие произведения классической музыки ассоциируются с сердцебиением?».
  • Ответ: «Иоганн Штраус II – Ускорительный вальс (Accelerationen Walzer, Op. 234). Начинается медленно, но постепенно ускоряется, как будто сердце замирает, а затем бьётся всё быстрее».
Сколько блинчиков вам нужно для счастья и продуктивной работы?

Используйте визуальные метафоры.


Здесь блинчик — это

  • а) элемент декора;
  • б) пайчарт;
  • в) элемент пиктографической диаграммы, отражающей долю от целого;
  • г) элемент пиктографической диаграммы, отражающей распределение голосов — альтернатива барчарту.

https://t.me/DtRoad/45618

Пять стратегий придумывания заголовков
для дата-визуализаций, статей
и карточек с инфографикой
  • Показатель как он есть
    «Число лягушек в мире»
  • Наводящий вопрос
    «Растёт ли число лягушек в мире»
  • Конфликт
    «Лягушки VS жабы: кого в мире больше»
  • Тенденция
    «Число лягушек в мире стремительно растёт»
  • Ключевой инсайт
    «Юго-Восточная Азия — лидер по числу лягушек»
Компьютерная лингвистика
Компьютерная лингвистика работает с неструктурированными языковыми данными — текстом и звучащей речью.

Человек может прочитать текст и понять, что там написано.
Компьютер может посчитать, что написано — он «понимает» только двоичный код.
См. Китайская комната.

Язык — множество цепочек символов из некоторого алфавита. Не всех цепочек, а только тех, которые удовлетворяют некоторым правилам.

Текст — отдельно взятая цепочка, построенная по этим правилам.





Алфавит — это множество символов, которые можно использовать для построения текстов.

Естественный язык — тот, на котором говорят между собой люди.

Текст и речь — это закодированная на естественном языке информация.

Теоретическая лингвистика пытается учесть все особенности естественного языка.

Компьютерная лингвистика, напротив, упрощает язык, ищет в нём структуры и закономерности и использует их, чтобы сделать выводы о тексте.
Где встречается
1. Проверка грамматики, орфографии, пунктуации и стилистики:

2. Спам-фильтры:
  • папка «Спам» в почте.​

3. Машинный перевод:

4. Распознавание речи:

5. Чат-боты и голосовые помощники​:
  • чаты в приложениях банков​;
  • ChatGPT, YandexGPT 2.

6. Информационный поиск:
  • Baidu;​
  • SEO-выдача сайтов.​

7. Оптическое распознавание символов — Optical character recognition (OCR)​:
  • перевод изображений рукописного или печатного текста в данные​;
  • распознавание текста на сканах в pdf;
  • Tabula туториал.

8. Морфологический анализ​:
  • найти в тексте все упоминания глагола «быть» во всех формах.

9. Синтаксический анализ​:
  • убрать из текста все деепричастия​.

10. Анализ тональности / сентимент-анализ​:
  • как люди относятся к пенсионной реформе​.

11. Анализ жанров.

12. Поиск плагиата.



13. Извлечение ключевых слов​:
  • нужно быстро проанализировать большой массив текстов и понять, о чём он​;
  • QuitaUp.

14. Извлечение именованных сущностей:

15. Определение предвзятой позиции в тексте:
  • отличить пророссийскую риторику от проукраинской​.

16. Фиксация и систематизация языка​:

17. Типологизация языков​ и сравнительно-сопоставительная лингвистика. Например, чем русский отличается от английского​:
  • ​флективность (словоизменение) = возможность менять форму слова в зависимости от ситуации;
  • смысловая омонимия (неоднозначность);
  • частеречная омонимия (неоднозначность);
  • порядок слов = свобода расположения слов в предложении.

18. Определение авторства​:

19. Порталы с различными инструментами для анализа русскоязычных текстов:

20. Взаимосвязь инфоповодов и другой медиаанализ.
Лексика
словарный состав языка, все слова в нём
Слово — единица языка, которой что-то называют или которая служит для каких-то вспомогательных целей.

Лексема — ​«чистая» форма слова; то, каким мы видим слово в словаре:
  • чай, к чаю, за чаем — одна лексема «чай»​.

Словоформа — цепочка фонем, образующая слово:
  • чай, к чаю, за чаем — три словоформы​.

Текстоформа — слова, разбитые пробелами​:
  • в зависимости от — составное слово из трёх текстоформ​.


Парадигма — список, объединённый общим признаком​.

Морфологическая парадигма — список всех словоформ одной лексемы, которые имеют разные грамматические значения.

Лемма — каноническая, стандартизированная форма лексемы:

Токен — идентифицированная лексема; знаки препинания также идентифицируются как отдельные токены.
Лемматизировать тексты на греческом можно в нейросетях DeepSeek и ChatGPT
Порядок действий
Вытаскиваем смысл из текстов

Сайт для тренировки: https://www.iefimerida.gr/
  • Сбор коллекции
    Собираем тексты в один txt-документ
  • Лемматизация
    Просим нейросеть (DeepSeek или ChatGPT) лемматизировать текст на новогреческом языке
  • Сохранение лемматизации в txt
    Сохраняем получившийся текст в txt-файл. Можно с помощью приложения «Блокнот»
  • Загружаем текст в AntConc
    Посмотрите видеотуториал ниже
  • Загружаем в AntConc стоп-слова
    Посмотрите видеотуториал ниже. Не забывайте нажимать заново Start после изменения настроек
Сложности
Главная сложность в работе с естественными языками — снятие неоднозначности.​

1. Вы работаете в Лаборатории Касперского, и ваш алгоритм банит сайты, где продаются огнеупорные трубы. Почему?​

2. В чём будет сложность с поиском по запросам «apple» и «вышка»?

3. «Эта собака была похожа на собак королевской семьи» — сколько собак?

4. В чём двойственность фраз
  • "flying planes can be dangerous";
  • «летят сорок сорок»;
  • «дети из Москвы полетели в Петербург»;
  • «мужу изменять нельзя»;
  • «мама мыла раму» VS «в ванной не было мыла»;
  • «мы подарили цветы девочкам, потому что они были красивые»?

5. Как корректно интерпретировать неологизмы?
  • slay queen, she ate and left no crumbs

6. Как токенизировать
  • what’re, I’m, isn’t,
  •  我二十四岁 — «мне 24 года»?
  • Больше статей про обработку иероглифических языков (иногда нужен VPN): раз, два, три.​​​

7. Как обработать текст, где смешаны разные письменности?
  • 我的hero! — Мой герой!
  • Τι κάνεις; — Как дела?



8. Как разделить на предложения текст?
  • ​«Масла для бензиновых и дизельных двигателей с увеличенным сервисным интервалом. Альтернатива — VW 505.01, VW 506.00, VW 506.01. Поставки от 12.02.2021»​.
  • тыс., ул., и т.д.

9. Как отличить в переписке «я не знаю ( » от «я не знаю (пока что)»; «Мы не успели на корабль( зато покатались на самокатах)» от «Мы не успели на корабль (зато покатались на самокатах)»?​

10. Мондегрины.

11. Нужно ли дробить на леммы "state-of-the-art" и «Римский-Корсаков»?

12. Как привести к единому формату сокращения США? U.S.A. USA US us

13. В чём разница по составу между предложениями:
  • Расстояние от Тулы до Москвы 186 км.
  • В отличие от Тулы, до Москвы из Новосибирска можно долететь прямым рейсом.

14. Как выдавать в поисковике нужные результаты по запросам, сформулированным разными словами?​
  • У годовалого ребёнка проблемы с дефекацией.
  • У малыша запор.
  • Мой годовасик тугосеря.
Примеры проектов
  1. Strong men, caring women — Pew Research Center​
  2. Beautiful in English — Google News Lab + Visual Cinnamon
  3. Literary Constellations — Nicholas Rougeux
  4. Why do cats and dogs...? — Nadieh Bremer + Google Trends
  5. What Do People Ask Most About Relationships In China? — ThePaper.cn (используйте браузерный плагин Google Translate)





6. Как называется это место? Исследования населённых пунктов на карте России — Исследования Яндекса
7. The Poet's Journey — Michela Lazzaroni
8. Decoding Everything Everywhere All at Once — Angelica Hom
9. Dad words — Nina Errey
10. On the same page — KTH Royal Institute of Technology
AntConc
Программа для анализа текстов
  1. Загружаем корпус в программу через Open.

2. Смотрим, корректно ли прогрузились тексты, кликнув на один из них и щёлкнув на File View.

3. Чтобы посмотреть на частотность слов в корпусе, идём в Word, видим самые популярные слова и их Freq (frequency) — по-русски «частотные списки» — набор слов данного языка, корпуса или текста вместе с информацией об их частотности.

Word — отдельные токены (слова) с подсчитанной частотой. Исключения (стоп-слова) загружаем через Settings → Global Settings → Tool Filters → → Hide words in file → Apply.​

4. File View
  • просмотр файла
  • обычный поиск по тексту в конкретном файле, а не во всём корпусе




5. Clusters — найти слово или паттерн в корпусе и сгруппировать (кластеризировать) их со словами слева и справа, а затем проранжировать результаты по частоте. Можно отредактировать:
  • размер кластера;
  • минимальную частоту;
  • минимальное число файлов, в которых встречается такое сочетание (range).

6. N-Gram — считает частоту сочетаний из n числа слов; альтернатива инструменту Cluster. В отличие от Cluster, здесь не нужно вводить поисковой термин. Если n = 2, а текст “This is an apple”, инструмент подсчитает частоту “This is”, “is an” и “an apple”. Также здесь нет разделения на правый и левый поиск. Также можно подставлять open slots — пустые места, в которые можно подставить что угодно (для n = 3 и выше).
Туториал по AntConc
Мария Казакова

Работа: дата-журналистка. Отвечаю за аналитическое направление в пресс-службе Центра организации дорожного движения Москвы (ЦОДД) с 2021 года.

Сфера ответственности:


Другие профессиональные интересы:

Бакалавриат: Международная журналистика, МГИМО, 2015–2019.
Магистратура: Журналистика данных, ВШЭ, 2019–2021.
Мария Казакова
преподаватель курса
Контакты
Телеграм: @oilunem
Телефон: +7-926-170-40-93
Почта: marikasakowa@gmail.com
Смело пишите по любому вопросу
This site was made on Tilda — a website builder that helps to create a website without any code
Create a website