Проблема распознавания достоверности новостей является актуальной, особенно в настоящее время, в гетерогенном информационном поле. Поэтому необходимо разработать инструменты, которые позволили бы автоматически с использованием лингвистических методов и моделей определять достоверность или недостоверность новостей, опубликованных в интернет-СМИ.

На уровне дискурса в области автоматической обработки текста можно работать с текстами в рамках теории риторической структуры. Мы собрали корпус из достоверных и недостоверных новостей и разметили их по использованным типам риторических связей.

Для решения задачи классификации текстов и машинного обучения мы использовали Support Vector Machines (для линейного ядра и rbf-ядра) и Random Forest Classifier, для обоих классификаторов с кросс-валидацией 10-fold. В качестве признаков использовались типы риторических связей (частотность), а также сочетания типов связей (типы риторических связей+биграммы и типы риторических связей+триграммы), всего в эксперименте было использовано три набора данных. Лучшие результаты мы получили при классификации с помощью Support Vector Machines с линейным ядром для первого набора данных, он оказался лучше всего линейно разделим на два класса. Модель имеет предсказательную силу (0.65), превышающую показатели для схожего исследования для английского языка, а также показатели распознавания достоверности новостей людьми.

Докладчик: Дина Писаревская