Дедуплицируете отсортированные данные без учета шаффла? Тогда данные будут выглядеть, как на пикче ниже :) Совет недели по работе с данными при помощи spark: метод .drop_duplicates() включает в себя шаффл данных. Это значит, что если вы предварительно отсортировали набор данных (например, по дате, чтобы оставить самые свежие записи), то результат будет отличаться от ожиданий (и не выдавать никаких ошибок). Для таких кейсов я предпочитаю выполнять дедупликацию с помощью оконных функций.