В статье выдвигается и математически обосновывается тезис о "псевдокалипсисе" - неизбежном конце анонимности в интернете из-за статистического "отпечатка", который каждый человек оставляет в своих текстах.
Для уникальной идентификации среди ~490 млн англоязычных людей достаточно всего ~29 бит информации. Обычные сообщения раскрывают порядка 106 бит информации о личности. 17 бит уходит на демографию, 39 - на черты личности по модели HEXACO, а 50 бит - это стилистические особенности: от частот служебных слов до пунктуационных привычек.
По его расчетам, псевдонимность компрометируется уже после ~1000 слов. Современные стилометрические методы работают лишь на пулах из ~50 авторов, но LLM уже неплохо угадывают авторов "случайно", а специализированная модель, обученная по рецепту "огромный датасет + огромная сеть + огромный бюджет", могла бы приблизиться к теоретическому пределу.
В статье автор упоминает и другие факторы для идентификации. Это может быть походка, царапины на машине, динамика нажатий клавиш, а также аналоговые схемы зарядки наушников.
Прикольно, что одной из контрмер может быть LLM-фильтрация, выхолащивающая человечность текста.
Кажется, что гонка вооружений между идентификацией и приватностью складывается в пользу идентификации
22.07.2026
Похожее
14.08.2026
Игры под Nintendo 64
Автор портировал свой старый JavaScript-демо-шутер Xibalba (2014) на Nintendo 64...
12.08.2026
Какой ты газонокосильщик
The Pudding провели интерактивный эксперимент, в котором больше 30 тысяч человек...
09.08.2026
Кровать на zig
Физик с PhD, с ADHD и аутизмом рассказывает, как купил Chilipad 2.0 - систему во...
04.08.2026
Макбук тачскрин
Статья аж 18-го года, и судя по комитам, проект никак не развивается. Но он все ...