В статье выдвигается и математически обосновывается тезис о "псевдокалипсисе" - неизбежном конце анонимности в интернете из-за статистического "отпечатка", который каждый человек оставляет в своих текстах.
Для уникальной идентификации среди ~490 млн англоязычных людей достаточно всего ~29 бит информации. Обычные сообщения раскрывают порядка 106 бит информации о личности. 17 бит уходит на демографию, 39 - на черты личности по модели HEXACO, а 50 бит - это стилистические особенности: от частот служебных слов до пунктуационных привычек.
По его расчетам, псевдонимность компрометируется уже после ~1000 слов. Современные стилометрические методы работают лишь на пулах из ~50 авторов, но LLM уже неплохо угадывают авторов "случайно", а специализированная модель, обученная по рецепту "огромный датасет + огромная сеть + огромный бюджет", могла бы приблизиться к теоретическому пределу.
В статье автор упоминает и другие факторы для идентификации. Это может быть походка, царапины на машине, динамика нажатий клавиш, а также аналоговые схемы зарядки наушников.
Прикольно, что одной из контрмер может быть LLM-фильтрация, выхолащивающая человечность текста.
Кажется, что гонка вооружений между идентификацией и приватностью складывается в пользу идентификации
22.07.2026
Похожее
20.07.2026
Запускаем DOOM на базе данных
Разработчики Turso портировали оригинальный Doom на байткод VDBE — виртуальную м...
17.07.2026
История в меню
Не хочу никаких сложных тем в пятницу. Лучше посмотрите на эту подборку красивых...
15.07.2026
Как не надо делать
Автор ставит забавный эксперимент: найти самый медленный способ просуммировать м...
10.07.2026
Ода форумам
Автор статьи размышляет о закате веб-форумов и том, что мы потеряли с их уходом....