В статье выдвигается и математически обосновывается тезис о "псевдокалипсисе" - неизбежном конце анонимности в интернете из-за статистического "отпечатка", который каждый человек оставляет в своих текстах.
Для уникальной идентификации среди ~490 млн англоязычных людей достаточно всего ~29 бит информации. Обычные сообщения раскрывают порядка 106 бит информации о личности. 17 бит уходит на демографию, 39 - на черты личности по модели HEXACO, а 50 бит - это стилистические особенности: от частот служебных слов до пунктуационных привычек.
По его расчетам, псевдонимность компрометируется уже после ~1000 слов. Современные стилометрические методы работают лишь на пулах из ~50 авторов, но LLM уже неплохо угадывают авторов "случайно", а специализированная модель, обученная по рецепту "огромный датасет + огромная сеть + огромный бюджет", могла бы приблизиться к теоретическому пределу.
В статье автор упоминает и другие факторы для идентификации. Это может быть походка, царапины на машине, динамика нажатий клавиш, а также аналоговые схемы зарядки наушников.
Прикольно, что одной из контрмер может быть LLM-фильтрация, выхолащивающая человечность текста.
Кажется, что гонка вооружений между идентификацией и приватностью складывается в пользу идентификации
22.07.2026
Похожее
02.09.2026
Исполняемы файл - это SQLite база
Куда только этот ваш SQLite не запихивали Статья рассказывает о проекте SELF ...
01.09.2026
Теория музыки
Статья объясняет теорию музыки "с нуля", отталкиваясь от физики и арифметики ...
30.08.2026
htmx для Game Boy
Автор рассказывает про видео игру "htmx 4: the game" - первую JavaScript-библиот...
27.08.2026
Интернет на калькуляторе
Радиолюбитель EI3LH, увлекся карманными компьютерами Casio и сумел запустить нас...