В статье автор разбирается в возможностях полнотекстового поиска в DuckDB.
Он сравнивает DuckDB с более зрелыми решениями, такими как Elasticsearch и PostgreSQL, отмечая, что встроенное FTS-расширение DuckDB поддерживает стемминг, стоп-слова, удаление диакритических знаков и алгоритм ранжирования Okapi BM25.
На практическом примере с 13 000 email-сообщений автор показывает полный рабочий процесс: предварительную обработку писем на Python, импорт JSON-данных в DuckDB, создание FTS-индекса и выполнение различных типов запросов.
В принципе, DuckDB предоставляет достаточно мощный и удобный инструмент для большинства исследовательских сценариев, особенно учитывая скорость работы и простоту развертывания практически на любых источниках данных
17.05.2026
Похожее
05.08.2026
mmap
Автор, три года строивший append-only базы данных на терабайтных масштабах, подр...
03.08.2026
Выживание с постгрей
Руководство по выживанию с Postgres для стартапов, основанное на двухлетнем опыт...
29.07.2026
768 серверов Postgres
Статья рассказывает, как PlanetScale заставляет 768 серверов Postgres, хранящих ...
20.07.2026
Запускаем DOOM на базе данных
Разработчики Turso портировали оригинальный Doom на байткод VDBE — виртуальную м...