Миллион токенов — это меньше слов, чем вы думаете: мы это подсчитали

Как только кто-то упоминает о «втором мозге», неизменно возникает возражение. Современные языковые модели способны обрабатывать миллион токенов, а некоторые — даже больше. Так зачем же вообще сортировать, маркировать и связывать заметки, если можно просто передать всю эту кучу искусственному интеллекту?
Ответ сводится к цифре, которую почти никто не проверяет. Токены — это фрагменты, на которые модель разбивает текст, и единица, по которой она выставляет счёт. Сколько текста вмещает миллион таких токенов, зависит от языка и от метода разбиения — токенизатора. Поэтому мы решили измерить это, а не гадать.
Как мы проводили подсчёт
Мы взяли за основу два текста с идентичным содержанием: немецкую и английскую версии одной из статей нашего журнала. Немецкая версия содержала 1 134 слова, а английская — 1 276 слов. Оба подсчёта включают только основной текст и подзаголовки, без подписей к иллюстрациям и списка источников. Всё, что находится между двумя пробелами, считается словом. Обе версии были обработаны с помощью библиотеки js-tiktoken версии 1.0.20: один раз с использованием кодировки o200k_base, которую OpenAI применяет в своих текущих моделях, и один раз с использованием cl100k_base — более старой кодировки, используемой в GPT-4 и GPT-3.5.
Широко цитируемое эмпирическое правило гласит, что один миллион токенов равен 750 000 слов. Для английского языка эта оценка является слишком консервативной; для немецкого — значительно завышенной. Сравнение двух методов кодирования говорит о многом. Один и тот же текст на немецком языке дает 1 747 токенов при использовании одной кодировки и 2 088 — при использовании другой. Разница составляет 20 %, и она обусловлена исключительно различиями в методах разбиения на токены. Английский текст остался практически неизменным: 1 200 против 1 202 токенов на слово. Прогресс в области токенизаторов почти полностью пришелся на языки, отличные от английского.
Для моделей Claude и Gemini провести аналогичное тестирование невозможно, поскольку компании Anthropic и Google не публикуют свои токенизаторы. Однако компания Anthropic в своей документации по ценообразованию отмечает, что в моделях Claude 4.7 и более поздних версиях используется иной метод, который генерирует примерно на 30 процентов больше токенов для одного и того же текста, чем их предшественники. Поэтому приведенные ниже цифры отражают разницу порядка величины, а не точные значения.
Что это означает для реальной коллекции
Мы провели измерения коллекции, которая пополнялась на протяжении многих лет: около 470 заметок, что экстраполируется на 350 000–400 000 слов. Этот объем едва умещается в контекстное окно, и коллекция продолжает расти.
Однако контекстное окно заполняется заново и оплачивается снова при каждом отдельном запросе. Модель ничего не запоминает. Каждый раз она начинает с самого начала. При использовании GPT-5.6 Sol один миллион входных токенов стоит пять долларов США, а при количестве 272 000 токенов в одном запросе — десять. 400 000 немецких слов составляют примерно 616 000 токенов, что относит их к дорогому тарифному уровню, то есть 6,16 доллара. За один вопрос. Десять вопросов за один день обойдутся примерно в 60 долларов. Notion Business — самая дорогая подписка в нашем сравнении систем — стоит 19,50 евро в месяц на одного пользователя.
Здесь следует учесть два нюанса. Данный расчёт касается API — интерфейса, который разработчики используют для прямого обращения к модели, — а не потребительских подписок. Пользователи ChatGPT Plus или Claude Pro не платят за каждый токен, но в конечном итоге достигают лимитов использования. Кроме того, существует кэширование. В случае попадания в кэш OpenAI и Anthropic взимают лишь десятую часть цены за ввод данных, что превращает 6,16 доллара в 62 цента. Однако в зависимости от настроек кэш действует всего от пяти минут до часа.
Почему сортировка по-прежнему окупается
Дело не в том, что система заметок будет дешевле искусственного интеллекта. Дело в том, что она уменьшает объем данных, которые вообще должны попадать в контекст. Качественный полнотекстовый поиск или семантический индекс, осуществляющий поиск по смыслу, а не по ключевым словам, предоставляет модели десять релевантных заметок вместо четырехсот.
В результате 616 000 токенов превращаются примерно в 9 000, а 6,16 доллара — в пять центов. По количеству токенов это соотношение составляет 67 к 1, по стоимости — 123 к 1, поскольку небольшой запрос не превышает дорогостоящий порог в 272 000 токенов. Кроме того, возникает эффект, который не отражён ни в одной таблице цен. Модель, анализирующая десять релевантных заметок, даёт более точные ответы, чем та, которая прорабатывает четыреста.
Настоящим ограничением редко является окно контекста
Если вы не работаете через API, вы в любом случае гораздо раньше столкнётесь с другим ограничением. В ChatGPT количество файлов на один проект зависит от тарифного плана: пять — в бесплатном тарифе, 25 — в тарифах «Go» и «Plus», и 40 — в тарифах «Pro», «Business» и образовательных тарифах. Gemini Notebook допускает 50 источников на один блокнот в рамках бесплатного тарифного плана «Standard», 100 — в рамках тарифного плана «Plus» и 300 — в рамках тарифного плана «Pro». Объём одного источника может достигать 500 000 слов.
Особенно бросается в глаза несогласованность этих цифр. На странице справки по проектам OpenAI указывает 25 файлов для тарифного плана «Plus», но в разделе справки по загрузке файлов — 20, причём обе страницы были обновлены в одну и ту же неделю. Если вы планируете полагаться на эти данные, проверьте количество в своём личном аккаунте, а не доверяйте документации.
Это переносит акцент вопроса. Решающим фактором, определяющим возможность запроса по коллекции, является не миллион токенов, а то, принимает ли инструмент эту коллекцию вообще. И именно в этом заключается ценность вашей собственной системы заметок: она не выбирает, что в неё попадает, а лишь то, что из неё выходит.
Что говорит против всей этой идеи
«Второй мозг» всё равно требует усилий, а у программ есть свои особенности, о которых стоит знать, прежде чем приступать к работе. Obsidian и Joplin также работают на телефонах, но не синхронизируются в фоновом режиме. Obsidian отвечает на этот вопрос в своём собственном разделе часто задаваемых вопросов о синхронизации однозначным «нет». Файлы синхронизируются только во время работы программы. На компьютере вы этого практически не замечаете, поскольку приложение, как правило, открыто. Но если вы набьёте заметку на ходу, а затем свернёте приложение, она не поступит на ваш компьютер, пока вы снова не откроете приложение на телефоне. Это касается и Obsidian Sync — платного собственного сервиса компании. Если же вы храните папку в iCloud или синхронизируете её с помощью Syncthing, этот сервис сделает всю работу за вас. В бесплатной версии Notion максимальный размер одного файла ограничен 5 МБ. А в случае с Gemini Notebook от Google пути назад нет: удалите записную книжку — и источники исчезнут вместе с ней. Только переписки в Gemini возвращаются в список чатов.
Поэтому лучший совет — собирать заметки в течение двух недель, а затем принять решение. Если у вас накопится тридцать заметок, вам не нужна система — вам нужна папка. Если же их будет триста, вы сами заметите, чего не хватает при поиске.
Источник(и)
OpenAI: Цены на API, Anthropic: Цены на модели и функции, js-tiktoken 1.0.20, Notion: Тарифные планы, Notion: Изображения, файлы и мультимедиа, Obsidian: Часто задаваемые вопросы о синхронизации, Joplin: Синхронизация, Google: Ограничения на блокноты Gemini, Google: удаление блокнотов, OpenAI: проекты в ChatGPT, OpenAI: часто задаваемые вопросы о загрузке файлов



