Between Tokens / заметки о языке и машинах

Как машина
продолжает мысль

Пишешь вопрос, а в ответ появляются предложения. Что происходит между этими двумя моментами?

Сначала текст становится токенами

Языковая модель работает с небольшими фрагментами текста — токенами. Это может быть слово, часть слова или знак препинания. Как именно разбивается текст, зависит от токенизатора.

Представим продолжение фразы
Сегоднязаокном…

«Дождь», «солнце», «снег» — несколько возможных продолжений. Здесь слова показаны условно: настоящий токенизатор может разделить их иначе.

Контекст помогает выбрать продолжение

Модель учитывает доступный ей текст: твой вопрос, предыдущие сообщения и уже написанную часть ответа. Этот текст называют контекстом. Его объём ограничен, поэтому длинный разговор не всегда помещается целиком.

Ответ появляется постепенно

Во время обучения модель усваивает закономерности на множестве примеров. При генерации она оценивает возможные следующие токены и выбирает продолжение. Новый токен добавляется к контексту, затем процесс повторяется.

Убедительный текст может быть ошибочным

Правдоподобное продолжение не гарантирует правильный факт. Модель может перепутать дату, придумать источник или пропустить условие. Для важных ответов полезно открыть первоисточник и проверить, что он действительно говорит.