Мокрый Тортл Мокрый Тортл Wet Tortle Таверна для героев A tavern for heroes
ТавернаTavern ГеймплейGameplay Как игратьHow to play ПутьJourney ВопросыFAQ Блог Роадмап Играть в TelegramPlay on Telegram

ДнД-бот на разных нейросетях: сравниваю DeepSeek и Gemini на генерации подземелий и NPC

· Владислав Новиков

ДнД-бот на разных нейросетях: сравниваю DeepSeek и Gemini на генерации подземелий и NPC

Нейросети для DnD отличаются не брендом бота, а тем, какая модель делает какую работу внутри хода: дешёвая разбирает намерение игрока, средняя держит сцену, дорогая - рассказывает историю. На A/B из 30 ходов DeepSeek V4 Flash обыграл Gemini 2.5 Flash Lite по канону и грубым ошибкам, хотя Gemini вдвое быстрее и дешевле.

Чем нейросети для DnD отличаются друг от друга в подходе к генерации

Не брендом бота и не громкостью маркетинга. Разница - в том, какая модель отвечает за какой кусок хода: одна разбирает, что вообще хочет игрок, вторая держит сцену и подземелье, третья рассказывает историю. ДнД-бот у меня внутри гоняет три разные нейросети на один ход, и от того, какую модель поставить на какую роль, зависит, забудет ли мастер, что дверь уже открыта, или начнёт раздавать квесты, которых не было.

Я сам первое время выбирал модель по общему ощущению “умная - не умная”, и почти влетел на этом дважды: один раз чуть не поставил на роль режиссёра сцены модель, которая красиво пишет, но плохо помнит, что произошло два хода назад. Спасло только то, что я прогнал её через тот же A/B, что и остальных, а не поверил на слово рекламным описаниям.

Три модели на один ход: почему одной нейросети мало

Если сгрузить весь ход на одну модель - даже дорогую и умную - она путает роли: пока думает над репликой NPC, забывает свериться с тем, что вообще произошло в сцене. Поэтому ход разбит на три задачи с тремя разными моделями под них: дешёвая и быстрая разбирает намерение игрока и отбирает нужные факты из памяти мира, средняя работает режиссёром сцены - решает, что происходит и какие правила применяются, а дорогая - по тарифу самого игрока - пишет текст, который он читает. Три роли, три бюджета, и это не распил ради экономии, а разделение труда: у режиссёра сцены и у рассказчика истории просто разные задачи, и хорошая модель для одной не обязана быть хорошей для другой.

Из сравнения ИИ-мастеров на русском видно, что разные боты выбирают эту архитектуру по-разному - кто-то гонит всё через одну модель, кто-то тоже делит роли. Разница в подходе к генерации подземелий и NPC начинается именно здесь, до всякого сравнения конкретных моделей.

Какая нейросеть лучше держит подземелья и NPC: DeepSeek или Gemini

На A/B из 30 реальных ходов, собранных из 29 кампаний, DeepSeek V4 Flash обыграл Gemini 2.5 Flash Lite на роли режиссёра сцены: 8.70 балла против 7.93 по качеству ведения канона и 3 грубые ошибки против 9. При этом Gemini вдвое быстрее и на 37% дешевле - по чистой скорости и цене она выглядит выгоднее.

Дьявол - в том, какие именно ошибки допускала проигравшая модель. Дело не в среднем балле, а в том, куда именно модель ошибается.

Почему профиль ошибок опаснее, чем средний балл

Проигравшая модель ошибалась не как попало, а систематически в одну сторону - в сторону игрока: убивала NPC по первой заявке, переписывала результат броска движка и авансом закрывала квесты, которые ещё даже не начались наполовину. Для мастера подземелий это страшнее, чем случайная опечатка в описании комнаты - игрок быстро замечает, что мир прогибается под любое требование, и доверие к ведущему улетучивается.

Разница между 8.70 и 7.93 звучит незначительно. Но за этой десятой доли балла прячется разница между “модель иногда путается в деталях” и “модель обманывает игрока в его же пользу” - а это ломает саму механику испытания, ради которой все сидят за столом.

На что смотреть при выборе нейросети для DnD: кэш и JSON-схемы

Кэш промптов у провайдеров живёт по-разному, и это меняет расклад сильнее, чем сравнение сырых цен за токен. DeepSeek держит 98-100% попаданий в кэш на паузах между запросами до 15 минут. У одного из хостов Gemini кэш живёт секунды - а на проде он и вовсе протухал между ходами игроков: 0.6% попаданий вместо подтверждённых 78% на мгновенном повторе того же промпта. Разница на бумаге и разница в реальном трафике - это два разных числа, и ориентироваться нужно на второе.

Ещё один момент, который не виден в документации, пока не столкнёшься сам: DeepSeek не поддерживает строгие JSON-схемы для структурированного ответа. Пришлось делать “мягкий” режим - описание полей уезжает в конец промпта, а форму ответа проверяет свой код после генерации. Замер показал: это решение на порядок дешевле и в полтора раза быстрее строгой схемы у конкурентов, но требует лишнего слоя валидации, который иначе был бы не нужен. О том, как эта экономия отразилась на итоговой цене хода, я уже писал в разборе про цену хода ИИ-мастера DnD.

По внешним бенчмаркам DeepSeek V4 Flash и Gemini 3.6 Flash тоже не выигрывают друг у друга везде одинаково: на SWE-bench (Vals) DeepSeek набирает 88.8% против 79.6% у Gemini, а на MMLU-Pro расклад обратный - 89.3% у Gemini против 86.2% у DeepSeek (по данным сравнения orcarouter.ai и benchlm.ai, 2026 год). Для задачи “сгенерировать подземелье и не наврать про канон” ни один из этих бенчмарков не проверяет напрямую то, что важно за столом - поэтому свой A/B на реальных ходах кампании и оказывается надёжнее чужих таблиц.

Тарифы и очереди: подводные камни, которых не видно в прайс-листе

Одна и та же модель Google продаётся тремя ступенями обслуживания. Тариф flex вдвое дешевле стандарта - и у AI Studio без потери скорости. А у Vertex тот же flex-тариф в очереди растягивал вызов до 75 секунд. Это значит, что решение “взять подешевле” без проверки конкретного хостинга модели может обернуться тем, что игрок будет ждать ответ мастера почти полторы минуты - дольше, чем сама пауза между его ходами. На бумаге flex и стандарт - одна и та же модель по паспорту, а по факту это два разных продукта, и сравнивать их нужно по своему трафику, а не по строчке в прайс-листе.

Кстати про паузы: у меня в проде медианная пауза между ходами игроков - 99 секунд, а 97% пар ходов укладываются в 30 минут. Это значит, что кэш промптов реально экономит только тогда, когда живёт от 5 минут и дольше - более короткий кэш просто не успевает сработать при обычном темпе игры. Разница в 13 раз между тем, что показывал счётчик токенов, и тем, во сколько на самом деле обходился ход, - отдельная история, я писал о ней в материале про то, сколько на самом деле стоит ход ИИ-мастера.

По части мультимодальности Gemini умеет принимать на вход изображения, аудио и видео, а DeepSeek V4 Flash - только текст. Для генерации подземелий и NPC в текстовом чате это не критично, но если бот когда-нибудь начнёт разбирать скриншоты карты боя от игрока - выбор моделей снова сдвинется.

Что в итоге проверять, если выбираешь нейросеть для своего ИИ-мастера

Сводка того, на что реально стоит смотреть, а не только на цену за токен в прайс-листе:

Про то, что ИИ-мастер сам генерирует в подземелье, а что до сих пор доделывают руками, я разбирал отдельно - там же видно, где у любой из этих моделей упираются границы того, что нейросеть пока не решает сама. А проверить обе модели на своей кампании можно прямо в ДнД-боте в Telegram - сравнить, как разные подходы к генерации подземелий и NPC ощущаются не в таблице бенчмарков, а за реальным столом.

Частые вопросы

Можно ли просто взять топовую нейросеть и не думать про архитектуру?

Нет - даже дорогая модель без разделения ролей путает намерение игрока со сценой. ДнД-боту важнее конвейер из нескольких моделей, чем одна универсальная, даже мощная.

Почему более дешёвая модель может генерировать подземелья лучше дорогой?

Дело не в цене, а в профиле ошибок: модель, которая реже переписывает результат движка и бережнее относится к канону, держит подземелья и NPC надёжнее - даже если формально не самая мощная по бенчмаркам.

Влияет ли кэширование промптов на выбор нейросети для DnD-бота?

Да, сильно: если кэш живёт секунды, а не минуты, экономия на цене хода исчезает - окупается только кэш с временем жизни от нескольких минут при типичных паузах игроков между ходами.

Как готовился материал: черновик собирает мой ИИ-конвейер по темам из практики таверны, факты сверяются с первоисточниками и правилами, финальную версию я читаю и правлю руками перед публикацией. Обложку тоже рисует нейросеть. Про кухню — на странице о проекте.