← Модуль 11/World models
EN
Модуль 11 · Современный фронтир

World models

Нейросеть, которая не рендерит мир по ассетам, а генерирует его покадрово в ответ на действия. Research-фронтир, не прод.
конспект~15 мин
Суть за 20 секунд
World model — это видеомодель, обученная предсказывать следующий кадр, обусловленный действием игрока. Скармливаешь нажатия — она «продолжает» интерактивный мир, которого нет ни в каких ассетах. К 2026 это умеют Genie 3 (DeepMind, авг 2025: реал-тайм ~24 fps, 720p, связность «минуты»), Muse/WHAM (Microsoft, фев 2025, обучена на Bleeding Edge, опубликована в Nature) и стартапы вроде Decart (Oasis → Lucy). Это «нейро-движок»: впечатляет, но без устойчивого состояния, детерминизма и точной управляемости — пока демо, не игра.

Что это делает

Классический движок: ассеты + физика + код → рендер кадра. World model выкидывает всё это: один нейросетевой forward-pass, обусловленный историей и текущим действием, выдаёт следующий кадр. Мир «живёт» в весах модели. Обучают на огромных объёмах геймплея (Muse — на ~7 годах матчей Bleeding Edge). Ключевые вехи:

МодельКто / когдаЧто показала
Genie 3Google DeepMind, авг 2025Реал-тайм навигация по генерируемому 3D-миру, ~24 fps / 720p, связность ~минуты; «Project Genie» открыт подписчикам AI Ultra (фев 2026, research-only)
Muse / WHAMMicrosoft, фев 2025World-and-Human-Action Model (WHAM-1.6B), обучена на >7 годах матчей Bleeding Edge, ~1 fps — статья в Nature. Позже WHAMM! (апр 2025, MaskGIT ~500M+250M) — >10 fps на 640×360, играбельный Quake II в браузере, обучен на ~1 неделе данных тестировщиков
Oasis → LucyDecart, 2024–25Реал-тайм интерактивная генеративная видео-модель / трансформация видео

🕹 В какие игры поиграть — и что заметить

Строго это демо, а не игры — но именно «пощупать» лучше всего показывает и магию, и потолок. От браузерного, в которое можно играть прямо сейчас, до research-превью, на которое пока только смотрят. Главное наблюдение везде одно: где распадается связность.

Oasis Decart + Etched · браузер, играбельно

Самое доступное: diffusion-transformer, обученный на видео Minecraft, принимает клавиши/мышь и генерирует каждый кадр авторегрессивно — без движка, ассетов и кода игры. Веса 500M открыты (HuggingFace Etched/oasis-500m); браузерное демо ~360p — это облачный стрим (генерация на серверном GPU, своего топ-железа не нужно), а веса можно гонять и локально на consumer-GPU. Понимает постройку, свет, инвентарь — но всё это «галлюцинация по кадрам».

🎮 Сыграй: открой демо Oasis в браузере, копни блок, отвернись и посмотри назад — мир ре-семплируется, ямы нет. Поднимись/опустись взглядом несколько раз — биом «поплывёт». Засеки, через сколько секунд связность рвётся: это накопление ошибки руками.

Muse / WHAMM Microsoft · браузер, Quake II

Линия Microsoft в два шага. WHAM (World-and-Human-Action Model) обучен на >7 годах матчей Bleeding Edge, опубликован в Nature (фев 2025) — но это ~1 fps. Затем WHAMM! (апр 2025) сменил авторегрессию на MaskGIT (генерит токены всего кадра разом, потом маскирует и уточняет) → >10 fps на 640×360 и играбельный Quake II в браузере, обучен всего на ~1 неделе данных тестировщиков на одном уровне. Тот же класс, другой движок-донор и другая архитектура декодирования.

🎮 Сыграй: запусти демо WHAMM!, постреляй и подвигайся — заметь низкий fps и «жидкие» стены, которые меняют геометрию при возврате. Сравни ощущение с настоящим Quake II: вот цена «нейро-движка» против растеризации.

Genie 3 DeepMind · research-превью, смотреть

Самое мощное и наименее доступное: реал-тайм навигация по генерируемому 3D-миру с текстового промпта, ~24 fps / 720p, связность «минуты» (анонс авг 2025). «Project Genie» приоткрыт подписчикам AI Ultra (фев 2026), но это research-only, не продукт.

🎮 Посмотри: разбери официальные ролики Genie 3 покадрово — ищи момент, где объект уезжает из кадра и возвращается другим (нет устойчивого состояния), и оцени, на сколько секунд держится когерентность. Это верхняя планка 2026-го — и её предел.

Хардкор: авторегрессия, накопление ошибки и почему связность распадаетсяможно пропустить

Модель параметризует

p(x_t | x_<t, a_<t)

и генерирует роллаутом: скармливает собственные выходы обратно на вход.

Exposure bias / накопление ошибки

Обучали на истинной истории (teacher forcing), а на инференсе модель обусловливается на собственных (неидеальных) кадрах → distribution shift. Пошаговая ошибка ε не гасится, а копится: в наивном имитационном пределе расхождение растёт как ~O(ε·T²) по горизонту T (анализ DAgger), против O(ε·T) при on-policy-коррекции. Это математическая причина, почему когерентность держится «минуты», а не часы.

Два разных смысла «world model»

  • Генеративно-видео (Genie, Muse): p(кадр | история, действие) в пиксельном пространстве — цель реализм/играбельность.
  • Model-based RL (Ha & Schmidhuber 2018 «World Models»; Dreamer): латентная модель динамики для планирования/воображения — цель полезность для управления, не красота кадра.

Почему устойчивое состояние — не «добавить память»

У чистой авторегрессионной видео-модели нет явного хранилища состояния: «память» живёт в конечном окне контекста. Факты вне окна не представлены → вернулся на место, и оно ре-семплируется заново. Устойчивость требует явной структуры состояния (гибрид с симуляцией/БД), а не просто длиннее контекст.

Хардкор · экономика и инфра: почему это пока не для шипаможно пропустить

Помимо несвязности — прозаичные блокеры:

  • Стоимость кадра: нейросетевая генерация кадра на порядки дороже растеризации — гонять 60 раз/сек на каждого игрока экономически абсурдно сегодня (датацентр-GPU на сессию).
  • Латентность и инфра: реал-тайм-инференс требует дорогого железа близко к игроку; на consumer-GPU — компромисс по качеству/fps.
  • Дизайн-вопрос: какому жанру вообще нужен непостоянный, не-авторский мир? Пока это инструмент прототипа/ресёрча и «нейро-моддинга», а не продукт — бизнес-кейс не закрыт.
Аналогия
Обычный движок — это кукольный театр: декорации, куклы, верёвочки заранее сделаны, код дёргает их. World model — это художник, который дорисовывает следующий кадр сна по твоему действию. Пока ты идёшь вперёд — коридор «придумывается» на лету. Отвернулся и вернулся — а стена уже другая: у сна нет устойчивой памяти. В этом и магия, и главный недостаток.
Почему это важно
Это потенциальная смена парадигмы рендеринга — мир без ассет-пайплайна. Но для инженера в 2026 ценность — трезвая оценка: это прорыв в исследованиях и инструмент прототипирования/«нейро-моддинга», а не способ сделать вашу игру. Знать, что умеют Genie 3 / Muse, и чего они ещё не умеют — часть профессиональной картины фронтира.

Чего пока нет

🔁 За пределами игр — куда это переносится
Главный механизм — авторегрессия и накопление ошибки (exposure bias), и различие «генеративная модель ≠ симулятор с состоянием». Переносится прямо в ML:

ML / AI: то же накопление ошибки в любом авторегрессионном роллауте — длинная генерация LLM «дрейфует»; teacher forcing vs free-running; почему DAgger чинит O(εT²)→O(εT). World models в model-based RL (Dreamer) = «воображаемый» симулятор для планирования.

Робототехника / контроль: sim-to-real и compounding error в предсказании динамики — та же проблема горизонта.

Принцип: ошибка на шаг копится по горизонту; «правдоподобно выглядит» ≠ «имеет устойчивое состояние» — общий предел генеративных моделей.

🔧 Запусти и поковыряй — на домашнем компе
Во что поиграть/посмотреть — выше (🕹). Здесь — залезть в саму модель:
🔧 Поковырять (debug) ~1 ч, Python + GPU
Подними open-oasis локально (репо etched-ai/open-oasis + веса Etched/oasis-500m, нужен GPU). Скорми свою последовательность действий и посмотри роллаут покадрово. Урежь окно контекста в инференс-скрипте — связность рвётся раньше (вот зависимость горизонта от окна). Заморозь ввод на одном кадре — увидишь, как модель всё равно «дорисовывает» дрейф.
🧪 Потестить (глазами QA) ~15 мин
Замерь горизонт когерентности: секунды/кадры до развала мира в Oasis или WHAMM!. Прогони тест «отвернулся-вернулся» — фиксируется ли состояние (нет). Сравни fps с настоящим Minecraft/Quake II — почувствуй цену генерации кадра нейросетью против растеризации.
Чеклист: запустил open-oasis локально; укоротил контекст и увидел более ранний развал; замерил горизонт когерентности в секундах; подтвердил «отвернулся → мир другой».
Связи
основа
LLM-NPC — та же линия «ML генерит контент»; LLM генерит диалог, world model — пиксели мира.
контраст
Классика vs ML — world model — крайняя точка «ML для контента»: даже сам кадр сгенерирован, а не отрисован движком.
Вопросы пытливого ума
Почему связность распадается именно «через минуты» — математически?
Авторегрессионный роллаут кормит модель её же выходами: ошибка на шаг не гасится, а копится (exposure bias / distribution shift). В наивном пределе расхождение растёт ~квадратично по горизонту (анализ DAgger), плюс факты вне окна контекста теряются. Отсюда «минуты когерентности», а не часы — см. хардкор выше.
Чем world model у Genie отличается от world model в Dreamer/Ha-Schmidhuber?
Разные цели. Genie/Muse — генеративно-видео p(кадр|история,действие), оптимизируют реализм/играбельность. Dreamer и «World Models» (2018) — латентная модель динамики для планирования (агент «воображает» траектории и учится в них). Первое — смотреть/играть, второе — управлять. Слово одно, задачи разные.
Что нужно для устойчивого состояния и почему это не «просто добавить память»?
Чистая видео-модель держит «память» только в окне контекста — вне его мир ре-семплируется. Устойчивость требует явного представления состояния (структура/симуляция/БД), которое модель обязана соблюдать, — то есть гибрид с классическим движком. Это другая архитектура, а не «длиннее контекст».
Чем это вообще отличается от Sora и видео-генерации?
Ключевое — обусловленность действием в реальном времени: модель предсказывает следующий кадр в ответ на твой ввод сейчас, а не рендерит готовый клип. Именно интерактивная обусловленность превращает видео-модель в (квази-)играбельную среду.
Что почитать / посмотреть