World models
Что это делает
Классический движок: ассеты + физика + код → рендер кадра. World model выкидывает всё это: один нейросетевой forward-pass, обусловленный историей и текущим действием, выдаёт следующий кадр. Мир «живёт» в весах модели. Обучают на огромных объёмах геймплея (Muse — на ~7 годах матчей Bleeding Edge). Ключевые вехи:
| Модель | Кто / когда | Что показала |
|---|---|---|
| Genie 3 | Google DeepMind, авг 2025 | Реал-тайм навигация по генерируемому 3D-миру, ~24 fps / 720p, связность ~минуты; «Project Genie» открыт подписчикам AI Ultra (фев 2026, research-only) |
| Muse / WHAM | Microsoft, фев 2025 | World-and-Human-Action Model (WHAM-1.6B), обучена на >7 годах матчей Bleeding Edge, ~1 fps — статья в Nature. Позже WHAMM! (апр 2025, MaskGIT ~500M+250M) — >10 fps на 640×360, играбельный Quake II в браузере, обучен на ~1 неделе данных тестировщиков |
| Oasis → Lucy | Decart, 2024–25 | Реал-тайм интерактивная генеративная видео-модель / трансформация видео |
🕹 В какие игры поиграть — и что заметить
Строго это демо, а не игры — но именно «пощупать» лучше всего показывает и магию, и потолок. От браузерного, в которое можно играть прямо сейчас, до research-превью, на которое пока только смотрят. Главное наблюдение везде одно: где распадается связность.
Самое доступное: diffusion-transformer, обученный на видео Minecraft, принимает клавиши/мышь и генерирует каждый кадр авторегрессивно — без движка, ассетов и кода игры. Веса 500M открыты (HuggingFace Etched/oasis-500m); браузерное демо ~360p — это облачный стрим (генерация на серверном GPU, своего топ-железа не нужно), а веса можно гонять и локально на consumer-GPU. Понимает постройку, свет, инвентарь — но всё это «галлюцинация по кадрам».
🎮 Сыграй: открой демо Oasis в браузере, копни блок, отвернись и посмотри назад — мир ре-семплируется, ямы нет. Поднимись/опустись взглядом несколько раз — биом «поплывёт». Засеки, через сколько секунд связность рвётся: это накопление ошибки руками.
Линия Microsoft в два шага. WHAM (World-and-Human-Action Model) обучен на >7 годах матчей Bleeding Edge, опубликован в Nature (фев 2025) — но это ~1 fps. Затем WHAMM! (апр 2025) сменил авторегрессию на MaskGIT (генерит токены всего кадра разом, потом маскирует и уточняет) → >10 fps на 640×360 и играбельный Quake II в браузере, обучен всего на ~1 неделе данных тестировщиков на одном уровне. Тот же класс, другой движок-донор и другая архитектура декодирования.
🎮 Сыграй: запусти демо WHAMM!, постреляй и подвигайся — заметь низкий fps и «жидкие» стены, которые меняют геометрию при возврате. Сравни ощущение с настоящим Quake II: вот цена «нейро-движка» против растеризации.
Самое мощное и наименее доступное: реал-тайм навигация по генерируемому 3D-миру с текстового промпта, ~24 fps / 720p, связность «минуты» (анонс авг 2025). «Project Genie» приоткрыт подписчикам AI Ultra (фев 2026), но это research-only, не продукт.
🎮 Посмотри: разбери официальные ролики Genie 3 покадрово — ищи момент, где объект уезжает из кадра и возвращается другим (нет устойчивого состояния), и оцени, на сколько секунд держится когерентность. Это верхняя планка 2026-го — и её предел.
Хардкор: авторегрессия, накопление ошибки и почему связность распадаетсяможно пропустить
Модель параметризует
и генерирует роллаутом: скармливает собственные выходы обратно на вход.
Exposure bias / накопление ошибки
Обучали на истинной истории (teacher forcing), а на инференсе модель обусловливается на собственных (неидеальных) кадрах → distribution shift. Пошаговая ошибка ε не гасится, а копится: в наивном имитационном пределе расхождение растёт как ~O(ε·T²) по горизонту T (анализ DAgger), против O(ε·T) при on-policy-коррекции. Это математическая причина, почему когерентность держится «минуты», а не часы.
Два разных смысла «world model»
- Генеративно-видео (Genie, Muse):
p(кадр | история, действие)в пиксельном пространстве — цель реализм/играбельность. - Model-based RL (Ha & Schmidhuber 2018 «World Models»; Dreamer): латентная модель динамики для планирования/воображения — цель полезность для управления, не красота кадра.
Почему устойчивое состояние — не «добавить память»
У чистой авторегрессионной видео-модели нет явного хранилища состояния: «память» живёт в конечном окне контекста. Факты вне окна не представлены → вернулся на место, и оно ре-семплируется заново. Устойчивость требует явной структуры состояния (гибрид с симуляцией/БД), а не просто длиннее контекст.
Хардкор · экономика и инфра: почему это пока не для шипаможно пропустить
Помимо несвязности — прозаичные блокеры:
- Стоимость кадра: нейросетевая генерация кадра на порядки дороже растеризации — гонять 60 раз/сек на каждого игрока экономически абсурдно сегодня (датацентр-GPU на сессию).
- Латентность и инфра: реал-тайм-инференс требует дорогого железа близко к игроку; на consumer-GPU — компромисс по качеству/fps.
- Дизайн-вопрос: какому жанру вообще нужен непостоянный, не-авторский мир? Пока это инструмент прототипа/ресёрча и «нейро-моддинга», а не продукт — бизнес-кейс не закрыт.
Чего пока нет
- Устойчивого состояния — мир не «помнит» себя дольше окна связности; вернулся — другое.
- Детерминизма и управляемости — дизайнер не может гарантировать «здесь будет дверь»; это не редактор уровней.
- Дешевизны — кадр от нейросети пока несопоставимо дороже растеризованного (числа — в хардкоре про экономику).
- Игровых правил — нет очков, инвентаря, побед/поражений как жёсткой логики; только «правдоподобное видео».
ML / AI: то же накопление ошибки в любом авторегрессионном роллауте — длинная генерация LLM «дрейфует»; teacher forcing vs free-running; почему DAgger чинит O(εT²)→O(εT). World models в model-based RL (Dreamer) = «воображаемый» симулятор для планирования.
Робототехника / контроль: sim-to-real и compounding error в предсказании динамики — та же проблема горизонта.
Принцип: ошибка на шаг копится по горизонту; «правдоподобно выглядит» ≠ «имеет устойчивое состояние» — общий предел генеративных моделей.
etched-ai/open-oasis + веса Etched/oasis-500m, нужен GPU). Скорми свою последовательность действий и посмотри роллаут покадрово. Урежь окно контекста в инференс-скрипте — связность рвётся раньше (вот зависимость горизонта от окна). Заморозь ввод на одном кадре — увидишь, как модель всё равно «дорисовывает» дрейф.Почему связность распадается именно «через минуты» — математически?
Чем world model у Genie отличается от world model в Dreamer/Ha-Schmidhuber?
p(кадр|история,действие), оптимизируют реализм/играбельность. Dreamer и «World Models» (2018) — латентная модель динамики для планирования (агент «воображает» траектории и учится в них). Первое — смотреть/играть, второе — управлять. Слово одно, задачи разные.Что нужно для устойчивого состояния и почему это не «просто добавить память»?
Чем это вообще отличается от Sora и видео-генерации?
- DeepMind, анонс и демо Genie 3 (авг 2025).
- Microsoft Research, Muse/WHAM — публикация в Nature (фев 2025) + демо WHAMM!.
- Модуль 11, раздел 5.5; смежно — 5.2 (генеративные агенты).