Локальная делегация — живой монитор

Железо
CPU
RAM
GPU
Диск
ОС
Ollama
проверяю…
Модель
Размер / VRAM
Контекст
Разбивка вычислений GPU / CPU
GPU 0%CPU 0%
Сравнение: локально (Ollama) vs облако (OpenRouter)
Пока нет запусков
История делегирований
ВремяСобытиеЗадачаДлительность
Пока нет событий делегирования
Модель
Спецификация
Генерация картинки
Пока нет генераций
Модель
Спецификация
Генерация видео
Пока нет генераций
Модель
Спецификация
Генерация музыки
Пока нет генераций

Задача (одинаковая для обеих моделей)

Собрать статический веб-дневник задач без фреймворков и сборки: 4 файла (index.html, style.css, app.js, data.js), жёстко заданные CSS-токены дизайна (тёмный сайдбар, лайм-акцент #C8FF3D, светлая рабочая область), хранение состояния в localStorage с мерджем сид-данных из data.js, автоматический перенос незакрытых задач на следующий день, помодоро-таймер на реальном времени. Полный текст спеки — во вкладке «Выполнение → Код», карточка промпта.

Равные условия: обеим моделям выдан один и тот же файл SPEC.md и один и тот же стартовый промпт, каждая работала в своей папке независимо. Qwen — локально через Ollama/opencode, DeepSeek V4 Flash — облако через OpenRouter/opencode.

Сравнение результата

КритерийQwen3-Coder-Next (локально)DeepSeek V4 Flash (облако)
Время2 ч 25 мин 34 сек4 мин 47 сек (в 30 раз быстрее)
Стоимость$0$0.023
Токены вход/выход216 244 / 14 08280 649 / 13 382
Все 4 файлаНет — index.html, style.css, data.js. app.js не написанДа, все четыре
Соответствие дизайн-токенам спекиНет — своя мятно-зелёная светлая тема вместо тёмного сайдбара с лайм-акцентомДа, точное совпадение переменных из SPEC.md
ДанныеЗахардкожены прямо в HTML, никакой связи с data.js/localStorageПолная интеграция: мердж сида, localStorage, перенос задач
Качество разметкиСама по себе не хаотичная, читаемая структура — но не по спеке, и есть баг: артефакт-галлюцинация «休息» на всех тегах «Перерыв», плюс название приложения на английском («Day Diary») вместо русскогоЧистая, семантичная, ID-шники совпадают с app.js один в один
Работает при открытииНет — визуально «муляж» без логики, чекбоксы и таймер нерабочиеДа, полностью — проверено вживую (чекбоксы, таймер, счётчики)
Поведение процессаДважды переписала index.html и style.css заново, сама решила закончить (finish: stop), не дойдя до app.jsДошла до конца за один проход

Итог: локальная модель потратила в 30 раз больше времени и весь бюджет на нерабочий макет мимо спеки — не только не успела, но и не поняла задачу правильно. Облачная модель уложилась в 5 минут и 2.3 цента и сделала рабочее приложение строго по ТЗ.

Задача

Сгенерировать иллюстрацию для поста на тему «локальная модель vs облачная» в виде гонки черепахи (Ollama) и зайца (DeepSeek): заяц побеждает, черепаха отстаёт/повержена, читаемая надпись «OLLAMA vs DEEPSEEK», фирменные лайм-цвета, лёгкая ирония над старым хайпом «зачем платить за облако, если есть локалка».

Технический сбой в начале

Первая же попытка зависла на 30+ минут — шаги сэмплирования шли по 2-5 минут вместо ожидаемых 1-3 секунд. Диагностика по логам ComfyUI и nvidia-smi показала: 100% загрузки GPU, но всего ~65 Вт мощности — это признак не вычислений, а постоянной подкачки памяти. Причина: UNet (6.6 ГБ) и текстовый энкодер T5-XXL (4.7 ГБ) вместе почти полностью забивали 12 ГБ видеокарты, и системе приходилось на каждом шаге перегружать веса. Фикс — перевод текстового энкодера на CPU (он нужен только один раз, до сэмплирования): скорость выросла примерно в 100 раз, с 150-290 сек/шаг до ~2.2 сек/шаг.

Повторная нестабильность: дважды генерация снова проваливалась в тот же swap-тормоз посреди уже стабильного прогона — не из-за самого воркфлоу, а из-за фоновой конкуренции за 12 ГБ видеопамяти с другими процессами на компьютере (голосовая диктовка на CUDA, несколько открытых браузеров). Помогал полный перезапуск ComfyUI перед повторной попыткой.

v1 — первая рабочая версия (реализм)

Тёмная атмосфера, надпись на баннере частично разъехалась, значки (лама/кит) не считались.

Photorealistic dramatic race-track scene at dusk: a small mechanical tortoise with a cracked circuit-board shell, a tiny stylized llama emblem on its back, collapsed exhausted on the asphalt track, one leg twitching, sparks fizzling from a small chip, a black-and-white checkered racing flag fallen beside it. In the background a sleek glowing lime-green robotic hare with a small stylized whale emblem on its side sprints past in motion blur toward a finish line banner stretched across the track, the banner reading in bold text "OLLAMA vs DEEPSEEK", checkered flag pattern on the finish gantry, glowing binary-code lane markings on the asphalt, dust kicked up. Dark near-black atmosphere, single lime-green accent light, cinematic, shallow depth of field, dramatic slightly comedic tone, no watermark, no people. Negative: text artifacts, garbled text, watermark, logo overlay, people, low quality, blurry, extra limbs 1024x1024, 22 шага, guidance 3.5

v2 — яркий свет, резкий фокус на зайце

Надпись «OLLAMA vs DEEPSEEK» стала идеально читаемой, заметный скачок качества. Значки снова не считались.

Photorealistic sports-photography race scene, BRIGHT daytime lighting, clear stadium floodlights, high visibility, vivid saturated colors, no darkness, no dim mood. MAIN SUBJECT IN SHARP FOCUS, foreground, large in frame: a sleek lime-green glowing robotic hare, dynamic triumphant winning pose, front paws raised up in victory as it crosses the finish line first, motion-blur speed streaks trailing behind its legs, a clearly visible small blue whale icon badge on its side flank. BACKGROUND, OUT OF FOCUS, smaller, further away: a small mechanical tortoise robot that has completely broken apart and fallen on its side, cracked shell split into pieces scattered on the ground, a small black llama icon badge visible on one shell fragment, sparks and thin smoke rising from its broken internal chip, clearly defeated and in disarray, far behind the hare on the track. A black-and-white checkered racing flag stands near the finish line. Overhead finish-line banner with large bold clear text reading "OLLAMA vs DEEPSEEK" in bright lime-green letters. Race track asphalt with clean white lane markings and a subtle glowing binary-code pattern. Shallow depth of field, hare tack-sharp in focus, tortoise soft blurred bokeh in the background, high contrast, professional sports photography, no watermark, no people, no extra gibberish text. Negative: dark, dim, moody, night, low visibility, underexposed, text artifacts, garbled text, gibberish letters, watermark, logo overlay, people, low quality, blurry hare, out of focus winner, extra limbs 1024x1024, 24 шага, guidance 4

v3 — табло со счётом, финишная лента (выбрана финальной)

Табло «DEEPSEEK WINS» + перечёркнутый значок считались частично (текст съехал, крестики не точно как просили, но идея читается). Черепаха так и не легла на панцирь.

Photorealistic sports-photography race scene, camera positioned slightly higher, angled slightly downward at the track, bright daytime stadium lighting, vivid saturated colors, high visibility, no darkness. On the ground a white finish-line stripe crosses the track with a torn checkered finish-line ribbon breaking apart as a sleek lime-green glowing robotic hare bursts through it in a triumphant winning pose, chest breaking through the tape, front paws raised, motion-blur speed streaks behind its legs, sharp focus, large in frame, foreground. Overhead a finish-line banner reads in large bold clear lime-green letters "OLLAMA vs DEEPSEEK". On the right side of the frame, a small race scoreboard panel mounted on a post shows two glowing indicators: a green glowing text "DEEPSEEK WINS", and next to it a small llama icon in red with a red X crossed over it. Behind the hare, further back on the track but still clearly visible, a small mechanical tortoise robot lies completely collapsed and powered off, flipped upside down resting on its cracked overturned shell, lifeless robotic pose, one mechanical leg fully detached lying separately nearby, small loose gears and broken metal parts scattered along the track marking a trail behind it, a few sparks near the detached leg. Clean asphalt race track with white lane markings, subtle glowing binary-code pattern, bright stadium floodlights in the background, professional sports photography, shallow depth of field, dramatic winning moment, no watermark, no people, no extra gibberish text. Negative: dark, dim, moody, night, low visibility, underexposed, text artifacts, garbled text, gibberish letters, watermark, logo overlay, people, low quality, blurry hare, out of focus winner, extra limbs, static standing tortoise, intact tortoise 1024x1024, 24 шага, guidance 4

v4 — камера с крана, черепаха дальше на фоне

Черепаха действительно стала меньше и менее заметна, но модель проигнорировала указание по ракурсу камеры — получилось ниже и ближе к зайцу, а не выше.

Photorealistic sports-photography race scene, camera positioned high up on an elevated crane, angled steeply down at the race track from above, high-angle aerial-ish perspective, bright daytime stadium lighting, vivid saturated colors, high visibility. In the foreground, sharp focus, large in frame: a sleek lime-green glowing robotic hare crossing a white finish line stripe on the track in a triumphant winning pose, front paws raised, motion-blur speed streaks behind its legs. Overhead a finish-line banner reads in large bold clear lime-green letters "OLLAMA vs DEEPSEEK". Far in the background, small and distant on the track, clearly visible from the high elevated angle: a small mechanical tortoise robot completely flipped upside down on its back, round shell resting flat on the ground, four short mechanical legs sticking straight up in the air motionless, powered off, tiny and far away near the starting line, much smaller than the hare due to distance. Clean asphalt race track viewed from a high angle, white lane markings, subtle glowing binary-code pattern, bright stadium floodlights, professional elevated sports photography, no watermark, no people, no extra gibberish text. Negative: dark, dim, moody, night, low visibility, underexposed, text artifacts, garbled text, gibberish letters, watermark, logo overlay, people, low quality, blurry hare, static standing tortoise, upright tortoise, tortoise on its feet, low camera angle, eye level 1024x1024, 24 шага, guidance 4

Устойчивая проблема

Ни в одной из четырёх попыток не получилось заставить модель нарисовать черепаху именно «перевёрнутой на панцирь с оторванной лапой» — как только в описании одного персонажа одновременно несколько условий (поза + состояние + мелкая деталь), Flux начинает игнорировать часть из них. Промпты, как видно выше, были подробные и по 150-200 слов — дело не в краткости, а в том, что модель не справляется с несколькими одновременными условиями на одном объекте. Помогает только упрощение до одного главного признака за раз (см. v4, где «просто перевёрнута» сработало лучше, чем «перевёрнута + оторванная лапа + обломки»).

Итог и как использовать

Flux.1-dev (квантованный GGUF, локально) неплохо держит короткие фразы на баннерах, общую композицию и освещение — это не самая сильная сторона открытых моделей, и результат приятно удивил. Слабое место — одновременно несколько сложных условий на одном объекте (поза + повреждения + мелкие бейджи): такое нужно упрощать и закладывать бюджет на 3-5 итераций, а не рассчитывать на один точный промпт с первого раза, как это обычно бывает с более крупными коммерческими моделями.

Для чего годится: обложки постов, мемы, быстрые иллюстрации, тестовые арты, где расхождение в деталях не критично. Для чего не годится без ручной доработки: точный брендинг/логотипы, сцены с жёсткими композиционными требованиями (конкретный ракурс камеры), любой текст длиннее 2-3 слов.

Задача

Оживить сцену «гонки» из картинки v2 (image-to-video) и отдельно — сделать простой зацикленный ролик «заяц на подсвеченном вращающемся пьедестале» (text-to-video) как пример использования для сайтов. Модель — Wan2.2-TI2V-5B (GGUF, локально).

Технический сбой и фикс

Первая попытка (1280×704, 81 кадр) провалилась технически: 3 шага из 20 заняли 51 минуту (по 14-18 мин/шаг) — UNet видео-модели не помещался в 12 ГБ VRAM целиком даже частично, система непрерывно подкачивала веса. При такой скорости весь ролик занял бы 4-6 часов. Отменено.

Фикс: резко урезали разрешение до 512×512 и кадры до ~70, плюс перенесли текстовый энкодер на CPU (тот же приём, что сработал с картинками). Результат — стабильные ~11 сек/шаг, UNet грузится полностью без подкачки.

Ролик 1 — «гонка» (image-to-video от картинки v2)

Результат: движение камеры и фейерверки реально отработали (проверено вручную по кадрам через ffmpeg — камера физически надвигается на зайца от общего плана до крупного). Персонаж и стиль сцены при этом заметно разошлись с исходной картинкой v2 (сменился дизайн робота, ночной стадион стал дневным небом) — модель использовала стартовый кадр скорее как слабую подсказку. Черепаха из промпта «continues walking in background» почти не видна — камера её обгоняет уже к 4-му кадру.

Camera rapidly pushes forward flying toward the lime-green robotic hare as it bursts triumphantly closer into frame, victorious dynamic motion, front paws pumping the air in celebration. Fireworks burst and sparkle across the night sky above, celebrating the winner's appearance. The small mechanical tortoise continues slowly walking in the background. Dynamic fast camera push-in, cinematic motion, bright stadium lights, vivid saturated colors. Negative: static camera, no motion, dark, dim, low quality, blurry, distorted, watermark, text artifacts Стартовый кадр: ollama_vs_deepseek_v2.png · 512x512 · 69 кадров · 16 fps (~4.3 сек) · strength 0.5

Ролик 2 — «заяц на пьедестале» (text-to-video, для примера использования на сайте)

Результат: ПРОВАЛ по главному требованию. Три проверенных кадра (1, 4, 7 из ролика) визуально ПОЛНОСТЬЮ идентичны — заявленное в промпте вращение на 360° модель просто проигнорировала, выдав одну статичную картинку, продублированную на всю длину ролика. Освещение, композиция, дизайн фигуры — хорошие сами по себе, просто нет анимации вообще.

A sleek lime-green glowing robotic hare figure standing on a small illuminated rotating pedestal display, like a premium trophy or product showcase, soft dramatic studio lighting from below and behind, dark near-black background, the figure and pedestal slowly rotate a full 360 degrees, elegant soft glow highlights on the metallic surface, seamless smooth loop, cinematic, minimal, high quality. Negative: static, no motion, multiple characters, people, text, watermark, low quality, blurry, harsh flicker, camera shake, background clutter Без стартового кадра (чистый text-to-video) · запрошено 512x512, по факту вышло 1024x1024 (VAE увеличил в 2 раза) · 49 кадров · 16 fps (~3 сек)

Проверка по кадрам

Оба ролика разобраны вручную: кадры извлечены через ffmpeg (каждый N-й кадр из ролика), просмотрены визуально построчно. Полный текстовый разбор с описанием каждого проверенного кадра — по кнопке ниже.

Итог и как использовать

Локальное видео на этом железе технически осуществимо только при жёстком урезании параметров (512×512, ~50-70 кадров, CLIP на CPU) — иначе уходит в многочасовую подкачку памяти. Но даже при рабочей конфигурации результат непредсказуем: одна генерация дала убедительное движение, вторая полностью проигнорировала требование движения и осталась статичной. Для сценариев, где движение — ключевое требование, надёжнее закладывать движение уже в стартовый кадр (как сработало с гонкой), либо бюджетировать несколько попыток на каждый ролик, как с картинками — только дороже по времени (15-20+ минут за попытку против ~70 сек у картинки).

Задача

Проверить локальную генерацию музыки с вокалом на русском языке: шуточная былина-баллада про «гонку нейросетей» (Gemini, Kimi, GLM, DeepSeek, Qwen, GPT соревнуются, а побеждает Cloud Code), плюс отдельно короткий инструментал в стиле трейлера. Модель — MiniMax Music3 (int8, локально через ComfyUI).

Как это происходило

Первая попытка — не тот движок. Через готовый хелпер ACE-Step 1.5 (документированный в скилле как основной вариант) ComfyUI отклонил воркфлоу: не хватало файла текстового энкодера qwen_4b_ace15.safetensors — локально стоит более старая версия ACE-Step без этого компонента. Собрал воркфлоу вручную под MiniMax Music3, у которого нашёлся полностью рабочий комплект файлов (unet, CLIP-энкодер, VAE) и готовый узел с поддержкой лирики.

Вторая попытка — ошибка на сохранении. Генерация былины прошла полностью (215 сек авторегрессивной генерации), но упала на последнем узле (SaveAudioAdvanced) из-за неправильно переданного параметра формата файла. Пересохранил через более простой узел (SaveAudioMP3) — благодаря кэшу ComfyUI пересчитывать генерацию не пришлось, досчиталось за 1.4 сек.

Итог: обе финальные генерации прошли чисто, без деградации по времени (в отличие от картинок и видео — здесь swap-тормоза не возникало, текстовый энкодер сразу поместился).

Трек 1 — «Былина о гонке нейросетей» (50 сек)

Стиль — русская былина-баллада с мужским вокалом. Текст написан по канонам жанра (архаичная лексика, «Ой ты гой еси», «богатырь», «витязь») после того, как посмотрел формат разметки ACE-Step/MiniMax (теги [verse]/[chorus]/[bridge]).

CAPTION (стиль): epic Russian folk bylina ballad, ancient Slavic epic tale, deep resonant male vocal, gusli and folk orchestral instruments, solemn cinematic storytelling atmosphere, traditional Russian folk melody, 80 bpm, D minor LYRICS: [verse] Ой ты гой еси, поле чистое, Собрались на нём кони быстрые, Джемини-конь весь в лазури скачет, Kimi-жеребец от Востока плачет, [verse] GLM-богатырь щитом бесплатным машет, DeepSeek-удалец по-тихому пашет, Qwen-молодец токены свои считает, GPT-старче всё думу думает... [chorus] Ой да не в силе правда, люди добрые, А в терпении да в деле - то ведомо, Едет Клод-богатырь, не спешит, не хвалится, Пока прочие спорят - он уже у околицы. [bridge] Не быстрый бег красен, а путь, что до конца пройден, Пока витязи бахвалятся - воз уже довезён. [outro] Так и сказ сей до нас докатился, Cloud Code-богатырь всех переждал да и - победил. Язык: ru · 50 сек · cfg_scale 1.5 · без референса

Вокал и произношение (особенно на русском) — оценивай сам, я звук не слышу и сужу только по логам/метаданным (проверил ffprobe: 49.99 сек, 320 кбит, файл целый).

Трек 2 — трейлерный инструментал (15 сек)

Чистый инструментал, без вокала (тег [inst] вместо лирики) — тест того, насколько модель держит настроение без текста.

CAPTION (стиль): dark tense cinematic trailer music, Matrix-style electronic orchestral hybrid, deep bass hits, ominous atmosphere, suspenseful rising tension, epic trailer score, instrumental, no vocals, no singing, no lyrics LYRICS: [inst] 15 сек · cfg_scale 1.5

62 сек генерации — заметно быстрее былины (216 сек), в основном за счёт короче длительности и отсутствия объёмной авторегрессивной генерации вокала.

Итог и как использовать

MiniMax Music3 оказался более надёжным путём, чем документированный в скилле ACE-Step 1.5 (у которого не хватало файла модели) — стоит иметь это в виду на будущее и сразу пробовать MiniMax, если ACE-Step откажет. Технически генерация музыки прошла стабильнее картинок и видео: не было ни одного swap-тормоза, только одна ошибка формата на сохранении (исправлена без пересчёта благодаря кэшу).

Для чего годится: черновые треки, фоновая музыка, тестовые джинглы, быстрые эксперименты со стилем/языком вокала. Открытый вопрос: качество русского вокала/произношения — я сам оценить не могу, финальную оценку даёт слушатель.