Telegram Web Link
SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing

Редактор картинок текстом от ByteDance

Авторы обнаружили, что разные шаги генерации играют разные роли в генерации изображений, независимо от промта. В частности, диффузионные модели фокусируются на (а) глобальном макете на ранних стадиях, (б) локальных атрибутах объекта на средних стадиях, (в) деталях изображения на поздних стадиях и (г) стиле изображения на всех стадиях выборки. Это вдохновило их на использование VLM. На схеме видно что ее используют вместо CLIP

Код

#imageediting
This media is not supported in your browser
VIEW IN TELEGRAM
Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play

Голосовая-языковая модель, позволяет выполнять разные задачи. Есть миллионы (что?) готовых голосов, можно делать свои. Можно переключать их на лету.

Да, это значит рилтайм, потоковоая генерация. Задержка 195мс - меньше чем среднее время реакции человека.

Знает 6 языков: Английский, китайский, французский, Немецкий, Японский и Корейский.

Придумали свой бенчмарк и побили в нем Moshi и SpeechGPT втрое 🤩

Код
Демо - видимо, еще не собрали

#tts #asr #stt #text2speech #speech2text #realtime #voicecloning
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
ACE-Step: A Step Towards Music Generation Foundation Model

Генератор музыки в опенсорсе, базовая модель, пригодная для дальнейшего файнтюна.

Мультиязычный, есть русский!
Помимо собственно генерации музыки по тексту, умеет делать вариации, смену пола вокалиста, замену слов, замену музыкальных фрагментов.

Обещают лоры с контролнетами, генерацию стемов (отдельных партий), вокал по готовому аккомпанементу

Звучит пока не очень, надеемся на пластичность в файнтюне

Код
Демо
Веса

#music #text2music #musicediting
This media is not supported in your browser
VIEW IN TELEGRAM
LTX VIDEO-13B

Выложили веса модели видеогенератора с 13B параметров
ltxv-13b-0.9.7-dev и
ltxv-13b-0.9.7-dev-fp8
FP8 должен завестись на 4090

HF
Гитхаб
ComfyUI
Попробовать на офсайте - притворитесь что вы не в РФ

#text2video #image2video
This media is not supported in your browser
VIEW IN TELEGRAM
Insert Anything: Image Insertion via In-Context Editing in DiT

Короче еще один инпейнтинг персонализатор.
Показываем одной картинкой что вставить, на другой - куда вставить

Под капотом FLUX.1-Fill-dev и FLUX.1-Redux-dev

Код
Демо
ComfyUI

#inpainting #personalization #imageediting
Cursor Pro за фото студенческого билета.

Раздают подписку Cursor Pro студентам на год.
Говорят, заявки из России тоже принимают.

#coding #gift
This media is not supported in your browser
VIEW IN TELEGRAM
AgenticSeek

Еще один агент, позиционируют себя как локальную опенсорсную альтернативу Manus на DeepSeek R1.
Без отправки данных в облако.

Для установки понадобятся ChromeDriver, Docker, Python 3.10

Гитхаб

#agent #desktop
This media is not supported in your browser
VIEW IN TELEGRAM
WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic Environments

Реконструкция 3D сцен на гауссианах с удалением движущихся объектов.
На вход нужно монокулярное видео

Код

#gaussian
Heygen Avatar IV

Сервис Heygen запустил обновленную функцию оживления портретов.

Достаточно закинуть фото и текст.

А также создали MCP сервер

Доки
Гитхаб

#postrainanimation #lipsync #text2speech #tts #image2video #mcp
This media is not supported in your browser
VIEW IN TELEGRAM
LAM: Large Avatar Model for One-shot Animatable Gaussian Head

Анимируемые аватары по одному изображению на гауссианах от Alibaba.

Управляются звуком и видео, поддаются редактированию-стилизации, шустро крутятся на разных девайсах

Код
Демо
Чат с аватарами - ну здесь они долго думают прежде чем ответить

#humanavatar #talkinghead #gaussian #head #mobile #realtime #lipsync #motion2video
This media is not supported in your browser
VIEW IN TELEGRAM
По совету подписчиков объявляю парад FramePack генераций. Хвастайтесь в комментариях что вам удалось выжать из этого генератора
Media is too big
VIEW IN TELEGRAM
HoloTime: Taming Video Diffusion Models for Panoramic 4D Scene Generation

Генерирует панорамные динамичные видео по тексту или по картинке, реконструируя 4D ассеты

Код

#image2scene #text2video #image2video #360 #panorama #4d #textto4d #imageto4d
This media is not supported in your browser
VIEW IN TELEGRAM
FramePack_with_Video_Input

Форк FramePack, принимающий на вход видео и продолжающий его.

На примере первые 3 секунды видео - исходник, дальше - генерация FramePack

Ветка на официальном FramePack

#videoextension #video2video
2025/07/05 14:16:44
Back to Top
HTML Embed Code: