
Gander, el modelo omni de interacción de Tencent Hunyuan Speech (con ZJU, SJTU, CUHK y NTU), salió el 9 de septiembre de 2026: escucha, ve y habla en streaming mientras un agente de razonamiento sigue trabajando en segundo plano — bajo licencia Apache-2.0.
Si tu asistente de voz se “congela” cuando lanza una tarea larga, Gander separa la conversación en tiempo real del cerebro que razona, para que puedas interrumpir, preguntar o seguir hablando sin matar el job.
Qué es Gander de Tencent
- Producto: Gander (también Gander-Unit8 / Omni Interaction Agent).
- Fecha: 9 de septiembre de 2026.
- Maker: Hunyuan Speech Team, Tencent (+ universidades asociadas).
- Tamaño: ~9B parámetros; base
MiniCPM-o 4.5. - Licencia: Apache-2.0 (pesos, código y datos publicados).
- Pesos: Hugging Face · Gander-Omni/Gander.
- Diseño clave: split Cerebellum–Brain — el “cerebelo” hace voz/video en tiempo real; el “cerebro” orquesta tareas largas (provider pluggable; Codex por defecto).
- Arquitectura streaming: Thinker + Talker desacoplados; entrada en chunks de ~1 segundo (video + speech + texto).
- Fuente: AI/TLDR · Gander (9 sep 2026) y paper Omni Interaction Agent (arXiv 2609.08977).
Qué cambió el 9 de septiembre de 2026
- Antes: muchos stacks de voz + agente van en serie: el asistente calla mientras el agente piensa.
- Ahora: Gander mantiene full-duplex (puedes interrumpirlo mid-frase) mientras el runtime manda trabajo largo al back-brain.
- Open: pesos + runtime local bajo Apache-2.0 — no dependes de un vendor cerrado para estudiar el split.
- Benchmarks reportados: SpokenQA ~75.60% Llama Questions / ~59.30% Web Questions; Full-Duplex-Bench v3 con 100% turn-taking accuracy (~8% interrupciones prematuras); Daily-Omni ~78.53%.
Cómo usarlo hoy (paso a paso)
- Clona el repo Omni-Interaction-Agent (GitHub del proyecto Gander) y crea el entorno conda con el
environment.ymlincluido. - Descarga checkpoints:
hf download Gander-Omni/Gander --local-dir checkpoints/Gander. - Confirma que tienes Thinker + Talker (Unit-8/50) y el manifiesto
release_manifest.json; el stack también usafaster-whisper-large-v3para ASR. - Arranca el servidor local:
./scripts/serve.shy abrehttp://127.0.0.1:8000. - Prueba conversación full-duplex: habla, interrumpe mid-frase y verifica que el Talker no “pierde el hilo”.
- Lanza una tarea larga (investigación, código, tool call) y confirma que el front sigue respondiendo mientras el Brain trabaja en async.
- Si quieres otro razonador, cambia el provider del runtime (Codex es el default) — el punto del diseño Cerebellum–Brain es que el front no se bloquee.
- Documenta en tu equipo latencia percibida, tasa de interrupciones y qué provider usas para el back-brain.
Casos de uso rápidos
- Asistente de voz local que no se silencia al delegar un job largo.
- Demo omni (cámara + mic) para soporte, onboarding o tutoría en vivo.
- Investigación full-duplex: comparar turn-taking vs pipelines turn-based.
- Prototipo comercial bajo Apache-2.0 (revisa también términos de MiniCPM-o y faster-whisper).
Buenas prácticas
- GPU: el ejemplo de serving suele cargar Talker en una segunda GPU; planifica VRAM antes de demo.
- Chunks de 1s: no esperes calidad “offline ASR” perfecta en cada segundo — mide endpointing real.
- Back-brain pluggable: elige el provider según costo/latencia; no mezcles secretos en el prompt del front.
- Licencias: Apache-2.0 en Gander no sustituye revisar MiniCPM-o 4.5 y faster-whisper si vas a producción.
FAQ
¿Cuándo salió Gander?
El 9 de septiembre de 2026, según el release de Hunyuan Speech / AI-TLDR y el paper Omni Interaction Agent.
¿Es open source?
Sí. Pesos, código y datos bajo Apache-2.0 en Hugging Face (Gander-Omni/Gander).
¿Puedo cambiar el agente de razonamiento?
Sí. El Brain es pluggable; Codex es el default, pero el runtime conecta el front streaming a otro provider.
¿Para quién es?
Investigadores de speech/voice agents y equipos que construyen asistentes en tiempo real con tareas largas en paralelo.
¿Cómo lo pruebo en local?
hf download Gander-Omni/Gander --local-dir checkpoints/Gander && ./scripts/serve.sh y abre http://127.0.0.1:8000.
Conclusión
Desde el 9 de septiembre de 2026, Gander de Tencent ofrece un modelo omni open (~9B) que mantiene voz/video full-duplex mientras un Brain asíncrono razona. Descarga los pesos, sirve en local y mide si tu producto de voz deja de “congelarse” al delegar trabajo largo.
Certifícate GRATIS en http://edu.ia.university/
Certificación IA internacional: https://ia.university/Asesor-IALab
Más en ia.university/ia-news.