Gander de Tencent: qué es y cómo usarlo hoy

Gander de Tencent: qué es y cómo usarlo hoy
Gander de Tencent: qué es y cómo usarlo hoy

Gander, el modelo omni de interacción de Tencent Hunyuan Speech (con ZJU, SJTU, CUHK y NTU), salió el 9 de septiembre de 2026: escucha, ve y habla en streaming mientras un agente de razonamiento sigue trabajando en segundo plano — bajo licencia Apache-2.0.

Si tu asistente de voz se “congela” cuando lanza una tarea larga, Gander separa la conversación en tiempo real del cerebro que razona, para que puedas interrumpir, preguntar o seguir hablando sin matar el job.

Qué es Gander de Tencent

  • Producto: Gander (también Gander-Unit8 / Omni Interaction Agent).
  • Fecha: 9 de septiembre de 2026.
  • Maker: Hunyuan Speech Team, Tencent (+ universidades asociadas).
  • Tamaño: ~9B parámetros; base MiniCPM-o 4.5.
  • Licencia: Apache-2.0 (pesos, código y datos publicados).
  • Pesos: Hugging Face · Gander-Omni/Gander.
  • Diseño clave: split Cerebellum–Brain — el “cerebelo” hace voz/video en tiempo real; el “cerebro” orquesta tareas largas (provider pluggable; Codex por defecto).
  • Arquitectura streaming: Thinker + Talker desacoplados; entrada en chunks de ~1 segundo (video + speech + texto).
  • Fuente: AI/TLDR · Gander (9 sep 2026) y paper Omni Interaction Agent (arXiv 2609.08977).

Qué cambió el 9 de septiembre de 2026

  • Antes: muchos stacks de voz + agente van en serie: el asistente calla mientras el agente piensa.
  • Ahora: Gander mantiene full-duplex (puedes interrumpirlo mid-frase) mientras el runtime manda trabajo largo al back-brain.
  • Open: pesos + runtime local bajo Apache-2.0 — no dependes de un vendor cerrado para estudiar el split.
  • Benchmarks reportados: SpokenQA ~75.60% Llama Questions / ~59.30% Web Questions; Full-Duplex-Bench v3 con 100% turn-taking accuracy (~8% interrupciones prematuras); Daily-Omni ~78.53%.

Cómo usarlo hoy (paso a paso)

  1. Clona el repo Omni-Interaction-Agent (GitHub del proyecto Gander) y crea el entorno conda con el environment.yml incluido.
  2. Descarga checkpoints: hf download Gander-Omni/Gander --local-dir checkpoints/Gander.
  3. Confirma que tienes Thinker + Talker (Unit-8/50) y el manifiesto release_manifest.json; el stack también usa faster-whisper-large-v3 para ASR.
  4. Arranca el servidor local: ./scripts/serve.sh y abre http://127.0.0.1:8000.
  5. Prueba conversación full-duplex: habla, interrumpe mid-frase y verifica que el Talker no “pierde el hilo”.
  6. Lanza una tarea larga (investigación, código, tool call) y confirma que el front sigue respondiendo mientras el Brain trabaja en async.
  7. Si quieres otro razonador, cambia el provider del runtime (Codex es el default) — el punto del diseño Cerebellum–Brain es que el front no se bloquee.
  8. Documenta en tu equipo latencia percibida, tasa de interrupciones y qué provider usas para el back-brain.

Casos de uso rápidos

  • Asistente de voz local que no se silencia al delegar un job largo.
  • Demo omni (cámara + mic) para soporte, onboarding o tutoría en vivo.
  • Investigación full-duplex: comparar turn-taking vs pipelines turn-based.
  • Prototipo comercial bajo Apache-2.0 (revisa también términos de MiniCPM-o y faster-whisper).

Buenas prácticas

  • GPU: el ejemplo de serving suele cargar Talker en una segunda GPU; planifica VRAM antes de demo.
  • Chunks de 1s: no esperes calidad “offline ASR” perfecta en cada segundo — mide endpointing real.
  • Back-brain pluggable: elige el provider según costo/latencia; no mezcles secretos en el prompt del front.
  • Licencias: Apache-2.0 en Gander no sustituye revisar MiniCPM-o 4.5 y faster-whisper si vas a producción.

FAQ

¿Cuándo salió Gander?

El 9 de septiembre de 2026, según el release de Hunyuan Speech / AI-TLDR y el paper Omni Interaction Agent.

¿Es open source?

Sí. Pesos, código y datos bajo Apache-2.0 en Hugging Face (Gander-Omni/Gander).

¿Puedo cambiar el agente de razonamiento?

Sí. El Brain es pluggable; Codex es el default, pero el runtime conecta el front streaming a otro provider.

¿Para quién es?

Investigadores de speech/voice agents y equipos que construyen asistentes en tiempo real con tareas largas en paralelo.

¿Cómo lo pruebo en local?

hf download Gander-Omni/Gander --local-dir checkpoints/Gander && ./scripts/serve.sh y abre http://127.0.0.1:8000.

Conclusión

Desde el 9 de septiembre de 2026, Gander de Tencent ofrece un modelo omni open (~9B) que mantiene voz/video full-duplex mientras un Brain asíncrono razona. Descarga los pesos, sirve en local y mide si tu producto de voz deja de “congelarse” al delegar trabajo largo.

Certifícate GRATIS en http://edu.ia.university/

Certificación IA internacional: https://ia.university/Asesor-IALab

Más en ia.university/ia-news.

Humata AI: La solución para resumir y comprender documentos difíciles

Humata AI: La solución para resumir y comprender documentos difíciles

Humata AI simplifica documentos legales y técnicos, proporcionando resúmenes rápidos y claros, respuestas instantáneas y…

20 Prompts para Marketeros: Ahorra tiempo e impulsa tu creatividad

20 Prompts para Marketeros: Ahorra tiempo e impulsa tu creatividad

Estos prompts ayudan a marketeros y creadores de contenido a generar ideas innovadoras, planificar campañas…

Vectorizer.AI: Conviértete en un Experto en Vectorización

Vectorizer.AI: Conviértete en un Experto en Vectorización

Convierte tus imágenes JPEG y PNG a vectores SVG con Vectorizer.AI de manera rápida y…

OpenAI desarrolla Modelos de IA Avanzada para investigación y razonamiento profundos

OpenAI desarrolla Modelos de IA Avanzada para investigación y razonamiento profundos

OpenAI desarrolla el proyecto Strawberry para crear modelos de IA con razonamiento avanzado e investigación…

AMD adquirirá Silo AI para liderar la IA a nivel empresarial

AMD adquirirá Silo AI para liderar la IA a nivel empresarial

AMD adquirirá Silo AI por $665 millones, fortaleciendo su posición en IA empresarial con soluciones…

Samsung presenta sus nuevos dispositivos con IA

Samsung presenta sus nuevos dispositivos con IA

Samsung lanza el Galaxy Z Fold 6, Z Flip 6 y el Galaxy Ring con…

Recibe en tu WhatsApp las últimas noticias de la Inteligencia Artificial.

¿Quieres conocer las últimas aplicaciones y cómo usarlas?

Scroll to Top