🎙️
CULTIVA IA — Audio & Voz
Generación de Podcast con GPT Realtime Mini
Azure OpenAI Realtime API · WebSocket Streaming · FastAPI + React
Streaming activo
4:23
Duración
Episodio 12
2.8s
Latencia
Primer chunk
847
Chunks
PCM recibidos
6.3MB
WAV output
Base64 listo
🎙️
Ep. 12 · IA al Día
El Agente de Marketing que Trabaja Mientras Duermes
CULTIVA IA · Voz: Nova · 24kHz · Mono · WAV
2:43 4:23
📝
Transcripción en tiempo real
response.output_audio_transcript.delta · streaming activo

Bienvenidos a IA al Día, el podcast donde cada semana exploramos cómo la inteligencia artificial está redefiniendo el marketing. Soy tu anfitrión virtual, y hoy hablamos de algo que muchos directores de marketing ya están experimentando: los agentes de IA autónomos.


Imagina que son las 3 de la mañana. Tu equipo duerme. Pero hay algo en tu empresa que no descansa: un agente de IA está analizando los datos de campañas del día, ajustando pujas en Google Ads, redactando tres propuestas de email para el segmento que menos convirtió, y preparando el informe de rendimiento que encontrarás en tu bandeja de entrada al despertar.


Esto no es ciencia ficción. Empresas como CULTIVA IA ya están implementando este tipo de automatización para sus clientes. La clave está en combinar modelos de lenguaje como GPT-4 con herramientas conectadas: CRMs, plataformas de ads, analytics y sistemas de email.


El reto no es tecnológico — la tecnología ya existe. El reto es de confianza y diseño: saber exactamente qué decisiones puede tomar el agente de forma autónoma y cuáles necesitan supervisión humana.


En CULTIVA IA llamamos a esto la "frontera de autonomía". Cada cliente tiene la suya, y la definimos juntos antes de poner en marcha cualquier automatización.

🎭
Selección de voz
6 voces disponibles · seleccionada: Nova
⚖️
Alloy
Neutral
🔥
Echo
Cálida
🎪
Fable
Expresiva
🎸
Onyx
Grave
Nova
Amigable ✓
💎
Shimmer
Nítida
Modelo
gpt-realtime-mini
Sample rate
24.000 Hz
Bit depth
16-bit PCM
Canales
Mono
WebSocket event log
Azure OpenAI Realtime API · wss://
wss://cultiva-openai.cognitiveservices.azure.com/openai/v1
00:00.000 session.created
00:00.021 session.update modalities=audio, voice=nova
00:00.089 session.updated
00:00.134 conversation.item.create type=message, role=user
00:00.201 response.create → iniciando
00:00.890 response.created id=resp_Kx92mPQn
00:02.834 response.output_audio.delta chunk #1 · 1.2KB
00:02.901 response.output_audio_transcript.delta "Bienvenidos a IA al Día…"
00:02.956 response.output_audio.delta chunk #2 · 1.4KB
00:03.012 response.output_audio.delta chunk #3 · 1.1KB
00:03.089 response.output_audio.delta chunk #4 · 1.6KB
00:03.144 response.output_audio_transcript.delta "…el podcast donde cada semana…"
... 847 chunks recibidos · streaming...
04:23.019 response.done ✓ Generación completa
04:23.022 pcm_to_wav() → 6.3MB WAV · base64 encoded
🏗️
Arquitectura del pipeline
FastAPI backend + React frontend · streaming end-to-end
📄
Texto del episodio
brief.md → prompt
FastAPI /generate
POST + async
🔌
WebSocket
wss:// Azure
🤖
GPT Realtime Mini
streaming PCM
🔧
pcm_to_wav()
24kHz → WAV
🎙️
React Player
base64 → blob
📦
Especificaciones de salida
audio generado · episodio 12
Formato
WAV (PCM)
Duración
4 min 23 seg
Sample rate
24.000 Hz
Bit depth
16-bit
Tamaño WAV
6.3 MB
Chunks PCM
847 recibidos
Palabras narradas
312 palabras
Latencia inicial
2.8 segundos
📡
Eventos Realtime API
WebSocket · Azure OpenAI
🔊 response.output_audio.delta
PCM chunk
📝 response.output_audio_transcript.delta
Texto
✅ response.done
Fin
🔗 session.created
Conexión
⚠️ error
event.error.message