Volver al blog

ProCat Solutions

Ganamos la subvención DIMOP Plusz: plataforma inteligente de atención al cliente por voz

Con 14,53 millones de forintos de la convocatoria DIMOP_PLUSZ-1.1.2/A-24 desarrollamos una plataforma multiinquilino de atención al cliente por voz hasta 2026.

ProCat Solutions subvencióndimop-pluszvoice-aisaasatención-al-cliente
Ganamos la subvención DIMOP Plusz: plataforma inteligente de atención al cliente por voz

Hoy arranca oficialmente el proyecto para el que nos preparó el trabajo de telecomunicaciones y backend de los últimos años: en el marco de la convocatoria DIMOP_PLUSZ-1.1.2/A-24 hemos obtenido financiación para desarrollar una plataforma inteligente de atención al cliente por voz. En esta entrada resumimos los datos de la subvención y el contenido técnico previsto.

Cofinanciado por la Unión Europea.

Datos de la subvención

  • Convocatoria: DIMOP_PLUSZ-1.1.2/A-24
  • Identificador del proyecto: DIMOP_PLUSZ-1.1.2/A-24-2025-00236
  • Título del proyecto: Desarrollo de una plataforma inteligente de atención al cliente por voz
  • Importe de la ayuda: 14 534 144 Ft (14,53 millones de forintos) de subvención a fondo perdido
  • Intensidad de la ayuda: 70%
  • Periodo de ejecución: 1 de julio de 2025 – 14 de septiembre de 2026

El 30% restante lo aporta la empresa como fondos propios. Para una microempresa el proyecto es un compromiso importante, por eso en los últimos meses elaboramos en detalle la planificación y los hitos.

¿Por qué construimos precisamente esto?

En los últimos años trabajamos con telefonía basada en SIP, integración PSTN, canales de SMS y WhatsApp, y sistemas SaaS multiinquilino. En todos los proyectos de atención al cliente aparecía la misma petición: una parte de las llamadas entrantes (reserva de citas, horarios de apertura, consultas de estado sencillas, dejar un mensaje) debería gestionarse automáticamente, sin intervención humana, día y noche, en varios idiomas.

Los avances en reconocimiento de voz, modelos de lenguaje grandes y síntesis de voz hoy lo hacen técnicamente posible. Lo que falta es una plataforma que conecte estos componentes con la red telefónica tradicional y que una pequeña o mediana empresa pueda configurar por sí misma, sin desarrollador. Eso es lo que queremos construir.

¿Qué vamos a implementar?

El contenido técnico comprometido del proyecto consta de los siguientes elementos principales.

Plataforma SaaS multiinquilino. Una única infraestructura atiende a varios clientes, con datos, configuración y facturación separados por inquilino. Se apoya en los patrones multi-tenant descritos en nuestras entradas anteriores: esquema compartido, row-level security, límites por inquilino.

Editor de flujos no-code. El cliente compone el recorrido de la llamada en el navegador, en un editor visual: saludo, preguntas, ramificaciones, recogida de datos, transferencia a una persona. No hace falta programar; la descripción del flujo se almacena en la base de datos y es la que dirige al asistente durante la llamada.

Cadena de procesamiento STT–LLM–TTS. El reconocimiento de voz continuo (speech-to-text) convierte el audio entrante en texto, un modelo de lenguaje grande lo interpreta y decide el siguiente paso, y la respuesta la pronuncia la síntesis de voz (text-to-speech). Cada elemento de la cadena es sustituible, y reducir la latencia es una de las tareas técnicas centrales del proyecto.

Integración SIP y PSTN. La plataforma recibe e inicia llamadas en números de teléfono reales a través de un SIP trunk, construida sobre nuestro propio componente PSTN bridge. El audio de la llamada se reenvía en tiempo real a la cadena de procesamiento, y de vuelta.

Registro de llamadas y exportación CSV. De cada llamada se generan una transcripción, un resumen y datos estructurados (por ejemplo, la cita reservada), que se pueden consultar en la interfaz y exportar en formato CSV a los sistemas existentes.

Precios basados en el uso. No hay paquete que pagar por adelantado; el cliente paga por las llamadas realmente gestionadas, y la facturación se apoya en el modelo de eventos de uso ya probado en Abisearch.

Operación en la UE conforme al RGPD. Las grabaciones de voz, las transcripciones y los datos personales se almacenan cifrados en servidores dentro de la Unión Europea, con periodo de retención configurable, política de privacidad y condiciones generales de servicio.

¿Cómo trabajamos en el proyecto?

El desarrollo lo hacemos de la forma habitual: entorno basado en Docker, pruebas automatizadas, entornos de staging y producción separados. Probar sistemas de voz es un reto nuevo, por eso los flujos de llamada los recorremos también con llamadas SIP reales, de forma automatizada, no solo con pruebas unitarias.

Sobre el avance del proyecto informaremos con regularidad en este blog: sobre las lecciones de la reducción de la latencia, sobre las trampas del reconocimiento de voz en streaming y sobre cómo se comporta un modelo de lenguaje en el ruido de una llamada telefónica real. Las entradas se escribirán en el tono de ingeniería habitual; la subvención no cambia qué escribimos ni cómo.

Agradecemos el apoyo del Gobierno de Hungría y de la Unión Europea.

Széchenyi Terv Plusz kedvezményezetti infoblokk
QR Code