Ebook to Audio convierte archivos EPUB y PDF en audiolibros navegables con reproducción por capítulos. Su pipeline de IA recuperable conserva la estructura durante extracción, síntesis y ensamblado.
Procesamiento documental, Arquitectura de datos, IA aplicada, Sistemas concurrentes, Ingeniería cloud, Resiliencia de proveedores
Demo del producto · 0:21 · Recorrido sin sonido
Así se convierte un libro en un audiolibro navegable
Heart of Darkness pasa del análisis de la fuente a la selección de voz, el procesamiento recuperable, la navegación por capítulos y el chat sobre el libro.
Pantallas del producto
Abre una pantalla para examinar el recorrido.
01 · Contexto
Qué lo motivó
No es un simple envoltorio de texto a voz. EPUB y PDF codifican la estructura de forma distinta, y la calidad de la extracción determina si el audio terminado sigue comportándose como un libro.
Las conversiones de larga duración superan los límites de una solicitud y atraviesan workers y proveedores. Por eso, fallos parciales, cuotas, reintentos, reconciliación y artefactos acotados al usuario forman parte del comportamiento del producto, no son detalles de implementación en segundo plano.
02 · Enfoque
Cómo funciona
Usar extracción específica para EPUB y PDF, limpieza y normalización asistidas por IA con fallbacks deterministas, y detección de capítulos a partir de índices, marcadores, señales y heurísticas.
Conservar el linaje del capítulo durante segmentación y síntesis, y combinar después los metadatos de síntesis disponibles con duraciones medidas del audio ensamblado y comprobaciones para producir los tiempos de navegación.
Ejecutar la conversión como trabajos en cola atómicos, con reintentos, estado fallido tras agotarlos, invocación por eventos, reconciliación programada y selección de proveedor y gestión de errores conscientes de las cuotas.
03 · Decisiones
Lo que elegí por el camino
01
Entregada
Adaptar la extracción al formato de origen
Restricción
Los paquetes EPUB y los PDF exponen texto y estructura mediante señales distintas, y cualquiera de las fuentes puede contener metadatos ruidosos o incompletos.
Alternativas consideradas
Aplanar todas las fuentes a texto plano o pedir a un modelo que reconstruya toda la estructura documental.
Decisión
Usar extracción específica por formato, limpieza y normalización asistidas por IA con fallbacks deterministas, y varias señales para detectar capítulos.
Efecto
El pipeline admite recuperación específica por fuente y conserva una estructura utilizable antes de comenzar la síntesis.
02
Entregada
Conservar el linaje de capítulos en todas las etapas
Restricción
Reconstruir capítulos después de ensamblar un único archivo de audio pierde la relación entre estructura fuente, segmentos, salida de síntesis y posiciones de reproducción.
Alternativas consideradas
Generar un único flujo de audio e inferir los límites de capítulo después del ensamblado.
Decisión
Transportar la identidad de capítulo durante extracción, limpieza, segmentación, síntesis y ensamblado; después, usar los metadatos de síntesis disponibles y duraciones medidas del audio ensamblado con comprobaciones de tiempo.
Efecto
El artefacto final conserva suficiente linaje para navegar por capítulos y diagnosticar desajustes temporales sin prometer tiempos exactos.
03
Entregada
Hacer recuperable la conversión de larga duración
Restricción
Un libro supera la vida de una solicitud, y workers o proveedores pueden fallar después de completar solo una parte.
Alternativas consideradas
Ejecutar toda la conversión en una solicitud o depender únicamente de la entrega de eventos sin reconciliación.
Decisión
Usar trabajos en cola atómicos, reintentos, estado fallido tras agotarlos, invocación por eventos, reconciliación programada y selección de proveedor y gestión de errores conscientes de las cuotas.
Efecto
El trabajo puede reanudarse o detenerse en límites explícitos, y los eventos perdidos o las restricciones del proveedor tienen caminos de recuperación definidos.
04 · Estado actual
Qué es cierto hoy
Entregado
El flujo desplegado para EPUB y PDF incluye detección de capítulos, varias voces e idiomas, reproducción, descarga y chat sobre el libro.
Evidencia
La implementación contiene extracción específica por formato, fallbacks de limpieza, linaje de capítulos, trabajos en cola atómicos, reintentos y estado terminal de fallo, invocación por eventos, reconciliación programada y gestión consciente de cuotas.
Pendiente
El comportamiento bajo carga sostenida no se ha medido. El ciclo de vida previsto para los artefactos solo está implementado parcialmente y no se ha verificado de extremo a extremo.
El procesamiento documental fiable con IA depende del linaje y de la recuperación a través de transformaciones, workers y proveedores.
La adaptación de datos empieza antes del modelo
Evidencia
La extracción de EPUB y PDF usa señales estructurales distintas, con limpieza y fallbacks deterministas antes de la síntesis.
La próxima vez
Perfilar la variabilidad de las fuentes y definir gates de calidad para los fallbacks antes de elegir proveedor de generación.
El linaje hace navegable el audio generado
Evidencia
La identidad de capítulo sobrevive a extracción, segmentación, síntesis y ensamblado, y después informa las comprobaciones temporales del audio final.
La próxima vez
Convertir identificadores de linaje y metadatos de reconciliación en elementos de primer nivel de cada contrato de transformación.
La concurrencia y el fallo de proveedor son comportamiento de producto
Evidencia
Trabajos atómicos, reintentos, estado terminal de fallo, invocación por eventos, reconciliación y gestión consciente de cuotas determinan cómo se expone y recupera el trabajo incompleto.
La próxima vez
Diseñar los estados visibles de fallo y reanudación junto con la cola y la estrategia de proveedor, no después.