Necesidad del cliente (explicación no técnica)
Profesionales y estudiantes de tecnología consumen diariamente una gran cantidad de contenido técnico, lo que dificulta organizar, localizar y reutilizar esta información posteriormente.
La solución debe permitir:
Organizar contenidos automáticamente; Facilitar las búsquedas por temas o tópicos; Encontrar contenidos relacionados; Reducir el esfuerzo manual de catalogación; Construir una base de conocimiento reutilizable.
Esta solución permite transformar grandes volúmenes de información en conocimiento estructurado y de fácil acceso.
Validación de mercado
Las herramientas de gestión del conocimiento son ampliamente utilizadas por empresas, equipos técnicos y plataformas educativas.
Las soluciones que automatizan la organización de contenidos pueden:
Reducir el tiempo dedicado a la búsqueda de información; Mejorar la productividad; Facilitar el intercambio de conocimiento; Apoyar procesos de aprendizaje continuo; Escalar repositorios de conocimiento de manera eficiente.
Incluso las soluciones simples pueden generar valor al automatizar tareas repetitivas y mejorar el acceso a la información.
Expectativa para este Hackathon
Objetivo Entregar un MVP funcional que permita organizar y enriquecer contenidos técnicos utilizando técnicas de Ciencia de Datos e integración con una API.
Alcance recomendado Los equipos podrán trabajar con uno o más enfoques, tales como:
Clasificación de contenido; Agrupación de documentos; Extracción de palabras clave; Búsqueda semántica; Recomendación de contenidos relacionados.
La integración entre la aplicación y el modelo de Ciencia de Datos deberá ser definida por el equipo, considerando la arquitectura adoptada para la solución.
Se recomienda que la integración se realice de manera que permita consumir el modelo a través de la API desarrollada para el proyecto.
Notebook del equipo de Ciencia de Datos (Jupyter/Colab)
Conteniendo:
Exploración y limpieza de datos (EDA); Procesamiento de textos; Transformación de datos a un formato adecuado para el modelado; Entrenamiento y evaluación de modelos; Métricas de rendimiento apropiadas para la solución propuesta; Serialización del modelo (joblib/pickle).
Aplicación Back-End (API REST) API con endpoints relacionados con la solución desarrollada; Recepción de contenido para su procesamiento; Retorno de los resultados generados por el modelo; Validación de entrada; Manejo de errores.
Integración con OCI
Sugerencias de uso:
Object Storage para el almacenamiento de modelos o documentos; OCI Compute para el alojamiento de la aplicación; OCI Functions para procesamiento específico; Base de datos opcional para persistencia.
Documentación mínima (README) Cómo ejecutar el proyecto; Cómo utilizar la API; Ejemplos de solicitud y respuesta; Dependencias y versiones utilizadas.
Demostración funcional
Presentar la solución en funcionamiento y explicar cómo los modelos utilizados generan los resultados.
Funcionalidades requeridas (MVP) El servicio debe exponer al menos un endpoint capaz de recibir contenido técnico y devolver información procesada por la solución desarrollada.
Ejemplo POST /contenido Entrada:
{ "titulo": "Introducción a Spring Boot", "texto": "En este contenido se presentan los conceptos básicos para la creación de APIs REST utilizando Java y Spring Boot." }
Salida:
{ "categoria": "Backend", "probabilidad": 0.89, "informacionadicional": [ "Java", "Spring Boot", "API REST" ] }
La estructura final de la respuesta podrá variar según el enfoque elegido por el equipo.
Requisitos
Modelo entrenado y cargado; Procesamiento funcional del contenido; API operativa; Integración con OCI; Mínimo de tres ejemplos de uso; Documentación funcional.
Recursos opcionales Recomendación de contenidos relacionados; Búsqueda por palabras clave; Procesamiento por lotes (CSV); Dashboard sencillo; Persistencia de resultados; Containerización con Docker; Pruebas automatizadas; Explicabilidad del modelo; Búsqueda semántica; Consulta por categorías.
Directrices técnicas para estudiantes
Ciencia de Datos Cada equipo deberá construir su propia base de contenidos.
Los datos podrán ser:
Obtenidos de fuentes públicas; Extraídos de documentación; Producidos por el propio equipo.
Sugerencias de tecnologías:
Python; Pandas; Scikit-Learn; TF-IDF; Regresión Logística; Técnicas de similitud textual.
Se permite el uso de otros enfoques y modelos.
Back-End Desarrollar una API REST utilizando las tecnologías trabajadas durante la formación.
La API deberá:
Recibir los datos de entrada de la solución; Consumir el modelo desarrollado por el equipo de Ciencia de Datos; Devolver respuestas en formato JSON; Realizar validaciones y manejo de errores; Exponer los endpoints necesarios para el funcionamiento de la aplicación.
La arquitectura utilizada quedará a criterio del equipo y deberá estar documentada.
OCI La solución debe utilizar al menos un servicio OCI como parte obligatoria del proyecto.