Segun MarkTechPost (AI/ML News), un estudio detallado explora el uso de inteligencia artificial para analizar el sentimiento en reseñas de películas, utilizando el conjunto de datos IMDb del Stanford Natural Language Processing. El trabajo compara técnicas tradicionales de aprendizaje automático, como el modelo TF-IDF combinado con regresión logística, con enfoques modernos basados en transformadores, específicamente el DistilBERT ajustado mediante LoRA. El proceso comienza con una evaluación rigurosa del conjunto de datos, analizando sesgos en la distribución de longitudes de reseñas, la presencia de duplicados y artefactos de preprocesamiento. Posteriormente, se construye una línea de base sólida mediante el entrenamiento de modelos clásicos, que sirven como referencia para medir el rendimiento de las soluciones más avanzadas.
El modelo DistilBERT, optimizado con LoRA y ejecutado mediante PEFT, es evaluado usando métricas estándar como precisión, F1 macro, área bajo la curva ROC, matrices de confusión y curvas ROC. Además, se analizan aspectos críticos como el ajuste de umbral de predicción, la calibración de probabilidades mediante el Error de Calibración Esperado y el análisis de confiabilidad. El estudio también examina errores de alta certeza, el desempeño en reseñas de diferentes longitudes, la relevancia de palabras específicas mediante ocultación a nivel léxico y las diferencias entre truncar al inicio o al final de las entradas. Estos elementos revelan cómo los modelos toman decisiones y cuándo suelen fallar debido a limitaciones en el manejo de contextos largos.
Para mejorar el rendimiento, se aplica una estrategia de etiquetado pseudo-automático usando el conjunto de datos no etiquetado de IMDb, generando nuevas etiquetas basadas en la confianza del modelo. Este enfoque permite entrenar un modelo semisupervisado que supera significativamente al modelo de base, demostrando la eficiencia de técnicas de aprendizaje de bajo costo en entornos con poca disponibilidad de datos etiquetados. Al final, se guarda el modelo ajustado para su uso posterior en inferencias reales, lo que abre puertas a aplicaciones prácticas en distintos sectores.
Para lectores peruanos, esta metodología ofrece un ejemplo directo de cómo los algoritmos de IA pueden procesar opiniones masivas —como las de redes sociales o reseñas de productos— para detectar tendencias de consumo. En un contexto donde el mercado de servicios, como turismo, salud o comercio electrónico, depende cada vez más de la percepción del cliente, entender el sentimiento detrás de una opinión puede ser clave para tomar decisiones estratégicas. Aunque el modelo original se aplica a películas, su estructura puede adaptarse fácilmente a la evaluación de opiniones sobre servicios públicos, productos locales o experiencias de consumo. La clave está en la calidad del conjunto de datos y en el diseño del enfoque, elementos que también pueden ser aplicados en entornos del Perú, donde la diversidad de opiniones es alta y las necesidades de análisis en tiempo real crecen.
