
Como se observa, el proyecto se fundamenta en una metodología interdisciplinar. La interdisciplinariedad se manifiesta en la fusión de las ciencias de la computación, la teoría literaria y las ciencias sociales para comprender cómo obras y autores son percibidos en el entorno digital. La multidisciplinariedad se refleja en la aplicación de técnicas como el análisis de Big Data, la Inteligencia Artificial, la sociología de la cultura y el estudio crítico literario. Por tanto, nuestro objeto de estudio es la cultura literaria y la figura del escritor en la era de la Inteligencia Artificial. El método es cruzado y combina paradigmas cualitativos (lectura de cerca, sociología de la literatura, teoría crítica) con cuantitativos (herramientas de Big Data e IA Generativa). Y nuestro marco de legibilidad parte de una perspectiva social, cultural, política y económica de lo literario, en su doble dimensión diacrónica y sincrónica.
Con este horizonte transepistémico, partimos de una metodología teórica (Obra, Lector, Autor), “situada” (Haraway) en los “Sures” (Quijano) que aplica técnicas de Big Data, dataísticas y de IA a nuestro corpus que comprende exactamente obras literarias de narrativa, poesía, ensayo y teatro publicadas en España entre 2001 y 2023.
El estudio se centrará en las siguientes variables: género literario, sexo, edad, nacionalidad, sello editorial, contenido y año de publicación. A esto hay que añadir la reflexión sobre la recepción, las tecnologías del escritor y nociones constitutivas del campo como ‘autor’, ‘obra’, ‘lector’.
Los tres ejes sobre los que planea el proyecto LETRAL_IA
Fuentes para la captura de datos masiva con APIs y su integración en plataforma web
| Fuente | Análisis y/o indicadores | Descripción |

Creación de un corpus literario para análisis comparativo y tendencias editoriales.
Registro de obras comerciales que facilita la identificación y clasificación de libros

Análisis cuantitativo de la presencia en bibliotecas, categorización por géneros y estudio del alcance internacional.
Base de datos global que agrega colecciones de bibliotecas para determinar la disponibilidad y la distribución geográfica de las obras

Análisis cualitativo de las discusiones y ediciones en entradas relacionadas con autores y obras; evaluación del impacto cultural.
Wikipedia y Wikidata son plataformas de conocimiento colaborativo que ofrecen contextos culturales, así como datos sobre la percepción y recepción de obras y autores.
Fuentes para la recopilación selectiva de datos basados en muestras de editorial y autores
| Fuente | Análisis y/o indicadores | Descripción |

Extracción de datos para estudios de frecuencia léxica y evolución del lenguaje literario; tendencias en temáticas y estilos.
Google Books y su producto Ngram proporcionan acceso a textos digitalizados y el análisis de la frecuencia de palabras o frases

Evaluación de la influencia académica mediante el recuento de citas y análisis bibliométricos; perfil de la citación.
Base de datos que indexa artículos académicos y literarios, ofreciendo una visión de la relevancia y el interés científico en ciertas obras.

Análisis de la valoración media de las obras, y estudio de sentimientos y percepciones a través de las reseñas
Plataforma donde los usuarios pueden valorar y reseñar libros, proporcionando datos sobre la recepción por parte del público.

Se investigará la puntuación promedio y se analizarán las reseñas para obtener respuestas emocionales y las opiniones
Comunidad de lectores en la que los usuarios pueden descubrir, valorar y reseñar libros, brindando una comprensión sobre la recepción

Análisis de engagement y alcance de los autores; estudio de la representación visual y personal branding de los escritores.
Red social centrada en el contenido visual que es utilizada por autores para interactuar con su audiencia y promover sus obras.
El diagrama metodológico resume la metodología de LETRAL_IA, que se inicia con la creación e identificación de los libros publicados en español entre 2001-2023 que es una población cercana a los 1.126.893 según datos del INE.
Este conjunto previo se filtrará atendiendo a dos criterios principales: (1) que pertenezcan a algunos de los géneros seleccionados (narrativa, teatro, poesía y ensayo) y que (2) pertenezcan a editoriales con un mínimo de obras publicadas y con una trayectoria consolidada durante el período analizado.
Tras su identificación a este subconjunto lo denominaremos Corpus XXI, y se estima (considerando que el 40% son obras literarias y la producción editorial sigue una distribución de Pareto) que tenga un volumen aproximado de 250.000 – 300.000 obras.
Base de datos unificada
En la siguiente fase procederemos a la creación de la base de datos unificada que integrará dos subconjuntos:
Los datos recopilados de forma masiva y automática mediante la consulta de APIs (Interfaz de Programación de Aplicaciones, es un conjunto de reglas que permite acceder y utilizar servicios digitales facilitando la integración y el análisis de grandes volúmenes de datos). Hemos de señalar que los datos de este conjunto permitirán generar una plataforma web en abierto donde se presenten los datos en diferentes niveles sobre la difusión y recepción.
La base de datos anterior también se analizará para detectar editoriales preferentes y muestras exactas de autores para luego proceder a recopilaciones selectivas de datos en plataformas comerciales y redes sociales
Una vez compilada la base de datos en sus dos apartados y desarrollada la plataforma web se aplicarán métodos propios de Big Data y de la IA generativa que podrán ser empleados, bien de forma simultánea o individual, para alcanzar los objetivos generales del proyecto.
A continuación, describimos algunas de las técnicas específicas que buscamos desarrollar en el marco de los objetivos específicos:
Métodos del Big Data: Para capturar la información bibliográfica implementaremos técnicas de Big Data. La extracción de datos mediante scraping y APIs proporcionará información estructurada de bases de datos y plataformas digitales. Utilizaremos minería de datos para revelar patrones y relaciones en grandes conjuntos de datos literarios. El análisis de sentimiento nos permitirá interpretar las emociones detrás de las reseñas y valoraciones de las obras. Complementaremos con visualizaciones de datos.
Métodos de la IA-Generativa: Paralelamente emplearemos técnicas para profundizar en la comprensión de las tendencias literarias. Modelos como ChatGPT nos ayudarán a analizar resúmenes de obras y crear perfiles de autores y editoriales, y a predecir tendencias futuras. A través del aprendizaje automático clasificaremos géneros literarios. Asimismo, ChatGPT nos puede ayudar a identificar entidades y sus interrelaciones en registros literarios, generar metadatos descriptivos y agrupar temáticas clave mediante modelado de tópicos.
Desde el punto de vista de los métodos tecnológicos la plataforma del proyecto LETRAL_IA integrará avanzadas tecnologías web y herramientas analíticas para proporcionar una experiencia de usuario enriquecedora. Utilizando HTML, CSS y JavaScript para el front-end. Para el back-end, se empleará Node.js o Python, garantizando un procesamiento eficiente y escalable, junto con bases de datos robustas como PostgreSQL.
En el núcleo de la plataforma, se implementarán modelos avanzados de inteligencia artificial para el procesamiento de registros bibliográfico y análisis de imagen, lo que permitirá desentrañar relaciones complejas en los textos y en las representaciones visuales relacionadas con la literatura.
Además, se integrarán APIs para acceder y manipular datos de fuentes externas, lo que enriquecerá la base de datos del proyecto con información actualizada y diversa. Estas APIs facilitarán la conexión con plataformas para recopilar datos. Para visualizar los datos, se utilizarán herramientas como Tableau, permitiendo a los usuarios interactuar con LETRAL_IA.