La indexación de materias es el acto de describir o clasificar un documento mediante términos de índice, palabras clave u otros símbolos para indicar de qué tratan los diferentes documentos, resumir sus contenidos o aumentar su capacidad de ser encontrados. En esencia, el objetivo principal es identificar y describir el tema o materia del documento.
Los índices se construyen, por lo general, en tres niveles distintos: términos dentro de un documento (como un libro), objetos en una colección (como una biblioteca) y documentos (como libros y artículos) dentro de un campo de conocimiento específico.
El Proceso de Indexación
La indexación es fundamental en la recuperación de información, especialmente para crear índices bibliográficos que permitan localizar documentos sobre un tema particular. Ejemplos de servicios de indexación académica incluyen Zentralblatt MATH, Chemical Abstracts y PubMed. Aunque los términos suelen ser asignados por expertos, las palabras clave proporcionadas por los autores también son comunes.
El proceso comienza con un análisis de la materia del documento. El indexador debe identificar los términos que describen adecuadamente el tema, ya sea extrayendo palabras directamente del texto o asignando términos de un vocabulario controlado. Finalmente, los términos se presentan en un orden sistemático.
Profundidad de la Indexación
Los indexadores deben decidir cuántos términos incluir y qué tan específicos deben ser estos términos. La combinación de estos dos factores determina la profundidad de la indexación.
Análisis de Materias
El primer paso es decidir el tema del documento. En la indexación manual, el indexador se plantea preguntas como: "¿Trata el documento sobre un producto, condición o fenómeno específico?". Dado que este análisis depende del conocimiento y la experiencia del indexador, es posible que dos profesionales analicen el contenido de manera diferente, lo que puede impactar la eficacia de la recuperación de la información.
Análisis Automático vs. Manual
La indexación automática sigue procesos establecidos para analizar la frecuencia de patrones de palabras y comparar los resultados con otros documentos para asignar categorías temáticas. Este método no requiere una comprensión profunda del material, lo que genera una indexación más uniforme, pero a expensas de la interpretación del significado real. Un programa informático puede no comprender el sentido de las declaraciones y, por lo tanto, fallar en la asignación de términos relevantes o asignarlos incorrectamente.
Por otro lado, los indexadores humanos se centran en partes específicas del documento, como el título, el resumen y las conclusiones, ya que analizar el texto completo en profundidad es costoso y consume mucho tiempo. Un sistema automatizado elimina la limitación de tiempo y permite analizar el documento completo, aunque también puede ser dirigido a secciones específicas.
Selección de Términos
La segunda etapa consiste en traducir el análisis de la materia en un conjunto de términos de índice. Esto puede implicar la extracción directa del documento o la asignación desde un vocabulario controlado.
A pesar de la popularidad de la búsqueda de texto completo, la indexación de materias y los expertos (indexadores profesionales, catalogadores y bibliotecarios) siguen siendo cruciales. Estos profesionales comprenden los vocabularios controlados y pueden localizar información que no se puede encontrar mediante una simple búsqueda de palabras clave.
Indexación por Extracción o Derivada
La indexación por extracción implica tomar palabras directamente del documento. Utiliza lenguaje natural y es ideal para técnicas automatizadas donde se calculan las frecuencias de palabras. Para evitar términos irrelevantes, se utiliza una stop-list (lista de palabras vacías) que excluye palabras comunes como "el", "y", "la".
Sin embargo, la indexación automática por extracción puede presentar problemas:
- Pérdida de significado: Al indexar palabras sueltas en lugar de frases, se puede perder el contexto.
- Términos demasiado comunes: Palabras como "glucosa" en documentos sobre diabetes pueden aparecer con frecuencia en casi todos los documentos, perdiendo su capacidad de discriminación.
- Términos raros pero significativos: Algunos términos que aparecen pocas veces pueden ser cruciales, como el nombre de un fármaco nuevo.
Para mitigar esto, se utiliza el enfoque de frecuencia relativa, donde la frecuencia de una palabra en un documento se compara con su frecuencia en toda la base de datos. Así, los términos que aparecen más a menudo de lo esperado en un documento específico se convierten en términos de índice, mientras que los términos comunes a toda la base de datos se excluyen.

