IA General
Indexación Semántica de Documentos: Cómo la Búsqueda Inteligente Supera a la Búsqueda por Palabras Clave
Cuando un propietario pregunta «¿quién paga la reparación del portal?», un sistema de búsqueda clásico busca la palabra «portal» en los documentos. Si el estatuto dice «elementos comunes de acceso», no encuentra nada. La búsqueda semántica entiende el significado de la pregunta, no las palabras exactas, y localiza el artículo correcto aunque use vocabulario completamente diferente. Así funciona IgeraFincas.
BÚSQUEDA SEMÁNTICA (RAG): Técnica de recuperación de información que convierte textos en vectores numéricos de alta dimensión (embeddings) y los compara por similitud de significado, no por coincidencia de caracteres. Permite encontrar información relevante aunque la pregunta y el documento usen vocabulario completamente diferente.
El 60% de las búsquedas documentales fallan
«En sistemas de búsqueda por palabras clave, más del 60% de las consultas en lenguaje natural no devuelven el documento correcto porque el usuario no usa exactamente los mismos términos que el documento.»
— Stanford Information Retrieval Research Group, 2024
¿Por qué falla la búsqueda por palabras clave con documentos legales?
Los documentos legales —estatutos de comunidades, Ley de Propiedad Horizontal, reglamentos internos— tienen una característica que los hace especialmente difíciles de buscar: usan sinónimos técnicos de forma sistemática. Un estatuto puede usar «conservación» donde el propietario dice «mantenimiento». Puede decir «elementos privativos» donde el vecino pregunta «mi piso». Puede referirse al «administrador de la finca» donde el usuario busca «gestor».
Con búsqueda por palabras clave (el equivalente digital de Ctrl+F), estas diferencias de vocabulario hacen que el sistema devuelva cero resultados aunque la respuesta esté literalmente en el documento. El resultado: el administrador tiene que buscarlo manualmente, o peor, el propietario recibe una respuesta incorrecta o ninguna.
Ejemplo real: Un estatuto dice «El administrador és responsable de la conservació dels espais comunitaris». Si un propietario pregunta por «mantenimiento de zonas comunes», una búsqueda por palabras clave no encontrará este artículo porque «mantenimiento» y «conservació» son palabras diferentes, aunque signifiquen lo mismo en contexto.
¿Cómo funciona la indexación semántica paso a paso?
La indexación semántica que usa IgeraFincas sigue cuatro pasos bien definidos, ejecutados automáticamente cuando se sube cualquier documento:
Fragmentación inteligente (chunking)
Cada PDF se divide en fragmentos de aproximadamente 500 tokens, respetando límites de párrafos, artículos y secciones. Un chunking mal hecho —cortar en mitad de una frase o mezclar artículos— destruye el contexto y degrada la calidad de las respuestas.
Vectorización (embedding)
Cada fragmento se convierte en un vector de 768 dimensiones usando Gemini Embedding 2. Este vector numérico captura el significado semántico del texto: «ascensor», «elevador» y «máquina de subida» generan vectores muy similares porque significan lo mismo en contexto.
Almacenamiento en pgvector
Los vectores se almacenan en Supabase PostgreSQL con extensión pgvector. Los índices IVFFlat permiten búsquedas por similitud en microsegundos, incluso con millones de fragmentos indexados de miles de documentos de diferentes comunidades.
Búsqueda por similitud coseno
Cuando un propietario hace una pregunta, esa pregunta también se convierte en un vector. El sistema busca los fragmentos cuyo vector sea más cercano al de la pregunta, usando similitud coseno (1.0 = significado idéntico, 0.0 = sin relación). El resultado: los fragmentos más relevantes semánticamente, no los que más palabras coinciden.
¿Cuál es la diferencia real entre búsqueda por palabras y búsqueda semántica?
| Característica | Búsqueda por palabras clave | Búsqueda semántica (RAG) |
|---|---|---|
| Qué compara | Caracteres exactos | Significado y contexto |
| Maneja sinónimos | No (necesita la palabra exacta) | Sí (entiende que «mantenimiento» = «conservació») |
| Funciona en múltiples idiomas | Solo si la palabra está en ese idioma | Sí, detecta similitud semántica multilingüe |
| Precisión en documentos legales | Baja (60%+ de consultas fallan) | Alta (>85% de consultas resueltas) |
| Genera respuesta en lenguaje natural | No (devuelve documentos) | Sí (responde citando el artículo exacto) |
| Velocidad | Muy rápida | <100ms con pgvector + IVFFlat |
¿Cómo IgeraFincas aplica esto a la administración de comunidades?
IgeraFincas indexa de forma semántica todos los documentos de cada comunidad: estatutos, reglamento interno, actas de junta, contratos de mantenimiento, y también la LPH (Ley de Propiedad Horizontal) y el Código Civil de Cataluña como base de conocimiento pública. Cuando un propietario hace una pregunta, el sistema:
- Convierte la pregunta en un vector de 768 dimensiones
- Busca en la base de datos vectorial de esa comunidad específica (nunca mezcla datos de diferentes comunidades)
- Recupera los 3-5 fragmentos más relevantes semánticamente
- Los envía como contexto a Gemini 2.0 Flash para generar una respuesta en lenguaje natural
- La respuesta cita el artículo exacto y el documento de origen
El resultado no es una lista de documentos para que el propietario lea. Es una respuesta directa: «Según el Art. 7 de los Estatutos de vuestra comunidad, el mantenimiento de elementos comunes es responsabilidad de la comunidad y se sufragará con el fondo de reserva. Para este tipo de reparación, el administrador debe convocar presupuestos a tres empresas.»
¿Qué documentos se pueden indexar con IgeraFincas?
El sistema acepta PDFs de cualquier tipo de documento de comunidad. Los más habituales son estatutos de la comunidad, reglamento de régimen interno, actas de juntas de propietarios, contratos de mantenimiento de ascensor, contrato de limpieza, pólizas de seguro del edificio, y presupuestos anuales aprobados. Todos se indexan automáticamente al subirlos, sin que el administrador tenga que hacer ninguna configuración adicional.
Además, IgeraFincas incluye de base la LPH completa y el CCC (Código Civil de Cataluña en la parte de comunidades horizontales), que actúan como capa de conocimiento público disponible para todas las comunidades sin necesidad de subirlos manualmente.
¿Quieres ver la búsqueda semántica en acción?
IgeraFincas responde preguntas de propietarios citando el artículo exacto de los estatutos o la LPH. Pruébalo 14 días sin compromiso.
Prueba gratis 14 días¿Qué es la similitud coseno y por qué importa?
La similitud coseno es la métrica matemática que el sistema usa para comparar vectores. Mide el ángulo entre dos vectores en un espacio de 768 dimensiones. Un valor de 1.0 significa que los dos textos tienen significado idéntico. Un valor de 0.0 significa que no tienen ninguna relación semántica. Un valor de 0.85 o superior generalmente indica que el fragmento recuperado es muy relevante para la pregunta planteada.
Esta métrica permite a IgeraFincas devolver solo los fragmentos realmente relevantes y descartar los que coinciden en una palabra pero no en el contexto. Es la diferencia entre encontrar todos los documentos que mencionan «agua» y encontrar específicamente los que hablan de responsabilidad por filtraciones de agua en elementos comunes.
Resumen: Ventajas de la indexación semántica
- Encuentra información aunque el propietario use vocabulario diferente al del estatuto
- Funciona en español, catalán e inglés sin configuración adicional
- Respuestas en <100ms incluso con millones de fragmentos indexados
- Cita el artículo y el documento exacto en cada respuesta
- Nunca mezcla documentos de comunidades diferentes (aislamiento por comunidad)
Preguntas frecuentes sobre búsqueda semántica en comunidades
¿La búsqueda semántica funciona con documentos escaneados?
Sí, con OCR previo. IgeraFincas procesa automáticamente PDFs escaneados usando reconocimiento óptico de caracteres antes de vectorizarlos. La calidad del OCR afecta a la calidad de la indexación, por lo que se recomienda subir documentos en formato texto cuando sea posible.
¿Cuánto tarda en indexarse un documento nuevo?
Un estatuto de 20-30 páginas tarda entre 30 y 90 segundos en procesarse completamente: OCR si es necesario, fragmentación, generación de embeddings en batch y almacenamiento en pgvector. Después, el documento está disponible inmediatamente para consultas.
¿Puede el sistema confundir artículos de comunidades diferentes?
No. IgeraFincas filtra estrictamente por comunidad en cada consulta. Los vectores de cada comunidad están etiquetados con su community_id y las búsquedas nunca cruzan ese límite. Un propietario del edificio A nunca recibirá información del edificio B.
¿Qué pasa si la respuesta no está en los documentos?
Si ningún fragmento supera el umbral mínimo de similitud coseno, el sistema responde que no ha encontrado información específica en los documentos de la comunidad y sugiere contactar directamente con el administrador. Nunca inventa información («alucinaciones») porque está obligado a citar la fuente.
¿Qué modelo de embedding usa IgeraFincas?
IgeraFincas usa Gemini Embedding 2 de Google, que genera vectores de 768 dimensiones optimizados para recuperación semántica en documentos legales y técnicos en español, catalán e inglés.
¿Cuánto cuesta añadir indexación semántica a mi despacho?
La indexación semántica está incluida en todos los planes de IgeraFincas (desde €99/mes por despacho, comunidades ilimitadas). No hay coste adicional por número de documentos indexados ni por número de consultas.
Actualizado: junio 2026 · Tecnología: Gemini Embedding 2, pgvector, Supabase · Autor: Equipo Técnico IgeraSolutions · Más info: IgeraFincas