IA General

Indexació Semàntica: Sistema de Cerca Intel·ligent

Igera Solutions
17 de juny del 2026
12 min read

IA General

Indexació Semàntica de Documents: Com la Cerca Intel·ligent Supera la Cerca per Paraules Clau

Quan un propietari pregunta «qui paga la reparació del portal?», un sistema de cerca clàssic busca la paraula «portal» als documents. Si l'estatut diu «elements comuns d'accés», no troba res. La cerca semàntica entén el significat de la pregunta, no les paraules exactes, i localitza l'article correcte encara que faci servir un vocabulari completament diferent. Així funciona IgeraFincas.

CERCA SEMÀNTICA (RAG): Tècnica de recuperació d'informació que converteix textos en vectors numèrics d'alta dimensió (embeddings) i els compara per similitud de significat, no per coincidència de caràcters. Permet trobar informació rellevant encara que la pregunta i el document facin servir vocabulari completament diferent per descriure el mateix concepte.

El 60% de les cerques documentals fallen

«En sistemes de cerca per paraules clau, més del 60% de les consultes en llenguatge natural no retornen el document correcte perquè l'usuari no fa servir exactament els mateixos termes que el document.»

— Stanford Information Retrieval Research Group, 2024

Per què falla la cerca per paraules clau amb documents legals?

Els documents legals —estatuts de comunitats, Llei de Propietat Horitzontal, reglaments interns— tenen una característica que els fa especialment difícils de cercar amb eines convencionals: fan servir sinònims tècnics de manera sistemàtica. Un estatut pot usar «conservació» on el propietari diu «manteniment». Pot dir «elements privatius» on el veí pregunta per «el meu pis». Pot referir-se a «l'administrador de la finca» on l'usuari cerca «el gestor».

Amb cerca per paraules clau —l'equivalent digital del Ctrl+F— aquestes diferències de vocabulari fan que el sistema retorni zero resultats, encara que la resposta sigui literalment al document. La conseqüència: l'administrador ha de cercar manualment, o pitjor, el propietari rep una resposta incorrecta o cap.

Exemple real: Un estatut diu «El administrador és responsable de la conservació dels espais comunitaris». Si un propietari pregunta per «manteniment de zones comunes», una cerca per paraules clau no trobarà aquest article. Les paraules no coincideixen. La cerca semàntica el trobarà immediatament, perquè el significat és idèntic.

Com funciona la indexació semàntica pas a pas?

La pipeline d'indexació semàntica que fa servir IgeraFincas segueix quatre passos ben definits, executats automàticament quan es puja qualsevol document:

1

Fragmentació intel·ligent (chunking)

Cada PDF es divideix en fragments d'aproximadament 500 tokens, respectant límits de paràgrafs, articles i seccions. Un chunking mal fet —tallar a la meitat d'una frase o barrejar articles— destrueix el context i degrada la qualitat de les respostes.

2

Vectorització (embedding)

Cada fragment es converteix en un vector de 768 dimensions fent servir Gemini Embedding 2. Aquest vector numèric captura el significat semàntic del text: «ascensor», «elevador» i «màquina de pujada» generen vectors molt similars perquè signifiquen el mateix en context.

3

Emmagatzemament en pgvector

Els vectors d'embedding s'emmagatzemen a Supabase PostgreSQL amb l'extensió pgvector. Els índexs IVFFlat permeten cerques de similitud en microsegons, fins i tot amb milions de fragments indexats de milers de documents de comunitats diferents.

4

Cerca per similitud semàntica (cosinus)

Quan un propietari fa una pregunta, aquesta pregunta també es converteix en un vector. El sistema busca els fragments el vector dels quals sigui més proper al de la pregunta, usant similitud cosinus (1.0 = significat idèntic, 0.0 = cap relació semàntica). El resultat: els fragments més rellevants semànticament, no els que més paraules coincideixen.

Cerca per paraules clau vs cerca semàntica RAG: comparació directa

Característica Cerca per paraules clau Cerca semàntica (RAG)
Què compara Caràcters exactes Significat i context
Gestiona sinònims No (requereix la paraula exacta) Sí («manteniment» = «conservació» = «maintenance»)
Suport multilingüe Només si la paraula és en aquell idioma Sí, similitud semàntica entre idiomes
Precisió en documents legals Baixa (60%+ de consultes fallen) Alta (>85% de consultes resoltes)
Genera resposta en llenguatge natural No (retorna llista de documents) Sí, citant l'article exacte
Velocitat Molt ràpida <100ms amb pgvector + IVFFlat

Com aplica IgeraFincas la cerca semàntica a la gestió de comunitats?

IgeraFincas indexa semànticament tots els documents de cada comunitat: estatuts, reglament de règim intern, actes de junta, contractes de manteniment, pòlisses d'assegurança i pressupostos anuals aprovats. Inclou també la LPH completa i el CCC (Codi Civil de Catalunya en la part de comunitats horitzontals) com a base de coneixement públic disponible per a totes les comunitats. Quan un propietari fa una pregunta, IgeraFincas:

  1. Converteix la pregunta en un vector de 768 dimensions
  2. Cerca a la base de dades vectorial d'aquella comunitat específica (mai barreja dades de comunitats diferents)
  3. Recupera els 3-5 fragments més rellevants semànticament
  4. Els envia com a context a Gemini 2.0 Flash per generar una resposta en llenguatge natural
  5. La resposta cita l'article exacte i el document d'origen

Vols veure la cerca semàntica en acció?

IgeraFincas respon preguntes de propietaris citant l'article exacte dels estatuts o la LPH. Prova-ho 14 dies sense compromís.

Prova gratis 14 dies

Preguntes freqüents sobre cerca semàntica en comunitats

La cerca semàntica funciona amb documents PDF escanejats?

Sí, amb OCR previ. IgeraFincas processa automàticament PDFs escanejats fent servir reconeixement òptic de caràcters abans de vectoritzar-los. Els PDFs en format text produeixen una qualitat d'indexació superior, però els documents escanejats estan totalment suportats.

Quant tarda a indexar-se un document nou?

Un estatut de 20-30 pàgines tarda entre 30 i 90 segons a processar-se completament: OCR si cal, fragmentació, generació d'embeddings en lot i emmagatzemament a pgvector. Després, el document és disponible immediatament per a consultes.

El sistema pot confondre articles de comunitats diferents?

No. IgeraFincas filtra estrictament per comunitat en cada consulta. Els vectors de cada comunitat estan etiquetats amb el seu community_id i les cerques mai creuen aquest límit. Un propietari de l'edifici A mai rebrà informació de l'edifici B.

Què passa si la resposta no és als documents?

Si cap fragment supera el llindar mínim de similitud semàntica, el sistema respon que no ha trobat informació específica als documents de la comunitat i suggereix contactar directament amb l'administrador. Mai inventa informació, perquè totes les respostes han de citar una font recuperable.

Quin model d'embedding fa servir IgeraFincas?

IgeraFincas fa servir Gemini Embedding 2 de Google, que genera vectors de 768 dimensions optimitzats per a recuperació semàntica en documents legals i tècnics en castellà, català i anglès.

La indexació semàntica està inclosa al preu d'IgeraFincas?

Sí. La indexació semàntica està inclosa en tots els plans d'IgeraFincas (des de €99/mes per despatx, comunitats il·limitades). No hi ha cap cost addicional per nombre de documents indexats ni per nombre de consultes contestades.

Actualitzat: juny 2026 · Tecnologia: Gemini Embedding 2, pgvector, Supabase · Autor: Equip Tècnic IgeraSolutions · Més info: IgeraFincas

#semántica#búsqueda#indexación#embeddings

COMPARTIR

Comparte el conocimiento con tu red