La historia de la consulta en 26 objetos: los catálogos, las fichas, las tablas y los buscadores con los que aprendimos a encontrar lo que ya habíamos guardado. De la biblioteca de Nínive al chatbot que contesta sin decir de dónde.
−650 ───────── 2026 · 7 salas · 26 objetos
El documento0 palabras
Índice invertido0 términos
Cambia el texto y busca una palabra. El buscador no lee el texto: va directo a la lista. Por eso encontrar cuesta lo mismo en mil páginas que en mil millones.
Baja para empezar el viaje
Guardar es solo la mitad del problema. Un dato que no puedes encontrar es un dato que no tienes: cuando se perdió la Biblioteca de Alejandría no desaparecieron solo los libros, desapareció el catálogo que decía qué había existido. Este ala cuenta la otra mitad: cómo aprendimos a preguntar.
Cuatro hilos cosen las siete salas. Fíjate en ellos:
① Del montón al orden
Cada objeto de este ala inventa una manera de no tener que mirarlo todo. Buscar bien es, sobre todo, poder descartar.
② El índice se paga antes
Encontrar rápido nunca es gratis: alguien ordenó, indexó o enlazó primero. La pregunta siempre es quién paga esa factura.
③ El orden no es neutral
Quien decide las categorías decide qué es normal y qué es una excepción. Dewey, el ranking y la recomendación son la misma decisión con otro nombre.
④ De la lista a la respuesta
Antes te decían dónde mirar y mirabas tú. Ahora te dan la conclusión. Se gana tiempo y se pierde el rastro de dónde salió.
Sala I
El orden
650 a.C. — 1500
Poner las cosas en un sitio para poder volver a ellas.
¿Cómo se busca algo entre treinta mil tablillas?
Nº 01 / 26 · Sala I
La biblioteca de Asurbanipal
s. VII a.C.
Origen
Nínive, junto a la actual Mosul (Irak); la biblioteca del rey asirio Asurbanipal
Función
Unas 30.000 tablillas agrupadas por materia, cada una con un colofón: qué obra es y qué número de tablilla ocupa
Dato brutal
Es la primera colección de la que sabemos que estaba ordenada para consultarla, y no solo guardada
Por qué importa. El colofón es una signatura: título, número de tablilla, dueño. Sin él, treinta mil tablillas son un montón; con él, son una biblioteca. Y fíjate en lo que es ese colofón: un dato sobre el dato, escrito en el borde para no tener que abrir nada. La diferencia entre almacenar y poder consultar cabe en un margen.
¿Sabías que…?
La biblioteca ardió cuando Nínive cayó, en 612 a.C. … y el incendio coció las tablillas y las conservó. Gracias a ese desastre podemos leer hoy el poema de Gilgamesh. La arcilla ya salía bien parada en el ala de los signos; aquí demuestra además que sobrevive a sus propias bibliotecas.
Hilo ① · del montón al orden
pero…ordenar por materia funciona si sabes de qué materia es lo que buscas. ¿Y si solo recuerdas una palabra?
Nº 02 / 26 · Sala I
El orden alfabético
s. III a.C. → s. XIII
Origen
Apuntado en Alejandría por Calímaco; generalizado en la Europa del siglo XIII
Función
Ordenar por una propiedad del signo —la letra— y no por materia, antigüedad ni importancia
Dato brutal
Tardó unos mil quinientos años en imponerse. Se consideraba un orden sin sentido
Por qué importa. Es el primer orden arbitrario, y precisamente por eso el primero universal: no exige saber nada del contenido. Cualquiera puede colocar y cualquiera puede recorrer sin entender el tema. Toda la informática vive de esa idea —ordenar por una clave que en sí misma no significa nada— y de su consecuencia: si está ordenado, puedes descartar la mitad sin mirarla.
¿Sabías que…?
A muchos eruditos medievales les parecía casi impío ordenar el saber por la letra en lugar de por su jerarquía, que empezaba en Dios y bajaba. Ordenar la teología como quien ordena una lista de la compra era una falta de respeto al orden del mundo. Cuando ordenas tus archivos por nombre estás usando una tecnología que costó siglos de discusión teológica.
Hilo ③ · el orden no es neutral
Pruébalo
Hojear o buscar
Treinta y dos fichas, una palabra en cada una. Busca la que se te pide pulsando fichas. Primero están en el orden en que llegaron; luego, ordenadas. La segunda vez no vas a mirar ni seis, y no porque busques mejor.
Busca la ficha: —
fichas miradas 0peor caso en este orden 32de media 16,5
pero…el alfabeto ordena los títulos, no lo que dicen por dentro. Para saber en qué página se habla del agua, hay que leerse el libro entero.
Nº 03 / 26 · Sala I
La concordancia bíblica
~1230
Origen
Convento dominico de Saint-Jacques, París, bajo la dirección de Hugo de Saint-Cher
Función
Listar cada palabra de la Biblia con todos los lugares donde aparece
Dato brutal
La tradición habla de quinientos frailes trabajando en ella. Es un índice invertido hecho a mano
Por qué importa. Es exactamente lo que hace el buscador de la portada de este museo, con pluma y en un convento. Y tiene una consecuencia que cambia la manera de leer: por primera vez se puede consultar un libro sin leerlo, entrando por la palabra. El texto deja de ser un camino que se recorre y se convierte en un espacio en el que se entra por donde quieras.
¿Sabías que…?
Para que las referencias sirvieran de algo hubo que inventar antes una forma de nombrar un sitio exacto dentro del texto: el capítulo y el versículo. La división en capítulos que todavía usamos se atribuye a Stephen Langton, del mismo París y de apenas una generación antes. Sin coordenadas no hay índice: primero hay que poder decir «aquí».
Hilo ② · el índice se paga antes
pero…esa concordancia es de ese libro, y costó una generación de frailes. Nadie va a hacer lo mismo con cada libro nuevo que aparezca.
Nº 04 / 26 · Sala I
El índice y la paginación
1470 — 1500
Origen
Los talleres de la generación siguiente a Gutenberg, en Venecia, Núremberg y Colonia
Función
Una lista alfabética al final del libro, con el número de página al lado de cada entrada
Dato brutal
En un manuscrito el número de página no sirve para nada: cada copia lo tiene en otro sitio
Por qué importa. El índice necesita coordenadas estables, y las coordenadas estables solo existen si la copia es exacta. La imprenta no solo multiplicó los libros: hizo posible referirse a un punto concreto de uno. Es la misma condición que cumple un enlace, y la misma que incumple una web que cambia de sitio: una dirección solo vale si apunta siempre a lo mismo.
¿Sabías que…?
«Índice» viene del latín index, el dedo que señala: el índice de un libro y el índice de tu mano son la misma palabra porque hacen el mismo trabajo. Y tardó en cuajar: muchos incunables se imprimieron todavía sin numerar las páginas, con el índice remitiendo a la primera palabra de la hoja en lugar de a un número.
Hilo ② · el índice se paga antes
pero…el índice sigue cosido a su libro. Para contestar algo que cruce dos libros hay que leerse los dos. Y en 1500 ya hay demasiados libros.
Parada · Sala I
¿Qué añade el colofón de una tablilla asiria?
✓ Escrito en el borde, para no tener que abrir nada. Sin él, treinta mil tablillas son un montón; con él, una biblioteca.
Sala II
La ficha
1545 — 1934
Sacar el dato del libro para poder recombinarlo.
¿Y si cada dato pudiera cambiar de sitio sin copiarlo otra vez?
Nº 05 / 26 · Sala II
La Bibliotheca universalis
1545
Origen
Conrad Gessner, médico y naturalista, en Zúrich
Función
Catalogar todo lo publicado en latín, griego y hebreo: unos tres mil autores
Dato brutal
Explica también el método: recortar las entradas en tiras para poder reordenarlas sin volver a copiarlas
Por qué importa. Dos saltos a la vez. El catálogo se despega del edificio: Gessner cataloga lo que existe, no lo que tiene en su estante. Y describe la operación que lo cambia todo: si cada dato va en un trozo suelto, reordenar sale gratis. Copiar es caro; mover es barato. Toda la informática de datos es esa frase.
¿Sabías que…?
Gessner era sobre todo naturalista —su Historia animalium es de las grandes obras del siglo XVI— y para él catalogar el saber era otra rama de la historia natural: clasificar libros o clasificar animales, el mismo oficio. Murió de peste a los 49 años mientras seguía trabajando en el catálogo.
Hilo ① · del montón al orden
pero…una hoja con tiras pegadas sigue siendo una hoja: para intercalar algo nuevo en medio, hay que despegar. Falta que la ficha sea de verdad suelta.
Nº 06 / 26 · Sala II
Las fichas de la Revolución
1791
Origen
Francia; instrucción del gobierno revolucionario para inventariar los libros confiscados
Función
Un asiento por obra, escrito en el reverso en blanco de un naipe
Dato brutal
Se considera el primer código nacional de catalogación del mundo
Por qué importa. Los naipes de la época tenían el reverso en blanco y eran el único papel resistente y de tamaño idéntico que había a mano por millones. Con eso, el registro deja de ser una línea dentro de un libro —que no se puede mover— y pasa a ser un objeto independiente: se intercala, se reordena, se presta, se pierde. Es la diferencia entre una anotación y un registro; entre un texto y una fila de una tabla.
¿Sabías que…?
La instrucción no solo decía dónde escribir, decía cómo: copiar el título tal como aparece, con sus mayúsculas, y añadir formato, materia y estado de conservación. Es la primera norma de descripción bibliográfica, y su descendiente directo es el formato con el que hoy dos bibliotecas de países distintos intercambian catálogos sin hablar el mismo idioma.
Hilo ① · del montón al orden
pero…con millones de fichas iguales el problema se muda otra vez. Ya no es el soporte: es en qué orden se ponen, y quién decide las categorías.
Nº 07 / 26 · Sala II
La Clasificación Decimal de Dewey
1876
Origen
Melvil Dewey, con 21 años, trabajando en la biblioteca del Amherst College
Función
Diez clases, cada una en diez divisiones y cada una en diez secciones, con notación decimal
Dato brutal
Sigue en uso en decenas de miles de bibliotecas de más de cien países, siglo y medio después
Por qué importa. El invento no son las diez clases: es la notación. 512.24 dice «dentro de ciencias, dentro de matemáticas, dentro de álgebra, ecuaciones», y siempre cabe otro decimal, así que puedes añadir un tema nuevo entre dos existentes sin mover un solo libro. Es un árbol escrito dentro de la propia clave, exactamente como una ruta de carpetas o una URL.
¿Sabías que…?
Mira el reparto: de las diez clases, una entera es para religión, y de sus cien divisiones unas ochenta son cristianismo; todas las demás religiones del planeta caben en el 290-299. El orden nunca es neutral: lo escribe alguien, desde algún sitio y en algún año. Y el propio Dewey acabó expulsado de la asociación de bibliotecarias y bibliotecarios que él había fundado por acosar a sus compañeras: en 2019 la profesión le quitó su nombre a su medalla más importante.
Hilo ③ · el orden no es neutral
Clasifica tú
Seis libros, diez cajones
Coloca cada libro en su clase de Dewey. No hace falta saber la clasificación: fíjate en dónde te obliga a ponerlos, que es lo que se aprende aquí.
Libro 1 de 6: —
pero…Dewey ordena los libros de una biblioteca. ¿Y si alguien quisiera ordenar todo lo que se ha escrito, esté donde esté?
Nº 08 / 26 · Sala II
El Mundaneum de Paul Otlet
1895 — 1934
Origen
Bruselas; Paul Otlet y Henri La Fontaine
Función
Un fichero universal de todo lo publicado, ordenado con la Clasificación Decimal Universal
Dato brutal
De 400.000 fichas en 1895 a 15.646.346 en 1934. Contadas
Por qué importa. Otlet añade a Dewey unos signos para combinar materias, y con eso se puede preguntar por «la química del vino en Francia» cruzando tres notaciones: la consulta compleja, medio siglo antes del ordenador. Y saca la consecuencia que nadie había sacado: si el fichero es universal, el usuario no tiene que estar en el edificio. Montó un servicio que respondía preguntas por correo y por telégrafo, pagando por consulta. Un buscador con sellos.
¿Sabías que…?
En 1934 dibujó su mondothèque: una mesa de trabajo con pantallas para consultar el fichero a distancia y saltar de un documento a otro. Sesenta años antes de la web, y sin electrónica que lo hiciera posible. El final es amargo: el Mundaneum fue desalojado, parte de sus salas se usaron para exponer arte del Tercer Reich y miles de fichas acabaron en la basura. Lo que se salvó está hoy en Mons, y se puede visitar.
Hilo ② · el índice se paga antes
pero…quince millones de fichas se consultan con las manos, una por una. El cuello de botella ya no es el orden: es el brazo.
Parada · Sala II
¿Qué permite la notación decimal de Dewey que no permitía una estantería numerada?
✓ Porque entre 512.2 y 512.3 siempre cabe un 512.24. La jerarquía va escrita dentro de la clave, igual que en una ruta de carpetas.
Sala III
La máquina de buscar
1945 — 1964
Que la búsqueda la haga la máquina.
¿Y si el camino por el saber lo pudieras trazar tú?
Nº 09 / 26 · Sala III
El Memex de Vannevar Bush
1945
Origen
Estados Unidos; Vannevar Bush, en el artículo «As We May Think» (julio de 1945)
Función
Un escritorio con microfilmes y dos pantallas donde el lector traza senderos entre documentos y los guarda
Dato brutal
No se construyó nunca. Es el objeto más influyente de este museo que jamás existió
Por qué importa. Bush ataca un problema que ni Dewey ni Otlet habían visto: no es que falte índice, es que el índice es de otro. Su propuesta es que cada lector abra sus propios caminos entre documentos y pueda prestárselos a otro. La palabra que usa es trails, senderos; nosotros lo llamamos historial, marcador, hilo, enlace. Y describe un oficio nuevo, el de quien abre caminos por el saber ajeno para que otros los recorran: eso es hoy media internet.
¿Sabías que…?
Bush había dirigido la investigación militar estadounidense durante la guerra, con miles de científicos a su cargo, y escribió el artículo preguntándose qué hacer con toda esa capacidad en tiempos de paz. Lo leyeron de jóvenes dos personas decisivas: Douglas Engelbart, que acabó inventando el ratón, y Ted Nelson, que en 1965 puso nombre a la idea —hipertexto— y arrancó Xanadu, un proyecto con enlaces de ida y vuelta que la web todavía no tiene.
Hilo ③ · el orden no es neutral
pero…un sendero personal sirve sobre todo a quien lo abrió. Para que la máquina busque sola, las palabras del propio documento tienen que ser su dirección.
Nº 10 / 26 · Sala III
El Uniterm de Mortimer Taube
1951
Origen
Mortimer Taube, Documentation Inc., Washington
Función
Describir cada documento con términos sueltos y buscar por combinación: los que tengan a la vez A y B
Dato brutal
Rompe la regla de un sitio por documento: uno puede estar a la vez en veinte listas
Por qué importa. Es el paso de la jerarquía a la etiqueta. Dewey te obliga a elegir una casilla; Taube te deja poner todas las palabras que hagan falta y encontrar por intersección. La consulta se convierte en una operación lógica —y, o, no— sobre listas de números, que es exactamente lo que hizo el índice invertido de la portada. Los hashtags son Uniterms con almohadilla.
¿Sabías que…?
El sistema se llevaba en fichas grandes, una por término, con los números de documento anotados en columnas. Para cruzar dos términos se ponían las dos fichas una al lado de la otra y se buscaban los números repetidos con la vista: un JOIN a ojo, con el dedo de guía. A los bibliotecarios clásicos les pareció una degradación —sin vocabulario controlado, cada uno etiqueta como quiere— y en eso no se equivocaban: es el mismo debate que hoy tenemos con las etiquetas de cualquier red social.
Hilo ② · el índice se paga antes
Pruébalo
Cruzar listas
Seis documentos etiquetados como los etiquetaría Taube. Pulsa una etiqueta para exigirla, otra vez para excluirla y otra para dejarla en paz. Mira cuántos documentos van cayendo: eso es una consulta.
con Y tienen que estar todas; con O, cualquiera
pero…cruzar dos columnas de números con la vista funciona con mil documentos. Con un millón hay que ir directamente al dato, y una cinta magnética no deja: es un rollo, y hay que rebobinarlo.
Nº 11 / 26 · Sala III
El acceso directo
1956
Origen
IBM San José, California; la primera unidad se entregó en junio de 1956
Función
Cincuenta discos de 61 cm girando a 1.200 rpm y un brazo que va a cualquier pista: 5 millones de caracteres, unos 3,75 MB
Dato brutal
Pesaba alrededor de una tonelada y no se vendía: se alquilaba por meses
Por qué importa. RAMAC son las siglas de Random Access Method of Accounting and Control, y la palabra que importa es random: acceso directo. Con cinta, para leer el registro 900 hay que pasar por los 899 anteriores. Con disco, el brazo va y vuelve. Sin eso no existe la consulta interactiva —preguntar y que te contesten ahora— y por tanto no existe nada de lo que viene en la sala siguiente.
¿Sabías que…?
Esto ya se había inventado con papel: el códice del siglo IV cambió el rollo por hojas cosidas precisamente para poder abrir por la página 128 sin rebobinar. La informática empezó con cintas, o sea con rollos, y tardó otros mil quinientos años en recuperar el acceso aleatorio. Casi todos los inventos de este museo son la segunda vez que alguien tiene la misma idea.
Hilo ① · del montón al orden
pero…el acceso directo resuelve cómo llegar, no a dónde. Con cien mil artículos publicados al año, la pregunta ya no es dónde está uno: es cuál de todos merece la pena.
Nº 12 / 26 · Sala III
El índice de citas
1955 → 1964
Origen
Eugene Garfield, Institute for Scientific Information, Filadelfia
Función
Indexar no por materia, sino por referencia: quién cita a quién
Dato brutal
La primera edición impresa (1964) cubría 613 revistas y 1,4 millones de citas
Por qué importa. Es el primer índice que no describe el contenido de un documento, sino su relación con los demás. Y de ahí sale una idea explosiva: si mucha gente cita un artículo, probablemente importe. La autoridad deja de ser una opinión y se convierte en una cuenta. Treinta y cuatro años más tarde, dos estudiantes de Stanford harán exactamente esto con los enlaces de la web y le pondrán otro nombre.
¿Sabías que…?
Garfield copió la idea de un índice jurídico del siglo XIX que servía para saber si una sentencia seguía en vigor o la había tumbado otra posterior. Y la criatura se le escapó: el «factor de impacto», que él inventó como herramienta para decidir qué revistas indexar, acabó usándose para evaluar personas —contratos, plazas, sexenios— y pasó el resto de su vida protestando contra ese uso. Todo ranking acaba convirtiéndose en el objetivo de alguien.
Hilo ③ · el orden no es neutral
pero…todo esto son índices que alguien construye a mano sobre documentos que alguien ha descrito a mano. Los datos de una empresa no son documentos: son millones de registros que cambian cada día, y cada programa los guarda a su manera.
Parada · Sala III
¿Qué cambia el Uniterm respecto a la clasificación de Dewey?
✓ De la jerarquía a la etiqueta: en vez de elegir una casilla, se ponen todas las palabras necesarias y se busca por intersección. Es lo que hace tu buscador.
Sala IV
La tabla
1970 — 1979
Separar lo que quieres saber de cómo se busca.
¿Y si pudieras pedir el resultado sin explicar el camino?
Nº 13 / 26 · Sala IV
El modelo relacional de Codd
1970
Origen
Edgar F. Codd, laboratorio de IBM en San José, California
Función
Describir los datos como tablas y consultarlas con un álgebra, sin decir cómo están guardados
Dato brutal
IBM ya vendía otra cosa y tardó años en hacer caso a su propio investigador
Por qué importa. Antes, el programa tenía que saber cómo estaban guardados los datos: punteros, orden físico, jerarquía. Cambiar el almacenamiento rompía los programas. Codd propone lo contrario: describe los datos como tablas y deja que la máquina decida el camino. Eso se llama independencia de los datos, y es la razón de que una aplicación escrita en 1985 pueda seguir funcionando sobre un disco que no existía cuando se escribió.
¿Sabías que…?
Codd venía de la lógica matemática, y su álgebra —seleccionar filas, proyectar columnas, combinar tablas— es teoría de conjuntos aplicada a la contabilidad. Y era un hombre de principios incómodos: cuando IBM sacó SQL le pareció que se apartaba de su modelo, y publicó una lista de doce reglas (trece, contando la número 0) para decidir si un sistema era relacional de verdad. Casi ningún producto de la época las cumplía. Casi ninguno de hoy tampoco.
Hilo ① · del montón al orden
pero…el modelo es matemático y elegante, y por eso mismo no lo puede usar nadie: falta la forma de pedirle algo a una tabla sin escribir un programa.
Nº 14 / 26 · Sala IV
SQL
1974
Origen
IBM San José; Donald Chamberlin y Raymond Boyce, dentro del proyecto System R
Función
Un lenguaje declarativo: describes el resultado que quieres, no los pasos para conseguirlo
Dato brutal
Se diseñó para que lo escribiera gente sin formación técnica. Medio siglo después sigue siendo el idioma común de los datos
Por qué importa.SELECT dice qué columnas, FROM de dónde, WHERE con qué condición. En ningún sitio dices en qué orden recorrer las tablas ni qué índice usar: eso lo decide el optimizador, cada vez, según cómo estén los datos ese día. Es la primera vez que a un ordenador se le pide un resultado en lugar de un procedimiento, y es la razón de que la misma consulta siga sirviendo cuando la tabla pasa de mil filas a mil millones.
¿Sabías que…?
Se llamaba SEQUEL, y hubo que cambiarle el nombre porque una empresa aeronáutica británica ya tenía registrada la marca. De ahí las tres letras… y de ahí que media profesión lo pronuncie «síquel» y la otra mitad «ese-cu-ele», discusión que lleva cincuenta años sin resolverse y que no va a resolverse aquí.
Hilo ④ · de la lista a la respuesta
Pruébalo de verdad
Un SELECT que se ejecuta aquí mismo
Tres tablas y un SQL que corre en tu navegador, sin servidor y sin trampa: SELECT, JOIN, WHERE, GROUP BY, ORDER BY y LIMIT. Empieza por un ejemplo, y luego rómpelo a ver qué pasa.
pero…un lenguaje sin producto es un artículo de revista. Hace falta que alguien lo venda, lo mantenga y responda al teléfono cuando se rompe.
Nº 15 / 26 · Sala IV
Ingres y Oracle
1973 — 1979
Origen
Ingres, proyecto de Michael Stonebraker y Eugene Wong en Berkeley; Oracle, empresa de Larry Ellison, Bob Miner y Ed Oates
Función
Convertir el modelo relacional en un producto que se pueda comprar y mantener
Dato brutal
Ingres empezó antes, pero con su propio lenguaje (QUEL). Oracle llegó antes al mercado, en 1979, y con SQL
Por qué importa. Es el momento en que una idea académica se convierte en infraestructura, y explica el mapa de hoy: casi todas las bases de datos que usas descienden de uno de esos dos linajes. Del árbol de Berkeley salió además otra cosa: la costumbre de repartir el código. PostgreSQL es nieto directo de aquel proyecto universitario, y por eso hoy puedes montar en clase, gratis, la misma tecnología que sostiene un banco.
¿Sabías que…?
Ingres se distribuía por correo, en cinta magnética, a cambio de poco más que el coste del soporte. Aquella costumbre de universidad —te mando el código y haz con él lo que quieras— acabó siendo una de las grandes normas de la industria. Cuando instalas PostgreSQL estás usando la descendiente de una cinta que salía de Berkeley por unos dólares.
Hilo ② · el índice se paga antes
pero…todo esto sigue siendo para empresas con departamento de informática. La mayoría de la gente no va a escribir un SELECT en su vida.
Una tabla en pantalla donde cada celda guarda un dato o una fórmula que se recalcula sola
Dato brutal
La primera aplicación por la que la gente compraba el ordenador: querían VisiCalc, y el Apple II venía con él
Por qué importa. Es el modelo relacional para el resto de la humanidad: filas, columnas y fórmulas que declaran una relación entre celdas. No hace falta saber programar, pero se está programando. Hoy el mundo se administra con hojas de cálculo —presupuestos, notas, inventarios, la contabilidad de medio país— y son a la vez el sistema de información más usado del planeta y el que más errores contiene.
¿Sabías que…?
Bricklin lo imaginó en una clase de gestión en Harvard, viendo al profesor borrar y recalcular a mano una tabla en la pizarra: si cambiaba un número, había que rehacerlo todo. Y no pudo protegerlo: en 1979 el software apenas se patentaba en Estados Unidos, así que Lotus 1-2-3 copió la idea y en tres años se llevó el mercado. El invento que creó una industria no dio ni para conservar la empresa que lo hizo.
Hilo ④ · de la lista a la respuesta
pero…una tabla exige que alguien decida antes las columnas. Y a partir de 1993 empiezan a aparecer millones de documentos que nadie ha descrito: sin columnas, sin esquema y sin dueño.
Parada · Sala IV
¿Qué significa que SQL sea un lenguaje «declarativo»?
✓ Por eso la misma consulta sigue funcionando cuando la tabla crece de mil filas a mil millones: el camino lo vuelve a elegir el optimizador cada vez.
Sala V
El índice del mundo
1990 — 2001
Indexar lo que nadie ha ordenado.
¿Cómo se cataloga algo que nadie ha descrito y que cambia cada día?
Nº 17 / 26 · Sala V
Archie
1990
Origen
Alan Emtage, Bill Heelan y Peter Deutsch, Universidad McGill (Montreal)
Función
Un índice de los nombres de archivo de los servidores FTP públicos, consultable a distancia
Dato brutal
Es el primer buscador de internet, y es anterior a la web
Por qué importa. Aquí cambia quién hace el índice. Hasta ahora lo hacía siempre una persona: el escriba, el fraile, la bibliotecaria, el documentalista. Archie es un programa que sale a la red por su cuenta, mira qué hay y lo apunta. La descripción deja de ser humana, y con eso el índice puede crecer al ritmo de lo que describe. Todo lo que viene después es esta idea con más potencia.
¿Sabías que…?
Emtage lo escribió porque estaba harto de buscar programas a mano para sus compañeros: era una herramienta doméstica que se le fue de las manos. Decidieron no patentarlo, y él ha contado sin ningún drama que no ganó dinero con el primer buscador de internet, porque en 1990 a nadie se le ocurría que internet pudiera ser un negocio. Los buscadores que vinieron detrás se llamaron Veronica y Jughead: todos, chistes sobre el mismo cómic.
Hilo ① · del montón al orden
pero…un nombre de archivo no dice casi nada, y encima puede mentir. Con la web llegando, hace falta indexar lo que las páginas dicen por dentro.
Nº 18 / 26 · Sala V
AltaVista y el rastreador
1995
Origen
Digital Equipment Corporation, Palo Alto
Función
Recorrer la web enlace a enlace e indexar el texto completo de cada página
Dato brutal
Indexaba decenas de millones de páginas cuando la competencia publicaba listas hechas a mano
Por qué importa. Pasa de indexar nombres a indexar todo lo que hay escrito, y de golpe el índice es más grande que cualquier catálogo que haya existido nunca. Pero aparece a la vez el problema que define esta sala: si las palabras clave las escribe el dueño de la página, mentirá. Las metaetiquetas se llenaron de basura en dos años. Cuando el índice lo hace una máquina, la confianza deja de venir de quien describe.
¿Sabías que…?
AltaVista no era un negocio: era un escaparate técnico para demostrar lo rápidos que eran los servidores Alpha de DEC. Nadie en la empresa pensó que el buscador fuera el producto. La web tenía cuatro años y ya no se podía leer entera; la respuesta fue mirarla con una máquina, y a partir de ahí ya nunca hemos visto internet directamente: la vemos siempre a través de un índice que alguien construye.
Hilo ③ · el orden no es neutral
pero…si el autor de la página escribe su propia valoración, el índice hereda sus mentiras. Hace falta que la nota la ponga alguien que no sea el interesado.
Nº 19 / 26 · Sala V
PageRank
1998
Origen
Larry Page y Sergey Brin, en el laboratorio de Stanford
Función
Puntuar cada página según quién la enlaza, y no según lo que ella dice de sí misma
Dato brutal
La puntuación no se calcula: se itera. Se reparte el peso una y otra vez hasta que deja de moverse
Por qué importa. Es el índice de citas de Garfield aplicado a la web, y resuelve el problema de AltaVista de la única manera posible: la valoración no la escribe el autor, la escriben los demás. Es la diferencia entre un currículum y una carta de recomendación. Con eso el buscador deja de ser un índice y se convierte en un juez: no solo te dice dónde está, te dice qué merece la pena. Y esa decisión ya no la puede auditar nadie.
¿Sabías que…?
La iteración tiene una lectura muy visual: la puntuación de una página es la probabilidad de que alguien que va pulsando enlaces al azar acabe allí. Y el nombre de la empresa es una errata: querían escribir gúgol, el número 1 seguido de cien ceros. La patente quedó a nombre de la Universidad de Stanford, que años después vendió sus acciones por cientos de millones: el mayor beneficio económico de la historia de una oficina de transferencia tecnológica.
Hilo ③ · el orden no es neutral
Pruébalo
PageRank a mano
Cinco páginas que se enlazan entre ellas. Al principio todas valen lo mismo. Cada iteración reparte el valor de cada página a partes iguales entre las que enlaza, y se vuelve a sumar. Dale unas cuantas veces y mira dónde se para.
pero…un buen ranking necesita algo que ordenar, y alguien tiene que haber escrito las páginas. ¿Quién escribe el contenido del que vive todo esto?
Nº 20 / 26 · Sala V
Wikipedia
2001
Origen
Jimmy Wales y Larry Sanger, como derivación de un proyecto anterior con expertos y revisión
Función
Una enciclopedia que cualquiera puede editar, con las categorías creciendo desde el uso
Dato brutal
Más de sesenta millones de artículos en cerca de trescientos idiomas, sin cobrar y sin publicidad
Por qué importa. Es el sueño de Otlet cumplido por el camino que él no imaginó: no lo construye una institución con un plan, lo construyen desconocidos discutiendo en público. Y su estructura no la diseñó nadie: las categorías, las redirecciones y las desambiguaciones emergen del uso, que es exactamente lo contrario de Dewey. Además es el suelo del que come todo lo demás: cuando un buscador te resume algo, muchas veces estás leyendo a un voluntario.
¿Sabías que…?
En Wikipedia la página de discusión es tan interesante como el artículo: ahí se ve cómo se negocia un hecho. Y hay una asimetría que da vértigo: casi todos los modelos de lenguaje se han entrenado con Wikipedia, y a la vez la gente entra menos porque ya se lo cuenta el chatbot. El pozo del que todos beben se está quedando sin quien lo llene, y ese es hoy uno de los problemas abiertos de este museo.
Hilo ② · el índice se paga antes
pero…el índice del mundo ya no cabe en una máquina. Ni el índice, ni la pregunta, ni la respuesta.
Parada · Sala V
¿Qué problema de AltaVista resolvió PageRank?
✓ Es la diferencia entre un currículum y una carta de recomendación. Y es la misma idea del índice de citas de Garfield, de 1964.
Sala VI
El dato de todos
2003 — 2009
Cuando la respuesta hay que repartirla entre mil máquinas.
¿Qué contestas cuando la mitad de tus máquinas no te habla?
Nº 21 / 26 · Sala VI
MapReduce
2003 — 2004
Origen
Google; Sanjay Ghemawat y Jeff Dean, junto al sistema de ficheros GFS
Función
Partir el cálculo en trozos que se hacen a la vez (map) y juntar los resultados (reduce)
Dato brutal
El diseño da por supuesto que las máquinas se rompen. Cuando una cae, su trozo se reparte otra vez y nadie se entera
Por qué importa. Cambia el supuesto de toda la sala anterior: ya no hay una máquina grande con un disco, hay mil máquinas mediocres y el problema es repartir la pregunta. Y el modelo es viejísimo: es exactamente lo que hicieron los frailes de la concordancia en 1230 —cada uno un trozo del libro, y al final alguien junta las listas—. MapReduce es un convento dominico con electricidad.
¿Sabías que…?
Google publicó los artículos con todo el diseño, pero no el código. Una comunidad los reimplementó desde cero y de ahí salió Hadoop, que sostuvo el big data de toda una década. Publicar la idea y guardarse el código acabó creando la competencia: la mayoría de las empresas que usaron Hadoop nunca pagaron nada a Google, pero tampoco habrían sabido qué construir.
Hilo ① · del montón al orden
pero…si la respuesta la calculan mil máquinas y en medio se cae la red, hay que decidir qué contestar: lo que sabías hace un minuto, o nada.
Nº 22 / 26 · Sala VI
El teorema CAP
2000 — 2007
Origen
Eric Brewer lo plantea como conjetura en 2000; Gilbert y Lynch lo demuestran en 2002. Amazon publica Dynamo en 2007
Función
Con los datos repartidos y la red partida, hay que elegir: contestar con datos posiblemente viejos, o no contestar
Dato brutal
No es una limitación que se pueda arreglar con más dinero: es un teorema
Por qué importa. Es la primera vez que este museo se topa con un límite demostrado. Todo lo anterior era ingenio, y el ingenio siempre puede mejorar; esto es una imposibilidad. Y obliga a una decisión que no es técnica sino de negocio: Amazon decidió que el carrito de la compra debe aceptar siempre un artículo, aunque después haya que arreglar alguna incoherencia, porque perder una venta es peor que tener un carrito raro. Un banco decide justo lo contrario.
¿Sabías que…?
De aquí salió la etiqueta «NoSQL», que es un nombre malísimo: no dice qué hacen esas bases de datos, solo qué no son. Y tiene un final irónico: quince años después casi todas han acabado añadiendo un lenguaje de consultas… parecido a SQL. Resulta que la gente quería seguir preguntando igual.
Hilo ② · el índice se paga antes
Elige dos de tres
Se corta la fibra entre Gavà y Girona
Los mismos datos viven en dos servidores, uno en cada sitio, y la línea que los une acaba de caerse. Elige las dos propiedades que quieres conservar: la tercera no la puedes tener, y no por falta de presupuesto.
pero…ya sabemos repartir la pregunta y elegir qué sacrificar. Queda una vuelta más incómoda: ¿y si el sistema deja de esperar a que preguntes?
Nº 23 / 26 · Sala VI
El premio Netflix
2006 — 2009
Origen
Netflix publica 100 millones de valoraciones «anónimas» y ofrece un millón de dólares por mejorar su recomendador un 10 %
Función
Adivinar qué querrías ver antes de que lo busques
Dato brutal
Ganó un equipo que combinaba más de cien modelos. Netflix nunca llegó a poner la solución ganadora en producción: era demasiado complicada
Por qué importa. Es el giro de todo el museo. Durante dos mil seiscientos años el sistema esperaba una pregunta: la tablilla, la ficha, el índice, el buscador. Aquí el catálogo se adelanta y propone. Y con eso el orden deja de ser tuyo: ya no ves lo que hay, ves lo que se ha decidido que verías. La pregunta «¿qué hay?» se convierte en «¿qué me ponen?».
¿Sabías que…?
El concurso acabó en un problema de privacidad de manual. Dos investigadores demostraron que cruzando las valoraciones «anónimas» con las públicas de IMDb se podía identificar a personas concretas —y con ellas, lo que veían—. Netflix canceló la segunda edición tras una demanda. La lección vale para cualquier conjunto de datos: anonimizar es mucho más difícil de lo que parece, porque nadie tiene tus mismos gustos.
Hilo ④ · de la lista a la respuesta
pero…si el sistema decide qué te enseña, la pregunta ya no es del todo tuya. Y aún queda un paso más: que en vez de una lista te dé directamente una respuesta.
Parada · Sala VI
Se parte la red entre dos servidores con los mismos datos. Según el teorema CAP, ¿qué NO puedes tener a la vez?
✓ O contestas con datos posiblemente viejos, o no contestas. Amazon eligió lo primero para el carrito; un banco elige lo segundo. Y no es una decisión técnica.
Sala VII
La respuesta
2008 — hoy
Cuando la máquina contesta en vez de darte una lista.
¿Qué se pierde cuando ya no te dicen de dónde lo han sacado?
Nº 24 / 26 · Sala VII
Preguntar sin escribir
2008 — 2011
Origen
Varios a la vez: Shazam con el audio (2002), la búsqueda por voz en el móvil (2008), la búsqueda por imagen (2009), los asistentes (2011)
Función
Consultar con la voz, con una foto o con un trozo de canción: la pregunta se despega del teclado
Dato brutal
Una foto no tiene palabras. Para poder buscarla, el índice tiene que estar hecho de otra cosa
Por qué importa. Hasta aquí, absolutamente todo este museo indexa palabras: colofones, entradas, descriptores, términos, texto completo. Una canción o una fotografía no tienen palabras, así que hay que convertirlas en números comparables: una huella acústica, un vector de rasgos. Es el primer índice de este museo que no está hecho de lenguaje, y es la puerta de lo que viene ahora.
¿Sabías que…?
Shazam no compara la canción: compara una huella, unos pocos picos de frecuencia colocados en el tiempo, que sobreviven al ruido de un bar y a un altavoz malo. Es el mismo truco que la función resumen del ala de los signos: reducir algo enorme a algo diminuto que sirva para comparar. Cuando entiendes un truco, lo empiezas a ver en todas partes.
Hilo ④ · de la lista a la respuesta
pero…si el índice deja de ser de palabras, la pregunta también puede dejar de serlo. ¿Se puede buscar algo parecido sin que comparta ni una letra?
Nº 25 / 26 · Sala VII
Los embeddings
2013
Origen
Tomáš Mikolov y su equipo, en Google (word2vec)
Función
Colocar cada palabra como un punto en un espacio de cientos de dimensiones, según la compañía que tiene
Dato brutal
Las direcciones significan algo: rey − hombre + mujer cae junto a reina
Por qué importa. Es la primera vez que una máquina encuentra algo parecido sin compartir una sola letra. Para el índice de la portada, «coche» y «automóvil» son dos términos sin ninguna relación; en un espacio vectorial están casi en el mismo punto. La consulta pasa de coincidir a parecerse, y por eso hoy puedes preguntar mal, con faltas y sin las palabras exactas, y aun así encontrar.
¿Sabías que…?
La idea es vieja y es de lingüistas: «una palabra se conoce por la compañía que tiene» (Firth, 1957). Y arrastra un problema conocido: los primeros embeddings colocaban «enfermera» cerca de «mujer» y «programador» cerca de «hombre», porque eso es lo que decían los textos con los que se entrenaron. Es el sesgo de Dewey otra vez, con una diferencia incómoda: ahora nadie lo ha escrito a mano y no hay una tabla que se pueda corregir.
Hilo ③ · el orden no es neutral
Pruébalo
Letras contra significado
Diez palabras colocadas a mano en un espacio de cuatro rasgos (transporte, ser vivo, comida y motor). Elige una y mira quién le queda cerca. El parecido no lo decide la ortografía.
pero…ya se puede preguntar de cualquier manera y encontrar por significado. Queda el último paso, y es el que cambia el trato: que en vez de enseñarte dónde mirar, te lo cuenten.
Nº 26 / 26 · Sala VII
El LLM como interfaz de consulta
2022 → hoy
Origen
La línea que va del transformer (2017) a los asistentes de uso masivo de 2022 en adelante
Función
Contestar en una frase en lugar de devolver una lista de sitios donde mirar
Dato brutal
Es la primera interfaz de consulta de la historia que no dice de dónde ha sacado la respuesta si no se lo pides
Por qué importa. Se recupera algo antiquísimo —la comodidad del oráculo: preguntas y te contestan— y se pierde algo que costó dos mil seiscientos años construir: el rastro. El colofón de Nínive decía en qué estante estaba; el índice impreso, en qué página; Garfield y PageRank, quién lo respaldaba. Una respuesta sin fuente rompe esa cadena. De ahí vienen los sistemas que buscan primero y contestan después, precisamente para poder volver a citar: la respuesta vale por el rastro que deja.
¿Sabías que…?
La alucinación no es una avería: es la consecuencia de cómo funciona. El modelo produce lo que suena bien, y la mayoría de las veces lo que suena bien es verdad —lo justo para que confiemos—. Y hay un problema de fondo del que se habla poco: si todos preguntamos al modelo y nadie visita la fuente, ¿quién escribirá la fuente de la que aprenda el modelo siguiente?
Hilo ④ · de la lista a la respuesta
Parada · Sala VII
¿Qué permiten los embeddings que no permitía un índice de palabras?
✓ «Coche» y «automóvil» no comparten letras y para un índice invertido son dos términos sin relación. En un espacio vectorial están casi en el mismo punto.
Las que ordenaron
De este museo se recuerdan los nombres de quienes inventaron sistemas: Dewey, Otlet, Bush, Codd. Pero ordenar el saber del mundo ha sido, durante siglo y medio, un oficio hecho sobre todo por mujeres, y de él salieron ideas que hoy están dentro de cualquier buscador. No hicieron de secretarias del conocimiento: hicieron su teoría.
Suzanne Briet1894 — 1989
Preguntó qué es un documento y dio la respuesta más radical: un antílope suelto en la sabana no lo es, pero el mismo antílope en un zoo, con su ficha, sí. Documento es todo aquello de lo que se guarda constancia.
Henriette Avram1919 — 2006
Programadora en la Library of Congress, creó el formato MARC: la razón de que dos bibliotecas cualesquiera del mundo puedan intercambiarse catálogos. Convirtió la ficha de cartón en un registro legible por una máquina.
Karen Spärck Jones1935 — 2007
Demostró que una palabra vale por lo rara que es: si aparece en todos los documentos no distingue nada. Esa idea —el IDF— está dentro de todos los buscadores. «La informática es demasiado importante para dejarla en manos de los hombres.»
Las catalogadoras de la LoC1901 — 1978
Durante casi ochenta años, un servicio de tarjetas impresas surtió de catálogo a las bibliotecas de todo un país. Miles de personas describiendo libros a mano, con reglas comunes: la infraestructura invisible sobre la que se pudo automatizar después.
El gran comparador
Mil millones de documentos
Cuántas comparaciones cuesta encontrar una palabra (escala logarítmica)
Uno a uno · peor caso
10⁹
Uno a uno · de media
5·10⁸
Ordenado · por mitades
30
Con índice invertido
1
Construir ese índice
10⁹
Mira las dos últimas líneas juntas, porque ahí está el hilo ② de este ala entero. Buscar con índice cuesta una operación. Construir el índice cuesta lo mismo que recorrerlo todo… una vez. Encontrar rápido no es magia: es trabajo hecho antes por alguien. Los quinientos frailes de 1230, las catalogadoras de la Library of Congress y las granjas de servidores que rastrean la web hacen el mismo turno.
El escriba de Nínive escribía en el borde de la tablilla de qué trataba y en qué estante vivía. Ese gesto —dejar dicho dónde encontrarlo— sostiene los veintiséis objetos de este ala. Hoy le pedimos la respuesta a una máquina que no nos dice de dónde la ha sacado. Hemos ganado la respuesta; el borde de la tablilla lo hemos perdido.
Quiz final · ¿Cuánto museo te llevas?
Diez preguntas, sin nota y sin trampa. Fallar también enseña (de hecho, enseña más).
Aciertos a la primera: 0 / 10
Pregunta 1
¿Por qué el orden alfabético tardó siglos en imponerse?
✓ Ordenar la teología como una lista de la compra parecía una falta de respeto al orden del mundo. Hoy es lo primero que hace tu ordenador con una carpeta.
Pregunta 2
La concordancia bíblica de 1230 es el antepasado directo de…
✓ Cada palabra con todos los lugares en que aparece: lo mismo que hace el buscador de la portada, hecho a pluma por cientos de frailes.
Pregunta 3
¿Por qué en un manuscrito el número de página no sirve para nada?
✓ Una referencia solo vale si apunta siempre a lo mismo. Hizo falta la copia exacta de la imprenta para que «página 128» significara algo.
Pregunta 4
¿Qué permite la notación decimal de Dewey?
✓ Entre 512.2 y 512.3 siempre cabe un 512.24. La jerarquía va escrita dentro de la clave, como en una ruta de carpetas.
Pregunta 5
¿Qué hacía el Mundaneum de Otlet que se parece asombrosamente a un buscador?
✓ Un buscador con sellos, en 1912. Y en 1934 Otlet dibujó una mesa con pantallas para consultarlo a distancia.
Pregunta 6
¿Qué cambió el Uniterm de Taube respecto a clasificar?
✓ De la jerarquía a la etiqueta. Las dos fichas puestas una al lado de otra para buscar los números repetidos son un JOIN hecho con la vista.
Pregunta 7
En una consulta SQL, ¿quién decide el camino para buscar los datos?
✓ Por eso la misma consulta sigue funcionando cuando la tabla crece de mil filas a mil millones. Eso es ser declarativo.
Pregunta 8
PageRank hereda casi tal cual una idea de 1964. ¿Cuál?
✓ Garfield lo hizo con artículos científicos; Page y Brin, con enlaces. La misma pregunta: ¿quién te respalda?
Pregunta 9
Se parte la red entre dos centros con los mismos datos. Según CAP, hay que elegir entre…
✓ Y no es una decisión técnica: Amazon eligió contestar siempre para no perder el carrito; un banco elige lo contrario.
Pregunta 10
¿Qué se pierde cuando la respuesta llega sin decir de dónde sale?
✓ Es lo que llevaba el colofón de Nínive, el número de página del incunable y el enlace de PageRank. Una respuesta vale por el rastro que deja.
¿Y ahora qué?
A este ala le falta el objeto Nº 27, y esta vez hay una pista bastante clara de por dónde va: sistemas que buscan antes de contestar y citan lo que han leído, para devolver el rastro que perdimos. Pero la pregunta gorda no es técnica: si todos preguntamos a la máquina y nadie visita la fuente, ¿quién escribirá la fuente de la que aprenda la máquina siguiente? Esa la contestáis vosotros, y no dentro de veinte años.
Enlaces directos: cada objeto tiene su ancla (#dewey, #codd, #pagerank…): añádela a la URL para proyectar ese objeto directamente. El botón «Índice» lista las 7 salas y los 26 objetos, y también las otras dos alas.
El interactivo de SQL ejecuta de verdad SELECT, JOIN … ON, WHERE con AND/OR, GROUP BY con agregados, ORDER BY y LIMIT sobre tres tablas, y da errores en castellano —incluido el de columna ambigua—. Sirve como primera sesión de bases de datos sin instalar nada, y para proyectar un JOIN antes de que nadie escriba una línea.
Pareja recomendada: «Hojear o buscar» (Sala I) y «El gran comparador» (cierre), seguidos. Entre los dos explican por qué existe la complejidad algorítmica sin usar la palabra.
Las tres alas:Máquinas que cuentan (los aparatos), Signos que guardan (los códigos y los cifrados) y esta (los catálogos y los índices). Se cruzan a propósito: Babbage aparece en dos, la concordancia de 1230 vuelve en MapReduce y el hash del ala de los signos reaparece en Shazam.
Rigor: datos contrastados con Britannica, el Computer History Museum, la Library of Congress, el Mundaneum y las publicaciones originales. Donde la cifra es tradición y no dato —los quinientos frailes de la concordancia— el texto lo dice.