Índice del museo

Sala I · El orden

  1. 01La biblioteca de Asurbanipal
  2. 02El orden alfabético
  3. 03La concordancia bíblica
  4. 04El índice y la paginación

Sala II · La ficha

  1. 05La Bibliotheca universalis
  2. 06Las fichas de la Revolución
  3. 07La Clasificación Decimal
  4. 08El Mundaneum de Otlet

Sala III · La máquina de buscar

  1. 09El Memex de Vannevar Bush
  2. 10El Uniterm de Taube
  3. 11El acceso directo
  4. 12El índice de citas

Sala IV · La tabla

  1. 13El modelo relacional
  2. 14SQL
  3. 15Ingres y Oracle
  4. 16VisiCalc

Sala V · El índice del mundo

  1. 17Archie
  2. 18AltaVista y el rastreador
  3. 19PageRank
  4. 20Wikipedia

Sala VI · El dato de todos

  1. 21MapReduce
  2. 22El teorema CAP
  3. 23El premio Netflix

Sala VII · La respuesta

  1. 24Preguntar sin escribir
  2. 25Los embeddings
  3. 26El LLM como interfaz

Interludio y cierre

  1. ·Las que ordenaron
  2. ·El gran comparador
  3. ·Quiz final
  4. ·¿Y ahora qué?

Las otras dos alas

  1. Máquinas que cuentan
  2. Signos que guardan

Museo digital · 2.700 años buscando

Preguntas que encuentran

La historia de la consulta en 26 objetos: los catálogos, las fichas, las tablas y los buscadores con los que aprendimos a encontrar lo que ya habíamos guardado. De la biblioteca de Nínive al chatbot que contesta sin decir de dónde.

−650 ───────── 2026  ·  7 salas  ·  26 objetos

El documento0 palabras

Índice invertido0 términos

Cambia el texto y busca una palabra. El buscador no lee el texto: va directo a la lista. Por eso encontrar cuesta lo mismo en mil páginas que en mil millones.

Baja para empezar el viaje

Guardar es solo la mitad del problema. Un dato que no puedes encontrar es un dato que no tienes: cuando se perdió la Biblioteca de Alejandría no desaparecieron solo los libros, desapareció el catálogo que decía qué había existido. Este ala cuenta la otra mitad: cómo aprendimos a preguntar.

Cuatro hilos cosen las siete salas. Fíjate en ellos:

① Del montón al orden

Cada objeto de este ala inventa una manera de no tener que mirarlo todo. Buscar bien es, sobre todo, poder descartar.

② El índice se paga antes

Encontrar rápido nunca es gratis: alguien ordenó, indexó o enlazó primero. La pregunta siempre es quién paga esa factura.

③ El orden no es neutral

Quien decide las categorías decide qué es normal y qué es una excepción. Dewey, el ranking y la recomendación son la misma decisión con otro nombre.

④ De la lista a la respuesta

Antes te decían dónde mirar y mirabas tú. Ahora te dan la conclusión. Se gana tiempo y se pierde el rastro de dónde salió.

Sala I

El orden

650 a.C. — 1500

Poner las cosas en un sitio para poder volver a ellas.

¿Cómo se busca algo entre treinta mil tablillas?

COLOFÓN EL BORDE DICE QUÉ OBRA ES Y QUÉ TABLILLA MATERIA: PRESAGIOS  ·  MATERIA: MEDICINA FIG. 01 · NÍNIVE · s. VII a.C.

Nº 01 / 26 · Sala I

La biblioteca de Asurbanipal

s. VII a.C.

Origen
Nínive, junto a la actual Mosul (Irak); la biblioteca del rey asirio Asurbanipal
Función
Unas 30.000 tablillas agrupadas por materia, cada una con un colofón: qué obra es y qué número de tablilla ocupa
Dato brutal
Es la primera colección de la que sabemos que estaba ordenada para consultarla, y no solo guardada

Por qué importa. El colofón es una signatura: título, número de tablilla, dueño. Sin él, treinta mil tablillas son un montón; con él, son una biblioteca. Y fíjate en lo que es ese colofón: un dato sobre el dato, escrito en el borde para no tener que abrir nada. La diferencia entre almacenar y poder consultar cabe en un margen.

¿Sabías que…?

La biblioteca ardió cuando Nínive cayó, en 612 a.C. … y el incendio coció las tablillas y las conservó. Gracias a ese desastre podemos leer hoy el poema de Gilgamesh. La arcilla ya salía bien parada en el ala de los signos; aquí demuestra además que sobrevive a sus propias bibliotecas.

Hilo ① · del montón al orden

pero…ordenar por materia funciona si sabes de qué materia es lo que buscas. ¿Y si solo recuerdas una palabra?

A B C D E F G H I EL SITIO LO DECIDE LA LETRA, NO LA IMPORTANCIA FIG. 02 · A—Z

Nº 02 / 26 · Sala I

El orden alfabético

s. III a.C. → s. XIII

Origen
Apuntado en Alejandría por Calímaco; generalizado en la Europa del siglo XIII
Función
Ordenar por una propiedad del signo —la letra— y no por materia, antigüedad ni importancia
Dato brutal
Tardó unos mil quinientos años en imponerse. Se consideraba un orden sin sentido

Por qué importa. Es el primer orden arbitrario, y precisamente por eso el primero universal: no exige saber nada del contenido. Cualquiera puede colocar y cualquiera puede recorrer sin entender el tema. Toda la informática vive de esa idea —ordenar por una clave que en sí misma no significa nada— y de su consecuencia: si está ordenado, puedes descartar la mitad sin mirarla.

¿Sabías que…?

A muchos eruditos medievales les parecía casi impío ordenar el saber por la letra en lugar de por su jerarquía, que empezaba en Dios y bajaba. Ordenar la teología como quien ordena una lista de la compra era una falta de respeto al orden del mundo. Cuando ordenas tus archivos por nombre estás usando una tecnología que costó siglos de discusión teológica.

Hilo ③ · el orden no es neutral

Pruébalo

Hojear o buscar

Treinta y dos fichas, una palabra en cada una. Busca la que se te pide pulsando fichas. Primero están en el orden en que llegaron; luego, ordenadas. La segunda vez no vas a mirar ni seis, y no porque busques mejor.

Busca la ficha:

fichas miradas 0 peor caso en este orden 32 de media 16,5

pero…el alfabeto ordena los títulos, no lo que dicen por dentro. Para saber en qué página se habla del agua, hay que leerse el libro entero.

AQVA GEN 1,6 EX 14,21 PS 18,12 CADA PALABRA, TODAS SUS APARICIONES FIG. 03 · SAINT-JACQUES, PARÍS · ~1230

Nº 03 / 26 · Sala I

La concordancia bíblica

~1230

Origen
Convento dominico de Saint-Jacques, París, bajo la dirección de Hugo de Saint-Cher
Función
Listar cada palabra de la Biblia con todos los lugares donde aparece
Dato brutal
La tradición habla de quinientos frailes trabajando en ella. Es un índice invertido hecho a mano

Por qué importa. Es exactamente lo que hace el buscador de la portada de este museo, con pluma y en un convento. Y tiene una consecuencia que cambia la manera de leer: por primera vez se puede consultar un libro sin leerlo, entrando por la palabra. El texto deja de ser un camino que se recorre y se convierte en un espacio en el que se entra por donde quieras.

¿Sabías que…?

Para que las referencias sirvieran de algo hubo que inventar antes una forma de nombrar un sitio exacto dentro del texto: el capítulo y el versículo. La división en capítulos que todavía usamos se atribuye a Stephen Langton, del mismo París y de apenas una generación antes. Sin coordenadas no hay índice: primero hay que poder decir «aquí».

Hilo ② · el índice se paga antes

pero…esa concordancia es de ese libro, y costó una generación de frailes. Nadie va a hacer lo mismo con cada libro nuevo que aparezca.

TABVLA 14 57 128 203 241 288 MIL EJEMPLARES, LA MISMA PÁGINA 128 FIG. 04 · 1470—1500

Nº 04 / 26 · Sala I

El índice y la paginación

1470 — 1500

Origen
Los talleres de la generación siguiente a Gutenberg, en Venecia, Núremberg y Colonia
Función
Una lista alfabética al final del libro, con el número de página al lado de cada entrada
Dato brutal
En un manuscrito el número de página no sirve para nada: cada copia lo tiene en otro sitio

Por qué importa. El índice necesita coordenadas estables, y las coordenadas estables solo existen si la copia es exacta. La imprenta no solo multiplicó los libros: hizo posible referirse a un punto concreto de uno. Es la misma condición que cumple un enlace, y la misma que incumple una web que cambia de sitio: una dirección solo vale si apunta siempre a lo mismo.

¿Sabías que…?

«Índice» viene del latín index, el dedo que señala: el índice de un libro y el índice de tu mano son la misma palabra porque hacen el mismo trabajo. Y tardó en cuajar: muchos incunables se imprimieron todavía sin numerar las páginas, con el índice remitiendo a la primera palabra de la hoja en lugar de a un número.

Hilo ② · el índice se paga antes

pero…el índice sigue cosido a su libro. Para contestar algo que cruce dos libros hay que leerse los dos. Y en 1500 ya hay demasiados libros.

Parada · Sala I

¿Qué añade el colofón de una tablilla asiria?

Sala II

La ficha

1545 — 1934

Sacar el dato del libro para poder recombinarlo.

¿Y si cada dato pudiera cambiar de sitio sin copiarlo otra vez?

EL PLIEGO ESCRITO EN CUALQUIER ORDEN MOVER ES BARATO; COPIAR ES CARO FIG. 05 · ZÚRICH · 1545

Nº 05 / 26 · Sala II

La Bibliotheca universalis

1545

Origen
Conrad Gessner, médico y naturalista, en Zúrich
Función
Catalogar todo lo publicado en latín, griego y hebreo: unos tres mil autores
Dato brutal
Explica también el método: recortar las entradas en tiras para poder reordenarlas sin volver a copiarlas

Por qué importa. Dos saltos a la vez. El catálogo se despega del edificio: Gessner cataloga lo que existe, no lo que tiene en su estante. Y describe la operación que lo cambia todo: si cada dato va en un trozo suelto, reordenar sale gratis. Copiar es caro; mover es barato. Toda la informática de datos es esa frase.

¿Sabías que…?

Gessner era sobre todo naturalista —su Historia animalium es de las grandes obras del siglo XVI— y para él catalogar el saber era otra rama de la historia natural: clasificar libros o clasificar animales, el mismo oficio. Murió de peste a los 49 años mientras seguía trabajando en el catálogo.

Hilo ① · del montón al orden

pero…una hoja con tiras pegadas sigue siendo una hoja: para intercalar algo nuevo en medio, hay que despegar. Falta que la ficha sea de verdad suelta.

LA CARA EL REVERSO EN BLANCO MISMO TAMAÑO UN ASIENTO, UNA FICHA FIG. 06 · FRANCIA · 1791

Nº 06 / 26 · Sala II

Las fichas de la Revolución

1791

Origen
Francia; instrucción del gobierno revolucionario para inventariar los libros confiscados
Función
Un asiento por obra, escrito en el reverso en blanco de un naipe
Dato brutal
Se considera el primer código nacional de catalogación del mundo

Por qué importa. Los naipes de la época tenían el reverso en blanco y eran el único papel resistente y de tamaño idéntico que había a mano por millones. Con eso, el registro deja de ser una línea dentro de un libro —que no se puede mover— y pasa a ser un objeto independiente: se intercala, se reordena, se presta, se pierde. Es la diferencia entre una anotación y un registro; entre un texto y una fila de una tabla.

¿Sabías que…?

La instrucción no solo decía dónde escribir, decía cómo: copiar el título tal como aparece, con sus mayúsculas, y añadir formato, materia y estado de conservación. Es la primera norma de descripción bibliográfica, y su descendiente directo es el formato con el que hoy dos bibliotecas de países distintos intercambian catálogos sin hablar el mismo idioma.

Hilo ① · del montón al orden

pero…con millones de fichas iguales el problema se muda otra vez. Ya no es el soporte: es en qué orden se ponen, y quién decide las categorías.

000 100 200 300 400 500 600 700 800 900 DIEZ CLASES 510 512 512.24 CIENCIAS → MATEMÁTICAS → ÁLGEBRA → ECUACIONES SIEMPRE CABE OTRO DECIMAL FIG. 07 · AMHERST · 1876

Nº 07 / 26 · Sala II

La Clasificación Decimal de Dewey

1876

Origen
Melvil Dewey, con 21 años, trabajando en la biblioteca del Amherst College
Función
Diez clases, cada una en diez divisiones y cada una en diez secciones, con notación decimal
Dato brutal
Sigue en uso en decenas de miles de bibliotecas de más de cien países, siglo y medio después

Por qué importa. El invento no son las diez clases: es la notación. 512.24 dice «dentro de ciencias, dentro de matemáticas, dentro de álgebra, ecuaciones», y siempre cabe otro decimal, así que puedes añadir un tema nuevo entre dos existentes sin mover un solo libro. Es un árbol escrito dentro de la propia clave, exactamente como una ruta de carpetas o una URL.

¿Sabías que…?

Mira el reparto: de las diez clases, una entera es para religión, y de sus cien divisiones unas ochenta son cristianismo; todas las demás religiones del planeta caben en el 290-299. El orden nunca es neutral: lo escribe alguien, desde algún sitio y en algún año. Y el propio Dewey acabó expulsado de la asociación de bibliotecarias y bibliotecarios que él había fundado por acosar a sus compañeras: en 2019 la profesión le quitó su nombre a su medalla más importante.

Hilo ③ · el orden no es neutral

Clasifica tú

Seis libros, diez cajones

Coloca cada libro en su clase de Dewey. No hace falta saber la clasificación: fíjate en dónde te obliga a ponerlos, que es lo que se aprende aquí.

Libro 1 de 6:

pero…Dewey ordena los libros de una biblioteca. ¿Y si alguien quisiera ordenar todo lo que se ha escrito, esté donde esté?

FICHAS RÉPERTOIRE BIBLIOGRAPHIQUE UNIVERSEL MONDOTHÈQUE · 1934 15.646.346 FICHAS FIG. 08 · BRUSELAS · 1895—1934

Nº 08 / 26 · Sala II

El Mundaneum de Paul Otlet

1895 — 1934

Origen
Bruselas; Paul Otlet y Henri La Fontaine
Función
Un fichero universal de todo lo publicado, ordenado con la Clasificación Decimal Universal
Dato brutal
De 400.000 fichas en 1895 a 15.646.346 en 1934. Contadas

Por qué importa. Otlet añade a Dewey unos signos para combinar materias, y con eso se puede preguntar por «la química del vino en Francia» cruzando tres notaciones: la consulta compleja, medio siglo antes del ordenador. Y saca la consecuencia que nadie había sacado: si el fichero es universal, el usuario no tiene que estar en el edificio. Montó un servicio que respondía preguntas por correo y por telégrafo, pagando por consulta. Un buscador con sellos.

¿Sabías que…?

En 1934 dibujó su mondothèque: una mesa de trabajo con pantallas para consultar el fichero a distancia y saltar de un documento a otro. Sesenta años antes de la web, y sin electrónica que lo hiciera posible. El final es amargo: el Mundaneum fue desalojado, parte de sus salas se usaron para exponer arte del Tercer Reich y miles de fichas acabaron en la basura. Lo que se salvó está hoy en Mons, y se puede visitar.

Hilo ② · el índice se paga antes

pero…quince millones de fichas se consultan con las manos, una por una. El cuello de botella ya no es el orden: es el brazo.

Parada · Sala II

¿Qué permite la notación decimal de Dewey que no permitía una estantería numerada?

Sala III

La máquina de buscar

1945 — 1964

Que la búsqueda la haga la máquina.

¿Y si el camino por el saber lo pudieras trazar tú?

UN SENDERO: LOS ENLAZA QUIEN LEE DOS PANTALLAS, LADO A LADO MICROFILME FIG. 09 · MEMEX · 1945

Nº 09 / 26 · Sala III

El Memex de Vannevar Bush

1945

Origen
Estados Unidos; Vannevar Bush, en el artículo «As We May Think» (julio de 1945)
Función
Un escritorio con microfilmes y dos pantallas donde el lector traza senderos entre documentos y los guarda
Dato brutal
No se construyó nunca. Es el objeto más influyente de este museo que jamás existió

Por qué importa. Bush ataca un problema que ni Dewey ni Otlet habían visto: no es que falte índice, es que el índice es de otro. Su propuesta es que cada lector abra sus propios caminos entre documentos y pueda prestárselos a otro. La palabra que usa es trails, senderos; nosotros lo llamamos historial, marcador, hilo, enlace. Y describe un oficio nuevo, el de quien abre caminos por el saber ajeno para que otros los recorran: eso es hoy media internet.

¿Sabías que…?

Bush había dirigido la investigación militar estadounidense durante la guerra, con miles de científicos a su cargo, y escribió el artículo preguntándose qué hacer con toda esa capacidad en tiempos de paz. Lo leyeron de jóvenes dos personas decisivas: Douglas Engelbart, que acabó inventando el ratón, y Ted Nelson, que en 1965 puso nombre a la idea —hipertexto— y arrancó Xanadu, un proyecto con enlaces de ida y vuelta que la web todavía no tiene.

Hilo ③ · el orden no es neutral

pero…un sendero personal sirve sobre todo a quien lo abrió. Para que la máquina busque sola, las palabras del propio documento tienen que ser su dirección.

AGUA ROMA 7 12 31 44 58 63 77 81 3 12 29 44 52 66 77 90 LOS QUE ESTÁN EN LAS DOS: 12 · 44 · 77 FIG. 10 · UNITERM · 1951

Nº 10 / 26 · Sala III

El Uniterm de Mortimer Taube

1951

Origen
Mortimer Taube, Documentation Inc., Washington
Función
Describir cada documento con términos sueltos y buscar por combinación: los que tengan a la vez A y B
Dato brutal
Rompe la regla de un sitio por documento: uno puede estar a la vez en veinte listas

Por qué importa. Es el paso de la jerarquía a la etiqueta. Dewey te obliga a elegir una casilla; Taube te deja poner todas las palabras que hagan falta y encontrar por intersección. La consulta se convierte en una operación lógica —y, o, no— sobre listas de números, que es exactamente lo que hizo el índice invertido de la portada. Los hashtags son Uniterms con almohadilla.

¿Sabías que…?

El sistema se llevaba en fichas grandes, una por término, con los números de documento anotados en columnas. Para cruzar dos términos se ponían las dos fichas una al lado de la otra y se buscaban los números repetidos con la vista: un JOIN a ojo, con el dedo de guía. A los bibliotecarios clásicos les pareció una degradación —sin vocabulario controlado, cada uno etiqueta como quiere— y en eso no se equivocaban: es el mismo debate que hoy tenemos con las etiquetas de cualquier red social.

Hilo ② · el índice se paga antes

Pruébalo

Cruzar listas

Seis documentos etiquetados como los etiquetaría Taube. Pulsa una etiqueta para exigirla, otra vez para excluirla y otra para dejarla en paz. Mira cuántos documentos van cayendo: eso es una consulta.

con Y tienen que estar todas; con O, cualquiera

pero…cruzar dos columnas de números con la vista funciona con mil documentos. Con un millón hay que ir directamente al dato, y una cinta magnética no deja: es un rollo, y hay que rebobinarlo.

50 DISCOS · 61 cm · 1.200 rpm BRAZO VA Y VUELVE CINTA: HAY QUE PASAR POR TODO FIG. 11 · IBM 350 · SAN JOSÉ, 1956

Nº 11 / 26 · Sala III

El acceso directo

1956

Origen
IBM San José, California; la primera unidad se entregó en junio de 1956
Función
Cincuenta discos de 61 cm girando a 1.200 rpm y un brazo que va a cualquier pista: 5 millones de caracteres, unos 3,75 MB
Dato brutal
Pesaba alrededor de una tonelada y no se vendía: se alquilaba por meses

Por qué importa. RAMAC son las siglas de Random Access Method of Accounting and Control, y la palabra que importa es random: acceso directo. Con cinta, para leer el registro 900 hay que pasar por los 899 anteriores. Con disco, el brazo va y vuelve. Sin eso no existe la consulta interactiva —preguntar y que te contesten ahora— y por tanto no existe nada de lo que viene en la sala siguiente.

¿Sabías que…?

Esto ya se había inventado con papel: el códice del siglo IV cambió el rollo por hojas cosidas precisamente para poder abrir por la página 128 sin rebobinar. La informática empezó con cintas, o sea con rollos, y tardó otros mil quinientos años en recuperar el acceso aleatorio. Casi todos los inventos de este museo son la segunda vez que alguien tiene la misma idea.

Hilo ① · del montón al orden

pero…el acceso directo resuelve cómo llegar, no a dónde. Con cien mil artículos publicados al año, la pregunta ya no es dónde está uno: es cuál de todos merece la pena.

×7 SIETE LO CITAN EL ÍNDICE NO DICE DE QUÉ VA: DICE QUIÉN LO USA FIG. 12 · SCI · FILADELFIA, 1964

Nº 12 / 26 · Sala III

El índice de citas

1955 → 1964

Origen
Eugene Garfield, Institute for Scientific Information, Filadelfia
Función
Indexar no por materia, sino por referencia: quién cita a quién
Dato brutal
La primera edición impresa (1964) cubría 613 revistas y 1,4 millones de citas

Por qué importa. Es el primer índice que no describe el contenido de un documento, sino su relación con los demás. Y de ahí sale una idea explosiva: si mucha gente cita un artículo, probablemente importe. La autoridad deja de ser una opinión y se convierte en una cuenta. Treinta y cuatro años más tarde, dos estudiantes de Stanford harán exactamente esto con los enlaces de la web y le pondrán otro nombre.

¿Sabías que…?

Garfield copió la idea de un índice jurídico del siglo XIX que servía para saber si una sentencia seguía en vigor o la había tumbado otra posterior. Y la criatura se le escapó: el «factor de impacto», que él inventó como herramienta para decidir qué revistas indexar, acabó usándose para evaluar personas —contratos, plazas, sexenios— y pasó el resto de su vida protestando contra ese uso. Todo ranking acaba convirtiéndose en el objetivo de alguien.

Hilo ③ · el orden no es neutral

pero…todo esto son índices que alguien construye a mano sobre documentos que alguien ha descrito a mano. Los datos de una empresa no son documentos: son millones de registros que cambian cada día, y cada programa los guarda a su manera.

Parada · Sala III

¿Qué cambia el Uniterm respecto a la clasificación de Dewey?

Sala IV

La tabla

1970 — 1979

Separar lo que quieres saber de cómo se busca.

¿Y si pudieras pedir el resultado sin explicar el camino?

ANTES: PUNTEROS Y ORDEN FÍSICO DESPUÉS: FILAS Y COLUMNAS. Y NADA MÁS. id nombre curso σ   π   ⋈ SELECCIÓN · PROYECCIÓN · COMBINACIÓN FIG. 13 · CODD · SAN JOSÉ, 1970

Nº 13 / 26 · Sala IV

El modelo relacional de Codd

1970

Origen
Edgar F. Codd, laboratorio de IBM en San José, California
Función
Describir los datos como tablas y consultarlas con un álgebra, sin decir cómo están guardados
Dato brutal
IBM ya vendía otra cosa y tardó años en hacer caso a su propio investigador

Por qué importa. Antes, el programa tenía que saber cómo estaban guardados los datos: punteros, orden físico, jerarquía. Cambiar el almacenamiento rompía los programas. Codd propone lo contrario: describe los datos como tablas y deja que la máquina decida el camino. Eso se llama independencia de los datos, y es la razón de que una aplicación escrita en 1985 pueda seguir funcionando sobre un disco que no existía cuando se escribió.

¿Sabías que…?

Codd venía de la lógica matemática, y su álgebra —seleccionar filas, proyectar columnas, combinar tablas— es teoría de conjuntos aplicada a la contabilidad. Y era un hombre de principios incómodos: cuando IBM sacó SQL le pareció que se apartaba de su modelo, y publicó una lista de doce reglas (trece, contando la número 0) para decidir si un sistema era relacional de verdad. Casi ningún producto de la época las cumplía. Casi ninguno de hoy tampoco.

Hilo ① · del montón al orden

pero…el modelo es matemático y elegante, y por eso mismo no lo puede usar nadie: falta la forma de pedirle algo a una tabla sin escribir un programa.

SELECT nombre FROM alumnado WHERE nota > 7 LO QUE QUIERES EL OPTIMIZADOR ELIGE EL CÓMO recorrer todo usar el índice el más barato TÚ NO DICES POR DÓNDE. Y ESO ES EL INVENTO. FIG. 14 · SEQUEL · SYSTEM R, 1974

Nº 14 / 26 · Sala IV

SQL

1974

Origen
IBM San José; Donald Chamberlin y Raymond Boyce, dentro del proyecto System R
Función
Un lenguaje declarativo: describes el resultado que quieres, no los pasos para conseguirlo
Dato brutal
Se diseñó para que lo escribiera gente sin formación técnica. Medio siglo después sigue siendo el idioma común de los datos

Por qué importa. SELECT dice qué columnas, FROM de dónde, WHERE con qué condición. En ningún sitio dices en qué orden recorrer las tablas ni qué índice usar: eso lo decide el optimizador, cada vez, según cómo estén los datos ese día. Es la primera vez que a un ordenador se le pide un resultado en lugar de un procedimiento, y es la razón de que la misma consulta siga sirviendo cuando la tabla pasa de mil filas a mil millones.

¿Sabías que…?

Se llamaba SEQUEL, y hubo que cambiarle el nombre porque una empresa aeronáutica británica ya tenía registrada la marca. De ahí las tres letras… y de ahí que media profesión lo pronuncie «síquel» y la otra mitad «ese-cu-ele», discusión que lleva cincuenta años sin resolverse y que no va a resolverse aquí.

Hilo ④ · de la lista a la respuesta

Pruébalo de verdad

Un SELECT que se ejecuta aquí mismo

Tres tablas y un SQL que corre en tu navegador, sin servidor y sin trampa: SELECT, JOIN, WHERE, GROUP BY, ORDER BY y LIMIT. Empieza por un ejemplo, y luego rómpelo a ver qué pasa.

pero…un lenguaje sin producto es un artículo de revista. Hace falta que alguien lo venda, lo mantenga y responda al teléfono cuando se rompe.

POSTGRESQL SYBASE ORACLE INGRES · QUEL SYSTEM R · SQL MODELO RELACIONAL, 1970 LA INVESTIGACIÓN LLEGÓ ANTES; EL PRODUCTO, PRIMERO FIG. 15 · BERKELEY / SAN JOSÉ · 1973—1979

Nº 15 / 26 · Sala IV

Ingres y Oracle

1973 — 1979

Origen
Ingres, proyecto de Michael Stonebraker y Eugene Wong en Berkeley; Oracle, empresa de Larry Ellison, Bob Miner y Ed Oates
Función
Convertir el modelo relacional en un producto que se pueda comprar y mantener
Dato brutal
Ingres empezó antes, pero con su propio lenguaje (QUEL). Oracle llegó antes al mercado, en 1979, y con SQL

Por qué importa. Es el momento en que una idea académica se convierte en infraestructura, y explica el mapa de hoy: casi todas las bases de datos que usas descienden de uno de esos dos linajes. Del árbol de Berkeley salió además otra cosa: la costumbre de repartir el código. PostgreSQL es nieto directo de aquel proyecto universitario, y por eso hoy puedes montar en clase, gratis, la misma tecnología que sostiene un banco.

¿Sabías que…?

Ingres se distribuía por correo, en cinta magnética, a cambio de poco más que el coste del soporte. Aquella costumbre de universidad —te mando el código y haz con él lo que quieras— acabó siendo una de las grandes normas de la industria. Cuando instalas PostgreSQL estás usando la descendiente de una cinta que salía de Berkeley por unos dólares.

Hilo ② · el índice se paga antes

pero…todo esto sigue siendo para empresas con departamento de informática. La mayoría de la gente no va a escribir un SELECT en su vida.

A B C D 1 2 3 4 132 231 99 =SUMA CADA CELDA: UN DATO O UNA REGLA CAMBIA UNO Y SE RECALCULA TODO SIN SABER PROGRAMAR… PERO PROGRAMANDO FIG. 16 · VISICALC · APPLE II, 1979

Nº 16 / 26 · Sala IV

VisiCalc

1979

Origen
Dan Bricklin y Bob Frankston, para el Apple II
Función
Una tabla en pantalla donde cada celda guarda un dato o una fórmula que se recalcula sola
Dato brutal
La primera aplicación por la que la gente compraba el ordenador: querían VisiCalc, y el Apple II venía con él

Por qué importa. Es el modelo relacional para el resto de la humanidad: filas, columnas y fórmulas que declaran una relación entre celdas. No hace falta saber programar, pero se está programando. Hoy el mundo se administra con hojas de cálculo —presupuestos, notas, inventarios, la contabilidad de medio país— y son a la vez el sistema de información más usado del planeta y el que más errores contiene.

¿Sabías que…?

Bricklin lo imaginó en una clase de gestión en Harvard, viendo al profesor borrar y recalcular a mano una tabla en la pizarra: si cambiaba un número, había que rehacerlo todo. Y no pudo protegerlo: en 1979 el software apenas se patentaba en Estados Unidos, así que Lotus 1-2-3 copió la idea y en tres años se llevó el mercado. El invento que creó una industria no dio ni para conservar la empresa que lo hizo.

Hilo ④ · de la lista a la respuesta

pero…una tabla exige que alguien decida antes las columnas. Y a partir de 1993 empiezan a aparecer millones de documentos que nadie ha descrito: sin columnas, sin esquema y sin dueño.

Parada · Sala IV

¿Qué significa que SQL sea un lenguaje «declarativo»?

Sala V

El índice del mundo

1990 — 2001

Indexar lo que nadie ha ordenado.

¿Cómo se cataloga algo que nadie ha descrito y que cambia cada día?

FTP FTP FTP FTP EL ÍNDICE, HECHO POR UN PROGRAMA NADIE HA DESCRITO NADA: LA MÁQUINA HA IDO A MIRAR FIG. 17 · ARCHIE · McGILL, MONTREAL, 1990

Nº 17 / 26 · Sala V

Archie

1990

Origen
Alan Emtage, Bill Heelan y Peter Deutsch, Universidad McGill (Montreal)
Función
Un índice de los nombres de archivo de los servidores FTP públicos, consultable a distancia
Dato brutal
Es el primer buscador de internet, y es anterior a la web

Por qué importa. Aquí cambia quién hace el índice. Hasta ahora lo hacía siempre una persona: el escriba, el fraile, la bibliotecaria, el documentalista. Archie es un programa que sale a la red por su cuenta, mira qué hay y lo apunta. La descripción deja de ser humana, y con eso el índice puede crecer al ritmo de lo que describe. Todo lo que viene después es esta idea con más potencia.

¿Sabías que…?

Emtage lo escribió porque estaba harto de buscar programas a mano para sus compañeros: era una herramienta doméstica que se le fue de las manos. Decidieron no patentarlo, y él ha contado sin ningún drama que no ganó dinero con el primer buscador de internet, porque en 1990 a nadie se le ocurría que internet pudiera ser un negocio. Los buscadores que vinieron detrás se llamaron Veronica y Jughead: todos, chistes sobre el mismo cómic.

Hilo ① · del montón al orden

pero…un nombre de archivo no dice casi nada, y encima puede mentir. Con la web llegando, hace falta indexar lo que las páginas dicen por dentro.

EL RASTREADOR VA SOLO meta: GRATIS GRATIS SI LAS PALABRAS CLAVE LAS PONE EL DUEÑO DE LA PÁGINA, MENTIRÁ FIG. 18 · ALTAVISTA · PALO ALTO, 1995

Nº 18 / 26 · Sala V

AltaVista y el rastreador

1995

Origen
Digital Equipment Corporation, Palo Alto
Función
Recorrer la web enlace a enlace e indexar el texto completo de cada página
Dato brutal
Indexaba decenas de millones de páginas cuando la competencia publicaba listas hechas a mano

Por qué importa. Pasa de indexar nombres a indexar todo lo que hay escrito, y de golpe el índice es más grande que cualquier catálogo que haya existido nunca. Pero aparece a la vez el problema que define esta sala: si las palabras clave las escribe el dueño de la página, mentirá. Las metaetiquetas se llenaron de basura en dos años. Cuando el índice lo hace una máquina, la confianza deja de venir de quien describe.

¿Sabías que…?

AltaVista no era un negocio: era un escaparate técnico para demostrar lo rápidos que eran los servidores Alpha de DEC. Nadie en la empresa pensó que el buscador fuera el producto. La web tenía cuatro años y ya no se podía leer entera; la respuesta fue mirarla con una máquina, y a partir de ahí ya nunca hemos visto internet directamente: la vemos siempre a través de un índice que alguien construye.

Hilo ③ · el orden no es neutral

pero…si el autor de la página escribe su propia valoración, el índice hereda sus mentiras. Hace falta que la nota la ponga alguien que no sea el interesado.

C A B D E NO CUENTA LO QUE DICE DE SÍ MISMA: CUENTA QUIÉN LA ENLAZA FIG. 19 · STANFORD, 1998

Nº 19 / 26 · Sala V

PageRank

1998

Origen
Larry Page y Sergey Brin, en el laboratorio de Stanford
Función
Puntuar cada página según quién la enlaza, y no según lo que ella dice de sí misma
Dato brutal
La puntuación no se calcula: se itera. Se reparte el peso una y otra vez hasta que deja de moverse

Por qué importa. Es el índice de citas de Garfield aplicado a la web, y resuelve el problema de AltaVista de la única manera posible: la valoración no la escribe el autor, la escriben los demás. Es la diferencia entre un currículum y una carta de recomendación. Con eso el buscador deja de ser un índice y se convierte en un juez: no solo te dice dónde está, te dice qué merece la pena. Y esa decisión ya no la puede auditar nadie.

¿Sabías que…?

La iteración tiene una lectura muy visual: la puntuación de una página es la probabilidad de que alguien que va pulsando enlaces al azar acabe allí. Y el nombre de la empresa es una errata: querían escribir gúgol, el número 1 seguido de cien ceros. La patente quedó a nombre de la Universidad de Stanford, que años después vendió sus acciones por cientos de millones: el mayor beneficio económico de la historia de una oficina de transferencia tecnológica.

Hilo ③ · el orden no es neutral

Pruébalo

PageRank a mano

Cinco páginas que se enlazan entre ellas. Al principio todas valen lo mismo. Cada iteración reparte el valor de cada página a partes iguales entre las que enlaza, y se vuelve a sumar. Dale unas cuantas veces y mira dónde se para.

pero…un buen ranking necesita algo que ordenar, y alguien tiene que haber escrito las páginas. ¿Quién escribe el contenido del que vive todo esto?

DISCUSIÓN CUALQUIERA CUALQUIERA CATEGORÍAS QUE NADIE DISEÑÓ EL CATÁLOGO DE OTLET, POR OTRO CAMINO FIG. 20 · WIKIPEDIA · 2001

Nº 20 / 26 · Sala V

Wikipedia

2001

Origen
Jimmy Wales y Larry Sanger, como derivación de un proyecto anterior con expertos y revisión
Función
Una enciclopedia que cualquiera puede editar, con las categorías creciendo desde el uso
Dato brutal
Más de sesenta millones de artículos en cerca de trescientos idiomas, sin cobrar y sin publicidad

Por qué importa. Es el sueño de Otlet cumplido por el camino que él no imaginó: no lo construye una institución con un plan, lo construyen desconocidos discutiendo en público. Y su estructura no la diseñó nadie: las categorías, las redirecciones y las desambiguaciones emergen del uso, que es exactamente lo contrario de Dewey. Además es el suelo del que come todo lo demás: cuando un buscador te resume algo, muchas veces estás leyendo a un voluntario.

¿Sabías que…?

En Wikipedia la página de discusión es tan interesante como el artículo: ahí se ve cómo se negocia un hecho. Y hay una asimetría que da vértigo: casi todos los modelos de lenguaje se han entrenado con Wikipedia, y a la vez la gente entra menos porque ya se lo cuenta el chatbot. El pozo del que todos beben se está quedando sin quien lo llene, y ese es hoy uno de los problemas abiertos de este museo.

Hilo ② · el índice se paga antes

pero…el índice del mundo ya no cabe en una máquina. Ni el índice, ni la pregunta, ni la respuesta.

Parada · Sala V

¿Qué problema de AltaVista resolvió PageRank?

Sala VI

El dato de todos

2003 — 2009

Cuando la respuesta hay que repartirla entre mil máquinas.

¿Qué contestas cuando la mitad de tus máquinas no te habla?

LA PREGUNTA map map map se cayó reduce SE DA POR HECHO QUE ALGUNA FALLARÁ FIG. 21 · MAPREDUCE · 2004

Nº 21 / 26 · Sala VI

MapReduce

2003 — 2004

Origen
Google; Sanjay Ghemawat y Jeff Dean, junto al sistema de ficheros GFS
Función
Partir el cálculo en trozos que se hacen a la vez (map) y juntar los resultados (reduce)
Dato brutal
El diseño da por supuesto que las máquinas se rompen. Cuando una cae, su trozo se reparte otra vez y nadie se entera

Por qué importa. Cambia el supuesto de toda la sala anterior: ya no hay una máquina grande con un disco, hay mil máquinas mediocres y el problema es repartir la pregunta. Y el modelo es viejísimo: es exactamente lo que hicieron los frailes de la concordancia en 1230 —cada uno un trozo del libro, y al final alguien junta las listas—. MapReduce es un convento dominico con electricidad.

¿Sabías que…?

Google publicó los artículos con todo el diseño, pero no el código. Una comunidad los reimplementó desde cero y de ahí salió Hadoop, que sostuvo el big data de toda una década. Publicar la idea y guardarse el código acabó creando la competencia: la mayoría de las empresas que usaron Hadoop nunca pagaron nada a Google, pero tampoco habrían sabido qué construir.

Hilo ① · del montón al orden

pero…si la respuesta la calculan mil máquinas y en medio se cae la red, hay que decidir qué contestar: lo que sabías hace un minuto, o nada.

CONSISTENCIA C DISPONIBILIDAD A PARTICIÓN P GAVÀ GIRONA fibra cortada DOS. NO TRES. Y NO ES CUESTIÓN DE DINERO.

Nº 22 / 26 · Sala VI

El teorema CAP

2000 — 2007

Origen
Eric Brewer lo plantea como conjetura en 2000; Gilbert y Lynch lo demuestran en 2002. Amazon publica Dynamo en 2007
Función
Con los datos repartidos y la red partida, hay que elegir: contestar con datos posiblemente viejos, o no contestar
Dato brutal
No es una limitación que se pueda arreglar con más dinero: es un teorema

Por qué importa. Es la primera vez que este museo se topa con un límite demostrado. Todo lo anterior era ingenio, y el ingenio siempre puede mejorar; esto es una imposibilidad. Y obliga a una decisión que no es técnica sino de negocio: Amazon decidió que el carrito de la compra debe aceptar siempre un artículo, aunque después haya que arreglar alguna incoherencia, porque perder una venta es peor que tener un carrito raro. Un banco decide justo lo contrario.

¿Sabías que…?

De aquí salió la etiqueta «NoSQL», que es un nombre malísimo: no dice qué hacen esas bases de datos, solo qué no son. Y tiene un final irónico: quince años después casi todas han acabado añadiendo un lenguaje de consultas… parecido a SQL. Resulta que la gente quería seguir preguntando igual.

Hilo ② · el índice se paga antes

Elige dos de tres

Se corta la fibra entre Gavà y Girona

Los mismos datos viven en dos servidores, uno en cada sitio, y la línea que los une acaba de caerse. Elige las dos propiedades que quieres conservar: la tercera no la puedes tener, y no por falta de presupuesto.

pero…ya sabemos repartir la pregunta y elegir qué sacrificar. Queda una vuelta más incómoda: ¿y si el sistema deja de esperar a que preguntes?

TE LO TRAE tú ya no buscas EL CATÁLOGO DEJA DE ESPERAR LA PREGUNTA 100.000.000 DE VALORACIONES · 1.000.000 $ FIG. 23 · PREMIO NETFLIX · 2006—2009

Nº 23 / 26 · Sala VI

El premio Netflix

2006 — 2009

Origen
Netflix publica 100 millones de valoraciones «anónimas» y ofrece un millón de dólares por mejorar su recomendador un 10 %
Función
Adivinar qué querrías ver antes de que lo busques
Dato brutal
Ganó un equipo que combinaba más de cien modelos. Netflix nunca llegó a poner la solución ganadora en producción: era demasiado complicada

Por qué importa. Es el giro de todo el museo. Durante dos mil seiscientos años el sistema esperaba una pregunta: la tablilla, la ficha, el índice, el buscador. Aquí el catálogo se adelanta y propone. Y con eso el orden deja de ser tuyo: ya no ves lo que hay, ves lo que se ha decidido que verías. La pregunta «¿qué hay?» se convierte en «¿qué me ponen?».

¿Sabías que…?

El concurso acabó en un problema de privacidad de manual. Dos investigadores demostraron que cruzando las valoraciones «anónimas» con las públicas de IMDb se podía identificar a personas concretas —y con ellas, lo que veían—. Netflix canceló la segunda edición tras una demanda. La lección vale para cualquier conjunto de datos: anonimizar es mucho más difícil de lo que parece, porque nadie tiene tus mismos gustos.

Hilo ④ · de la lista a la respuesta

pero…si el sistema decide qué te enseña, la pregunta ya no es del todo tuya. Y aún queda un paso más: que en vez de una lista te dé directamente una respuesta.

Parada · Sala VI

Se parte la red entre dos servidores con los mismos datos. Según el teorema CAP, ¿qué NO puedes tener a la vez?

Sala VII

La respuesta

2008 — hoy

Cuando la máquina contesta en vez de darte una lista.

¿Qué se pierde cuando ya no te dicen de dónde lo han sacado?

LA VOZ UNA FOTO EL ÍNDICE, YA NO DE PALABRAS 0.83 0.12 0.55 FIG. 24 · 2008—2011

Nº 24 / 26 · Sala VII

Preguntar sin escribir

2008 — 2011

Origen
Varios a la vez: Shazam con el audio (2002), la búsqueda por voz en el móvil (2008), la búsqueda por imagen (2009), los asistentes (2011)
Función
Consultar con la voz, con una foto o con un trozo de canción: la pregunta se despega del teclado
Dato brutal
Una foto no tiene palabras. Para poder buscarla, el índice tiene que estar hecho de otra cosa

Por qué importa. Hasta aquí, absolutamente todo este museo indexa palabras: colofones, entradas, descriptores, términos, texto completo. Una canción o una fotografía no tienen palabras, así que hay que convertirlas en números comparables: una huella acústica, un vector de rasgos. Es el primer índice de este museo que no está hecho de lenguaje, y es la puerta de lo que viene ahora.

¿Sabías que…?

Shazam no compara la canción: compara una huella, unos pocos picos de frecuencia colocados en el tiempo, que sobreviven al ruido de un bar y a un altavoz malo. Es el mismo truco que la función resumen del ala de los signos: reducir algo enorme a algo diminuto que sirva para comparar. Cuando entiendes un truco, lo empiezas a ver en todas partes.

Hilo ④ · de la lista a la respuesta

pero…si el índice deja de ser de palabras, la pregunta también puede dejar de serlo. ¿Se puede buscar algo parecido sin que comparta ni una letra?

coche camión automóvil hombre rey mujer reina LA MISMA FLECHA DOS VECES: EL SENTIDO TIENE DIRECCIÓN FIG. 25 · WORD2VEC · 2013

Nº 25 / 26 · Sala VII

Los embeddings

2013

Origen
Tomáš Mikolov y su equipo, en Google (word2vec)
Función
Colocar cada palabra como un punto en un espacio de cientos de dimensiones, según la compañía que tiene
Dato brutal
Las direcciones significan algo: rey − hombre + mujer cae junto a reina

Por qué importa. Es la primera vez que una máquina encuentra algo parecido sin compartir una sola letra. Para el índice de la portada, «coche» y «automóvil» son dos términos sin ninguna relación; en un espacio vectorial están casi en el mismo punto. La consulta pasa de coincidir a parecerse, y por eso hoy puedes preguntar mal, con faltas y sin las palabras exactas, y aun así encontrar.

¿Sabías que…?

La idea es vieja y es de lingüistas: «una palabra se conoce por la compañía que tiene» (Firth, 1957). Y arrastra un problema conocido: los primeros embeddings colocaban «enfermera» cerca de «mujer» y «programador» cerca de «hombre», porque eso es lo que decían los textos con los que se entrenaron. Es el sesgo de Dewey otra vez, con una diferencia incómoda: ahora nadie lo ha escrito a mano y no hay una tabla que se pueda corregir.

Hilo ③ · el orden no es neutral

Pruébalo

Letras contra significado

Diez palabras colocadas a mano en un espacio de cuatro rasgos (transporte, ser vivo, comida y motor). Elige una y mira quién le queda cerca. El parecido no lo decide la ortografía.

pero…ya se puede preguntar de cualquier manera y encontrar por significado. Queda el último paso, y es el que cambia el trato: que en vez de enseñarte dónde mirar, te lo cuenten.

pregunta enlace enlace fuente fuente SE PUEDE COMPROBAR pregunta LA RESPUESTA ? SE GANA LA RESPUESTA. SE PIERDE EL RASTRO. FIG. 26 · 2022 → HOY

Nº 26 / 26 · Sala VII

El LLM como interfaz de consulta

2022 → hoy

Origen
La línea que va del transformer (2017) a los asistentes de uso masivo de 2022 en adelante
Función
Contestar en una frase en lugar de devolver una lista de sitios donde mirar
Dato brutal
Es la primera interfaz de consulta de la historia que no dice de dónde ha sacado la respuesta si no se lo pides

Por qué importa. Se recupera algo antiquísimo —la comodidad del oráculo: preguntas y te contestan— y se pierde algo que costó dos mil seiscientos años construir: el rastro. El colofón de Nínive decía en qué estante estaba; el índice impreso, en qué página; Garfield y PageRank, quién lo respaldaba. Una respuesta sin fuente rompe esa cadena. De ahí vienen los sistemas que buscan primero y contestan después, precisamente para poder volver a citar: la respuesta vale por el rastro que deja.

¿Sabías que…?

La alucinación no es una avería: es la consecuencia de cómo funciona. El modelo produce lo que suena bien, y la mayoría de las veces lo que suena bien es verdad —lo justo para que confiemos—. Y hay un problema de fondo del que se habla poco: si todos preguntamos al modelo y nadie visita la fuente, ¿quién escribirá la fuente de la que aprenda el modelo siguiente?

Hilo ④ · de la lista a la respuesta

Parada · Sala VII

¿Qué permiten los embeddings que no permitía un índice de palabras?

Las que ordenaron

De este museo se recuerdan los nombres de quienes inventaron sistemas: Dewey, Otlet, Bush, Codd. Pero ordenar el saber del mundo ha sido, durante siglo y medio, un oficio hecho sobre todo por mujeres, y de él salieron ideas que hoy están dentro de cualquier buscador. No hicieron de secretarias del conocimiento: hicieron su teoría.

Suzanne Briet 1894 — 1989

Preguntó qué es un documento y dio la respuesta más radical: un antílope suelto en la sabana no lo es, pero el mismo antílope en un zoo, con su ficha, sí. Documento es todo aquello de lo que se guarda constancia.

Henriette Avram 1919 — 2006

Programadora en la Library of Congress, creó el formato MARC: la razón de que dos bibliotecas cualesquiera del mundo puedan intercambiarse catálogos. Convirtió la ficha de cartón en un registro legible por una máquina.

Karen Spärck Jones 1935 — 2007

Demostró que una palabra vale por lo rara que es: si aparece en todos los documentos no distingue nada. Esa idea —el IDF— está dentro de todos los buscadores. «La informática es demasiado importante para dejarla en manos de los hombres.»

Las catalogadoras de la LoC 1901 — 1978

Durante casi ochenta años, un servicio de tarjetas impresas surtió de catálogo a las bibliotecas de todo un país. Miles de personas describiendo libros a mano, con reglas comunes: la infraestructura invisible sobre la que se pudo automatizar después.

El gran comparador

Mil millones de documentos

Cuántas comparaciones cuesta encontrar una palabra (escala logarítmica)

Uno a uno · peor caso
10⁹
Uno a uno · de media
5·10⁸
Ordenado · por mitades
30
Con índice invertido
1
Construir ese índice
10⁹

Mira las dos últimas líneas juntas, porque ahí está el hilo ② de este ala entero. Buscar con índice cuesta una operación. Construir el índice cuesta lo mismo que recorrerlo todo… una vez. Encontrar rápido no es magia: es trabajo hecho antes por alguien. Los quinientos frailes de 1230, las catalogadoras de la Library of Congress y las granjas de servidores que rastrean la web hacen el mismo turno.

El escriba de Nínive escribía en el borde de la tablilla de qué trataba y en qué estante vivía. Ese gesto —dejar dicho dónde encontrarlo— sostiene los veintiséis objetos de este ala. Hoy le pedimos la respuesta a una máquina que no nos dice de dónde la ha sacado. Hemos ganado la respuesta; el borde de la tablilla lo hemos perdido.

Quiz final · ¿Cuánto museo te llevas?

Diez preguntas, sin nota y sin trampa. Fallar también enseña (de hecho, enseña más).

Aciertos a la primera: 0 / 10

Pregunta 1

¿Por qué el orden alfabético tardó siglos en imponerse?

Pregunta 2

La concordancia bíblica de 1230 es el antepasado directo de…

Pregunta 3

¿Por qué en un manuscrito el número de página no sirve para nada?

Pregunta 4

¿Qué permite la notación decimal de Dewey?

Pregunta 5

¿Qué hacía el Mundaneum de Otlet que se parece asombrosamente a un buscador?

Pregunta 6

¿Qué cambió el Uniterm de Taube respecto a clasificar?

Pregunta 7

En una consulta SQL, ¿quién decide el camino para buscar los datos?

Pregunta 8

PageRank hereda casi tal cual una idea de 1964. ¿Cuál?

Pregunta 9

Se parte la red entre dos centros con los mismos datos. Según CAP, hay que elegir entre…

Pregunta 10

¿Qué se pierde cuando la respuesta llega sin decir de dónde sale?

¿Y ahora qué?

A este ala le falta el objeto Nº 27, y esta vez hay una pista bastante clara de por dónde va: sistemas que buscan antes de contestar y citan lo que han leído, para devolver el rastro que perdimos. Pero la pregunta gorda no es técnica: si todos preguntamos a la máquina y nadie visita la fuente, ¿quién escribirá la fuente de la que aprenda la máquina siguiente? Esa la contestáis vosotros, y no dentro de veinte años.

Para el profesorado

Enlaces directos: cada objeto tiene su ancla (#dewey, #codd, #pagerank…): añádela a la URL para proyectar ese objeto directamente. El botón «Índice» lista las 7 salas y los 26 objetos, y también las otras dos alas.

El interactivo de SQL ejecuta de verdad SELECT, JOIN … ON, WHERE con AND/OR, GROUP BY con agregados, ORDER BY y LIMIT sobre tres tablas, y da errores en castellano —incluido el de columna ambigua—. Sirve como primera sesión de bases de datos sin instalar nada, y para proyectar un JOIN antes de que nadie escriba una línea.

Pareja recomendada: «Hojear o buscar» (Sala I) y «El gran comparador» (cierre), seguidos. Entre los dos explican por qué existe la complejidad algorítmica sin usar la palabra.

Las tres alas: Máquinas que cuentan (los aparatos), Signos que guardan (los códigos y los cifrados) y esta (los catálogos y los índices). Se cruzan a propósito: Babbage aparece en dos, la concordancia de 1230 vuelve en MapReduce y el hash del ala de los signos reaparece en Shazam.

Rigor: datos contrastados con Britannica, el Computer History Museum, la Library of Congress, el Mundaneum y las publicaciones originales. Donde la cifra es tradición y no dato —los quinientos frailes de la concordancia— el texto lo dice.