Qué es un agente de IA y qué puede hacer hoy (sin humo)
Un agente de IA no es un chatbot con otro nombre: qué es exactamente, qué hace bien hoy con casos reales, dónde falla y cómo saber si te sirve.
Cómo la Búsqueda de personas con IA en LinkedIn revoluciona el reclutamiento con indexación en GPU y destilación de modelos a escala de mil millones.
Tiempo de lectura: 12 min
Búsqueda de personas con IA en LinkedIn es el salto de la búsqueda por palabras clave a la búsqueda semántica LinkedIn, pensado para encontrar personas relevantes aunque no usen exactamente tus palabras. Llega tras el boom de ChatGPT y se apoya en el precedente de la búsqueda de empleo con IA.
La promesa es clara: entender la intención, no solo las palabras, y devolver candidatos que encajan con lo que necesitas. Esto marca la diferencia en una red con 1.300 millones de miembros, donde la coincidencia literal se queda corta.
En empleo, LinkedIn ya había mostrado el camino con IA generativa y consultas en lenguaje natural, con mejoras medibles en descubrimiento y conversión, especialmente para buscadores sin título universitario (reportes citan incrementos cercanos al 10%). Ver búsqueda de empleo con IA en LinkedIn.
Ahora esa receta técnica y organizativa se aplica a personas: un motor semántico apoyado por LLMs, indexación en GPU y un pipeline de destilación que hace posible la relevancia a escala. Consulta la búsqueda asistida por IA en LinkedIn Recruiter y este resumen técnico sobre cómo escalaron con indexación en GPU.
La búsqueda léxica tradicional empareja palabras exactas. Si preguntas “cáncer”, el sistema prioriza perfiles que contengan literalmente “cáncer”. Es rígida: un sinónimo o una formulación distinta pueden excluir talento valioso.
La búsqueda semántica LinkedIn usa LLMs para entender la intención y las relaciones conceptuales. Una consulta como “¿Quién sabe sobre curar el cáncer?” ya no mira solo la palabra “cáncer”, sino conceptos relacionados: oncología, biología molecular, investigación genómica, ensayos clínicos, publicaciones y patentes. También reconoce funciones (“investigador principal”), industrias y seniority.
Ejemplo práctico: escribes en lenguaje natural “¿Quién sabe sobre curar el cáncer?”. El sistema prioriza líderes de investigación, clínicos con ensayos en fase II/III, científicos de datos que publicaron en onco-genómica y, además, ordena con inteligencia a quienes están a 1 o 2 grados de tu red para maximizar la posibilidad de contacto.
El valor de producto está en ese equilibrio: relevancia semántica + utilidad real (alcanzabilidad). La lista final es útil porque incorpora contexto profesional, señales de tu red y probabilidad de respuesta.
La solución opera en dos etapas con un enrutador y modelos especializados para cada fase. El objetivo: relevancia a escala de 1.300M miembros y latencias aptas para producto.
Un enrutador de consultas impulsado por LLM decide si tu búsqueda debe ir a la pila semántica (intención, sinónimos, lenguaje natural) o a la léxica tradicional (casos exactos, nombres propios, IDs). Así se evita sobredimensionar la IA cuando una coincidencia exacta es mejor.
La primera etapa usa un modelo de ~8.000M parámetros para generar embeddings y recuperar candidatos relevantes en todo el grafo. El stack de CPU previo no escalaba por latencia y memoria a nivel de mil millones de registros; la migración a indexación en GPU permitió consultas de alta dimensión con latencias “ágiles” y mayor throughput. Si te interesa cómo extender estos patrones a recuperación y razonamiento con grafos, revisa este enfoque de Graph-RAG.
Tras recuperar miles de candidatos, un modelo alumno altamente destilado hace el ranking fino. Pasar de ~440M a ~220M parámetros redujo latencia con menos del 1% de pérdida de relevancia. Esta capa reordena con señales semánticas, de red y de engagement.
Consulta → Enrutador LLM → Recuperación semántica (8B + índice en GPU)\n → Resumidor de contexto → Ranking alumno (≈220M) → Resultados
Este diseño modular mantiene precisión y velocidad, con componentes que se entrenan y despliegan de forma desacoplada. Para profundizar en arquitectura de ML en producción, consulta esta guía de diseño de sistemas de ML.
LinkedIn codificó un pipeline de destilación y co-diseño para hacer la IA entrenable, verificable y eficiente. Es un recetario replicable por equipos de producto.
Se arranca con un conjunto “golden” de cientos o miles de pares consulta-perfil anotados según una política clara (documento de 20–30 páginas). Define qué es “relevante”, cómo balancear alcance de red, seniority y frescura del perfil.
Con ese gold set se instruye un LLM base para generar ejemplos sintéticos, ampliando la cobertura de consultas y variaciones lingüísticas sin multiplicar el coste de anotación humana.
Un modelo grande (≈7B) actúa como “juez” de alta fidelidad para evaluar relevancia y adherencia a la política. Es demasiado lento para producción, pero ideal como referencia offline.
Se aplica destilación de modelos para ranking en varias capas:
El resultado: varios maestros más un estudiante permiten sopesar política, relevancia y utilidad. Se puede ajustar el “mezclador” para priorizar conectabilidad en búsquedas de negocio o profundidad técnica en investigación.
Fragmento de política de producto (ejemplo)
- Relevancia temática ≥ umbral definido por taxonomía de skills.
- Preferir contactos 1º y 2º grado cuando la relevancia es similar.
- Penalizar perfiles inactivos o con señales de baja respuesta.
- Fomentar diversidad de títulos y trayectorias cuando la intención lo permita.
Escalar la IA a 1.300M miembros exige optimización de modelos LLM sin descanso. Tres técnicas dieron el salto.
Reducir el re-ranker de ~440M a ~220M con pruning estructurado y técnicas de conocimiento conservado mantuvo la calidad con una caída de relevancia <1%. La latencia por solicitud bajó en decenas de milisegundos, habilitando más tráfico concurrente.
Un resumidor entrenado por RL compacta el contexto (descripciones, publicaciones, skills) antes del ranking. La reducción de tokens de entrada fue ~20x con mínima pérdida de información, lo que permitió mayores lotes y menos memoria en GPU.
Al combinar compresión, resumido y mejor batch sizing/quantización, el throughput del ranking aumentó cerca de 10x. Ejemplo: si un clúster atendía 1.000 consultas/seg con p95=250ms, pasó a 10.000 consultas/seg con p95~180ms, ajustando cuantización a 8 bits y colas por prioridad.
Estos cambios se midieron continuamente para vigilar los trade-offs: una ganancia de 20ms que degrade 2% la precisión no siempre compensa en negocio.
La indexación en GPU fue necesaria para búsquedas vectoriales de alta dimensión sobre miles de millones de embeddings. En CPU, la latencia p95 crecía demasiado con el tamaño del índice; en GPU, la paralelización mantuvo el tiempo casi constante a mayor escala. Ver explicación en este análisis.
El cambio implicó nuevos costos operativos (capex de GPU, energía) y rediseño de la capa de servicio: colas por SLO, particionado del índice, replicación activa-activa y warm caches por región. Se agregaron controles de backpressure y límites por cliente. Complementa con estrategias de ingeniería de datos para IA que habilitan pipelines robustos.
En despliegue, los SLOs se fijaron por capa: 50–80ms para recuperación, 60–90ms para ranking, 20–40ms para enrutado y networking. La monitorización combina métricas de latencia con métricas de calidad de ranking, para evitar “optimizar solo la velocidad”.
El objetivo no es solo “acertar”, sino ser útil. Por eso la utilidad/engagement pesa tanto como la relevancia pura.
Las métricas incluyen precisión semántica, tasa de conexión, tasa de respuesta, CTR y conversiones. Los A/B tests evalúan impacto real en la red profesional y detectan regresiones por cambios de modelos o políticas. Revisa la guía de LinkedIn Recruiter.
Regla 1: Sé pragmático. “No intentéis hacer demasiado a la vez… gana un vertical primero.” —Wenjing Zhang. LinkedIn lo hizo con búsqueda de empleo con IA antes de generalizar a personas.
Regla 2: Codifica el recetario. Documentación, golden datasets y pipelines reproducibles (pipeline de destilación y co-diseño) permiten escalar equipos sin perder calidad. Si lideras la adopción de IA en tu organización, consulta esta guía de liderazgo en IA empresarial.
Regla 3: Optimiza sin descanso. Destilación de modelos para ranking, pruning, cuantización y un resumidor entrenado por RL te dan el margen de latencia para crecer sin sobredimensionar infraestructura.
Regla 4: Construye herramientas primero. “Los productos agentivos solo son tan buenos como las herramientas que usan…” Un buen enrutador, un índice robusto y APIs de recuperación/ranking son la base de cualquier agente. Aprende a crear Skills y agentes para Claude (Anthropic).
Riesgos técnicos: sobrecompresión que degrade relevancia, latencia inestable por picos de tráfico, y costos operativos altos en GPU si la eficiencia no acompaña.
Riesgos de producto: sesgos en selección (por industria, educación o geografía), privacidad de señales y posibilidad de perfiles manipulando resultados.
Salvaguardas: una política de producto firme y auditable; modelos de “juicio” (policy model) que verifiquen adherencia; pruebas con datos reales y diversidad de casos; límites de visibilidad para reducir gaming; y auditorías periódicas de sesgo y drift. Más contexto en este análisis.
La filosofía es clara: primero herramientas (motor semántico, enrutador y APIs estables) y luego agentes que las usen. Con esa base, se pueden crear asistentes que busquen, califiquen, redacten mensajes y preparen presentaciones con un clic.
La hoja de ruta razonable: extender la receta a más superficies de LinkedIn (ventas, aprendizaje, eventos) y, a futuro, ofrecer agentes integrados controlados por políticas. “Una cosa es hacerlo con decenas de millones de puestos. Otra cosa es hacerlo con más de mil millones de miembros.” —Erran Berger. Ver cobertura en esta nota.
Meta title sugerido: Búsqueda de personas con IA en LinkedIn: arquitectura, optimizaciones y lecciones
Meta description sugerida: Descubre cómo funciona la búsqueda semántica LinkedIn, su pipeline de destilación, indexación en GPU y mejores prácticas IA empresarial.
La Búsqueda de personas con IA en LinkedIn demuestra que el paso de la búsqueda léxica a la semántica es posible a escala, si se combina un buen enrutador, indexación en GPU y destilación de modelos para ranking. La lección: herramienta sólida, política clara y obsesión por utilidad.
Si lideras producto o ingeniería, empieza por un vertical, construye tu golden dataset y experimenta con destilación. Al hacerlo, estarás listo para llevar la búsqueda semántica LinkedIn y sus beneficios a tu propio dominio.
Entiende la intención y los conceptos relacionados, no solo palabras exactas. Esto trae perfiles relevantes aunque no coincida el término literal, y ordena por alcanzabilidad y probabilidad de respuesta.
Es transferir el conocimiento de modelos grandes a uno pequeño y rápido. La destilación multi-maestro permitió un re-ranker de ~220M que mantiene calidad con latencia baja, clave para operar a escala.
Para manejar búsqueda vectorial sobre miles de millones de embeddings con latencia estable y alto throughput. En CPU, el costo/latencia crecía demasiado con el tamaño del índice.
Es un modelo que comprime el contexto de entrada optimizando una recompensa (relevancia/recall). Redujo los tokens ~20x y habilitó un incremento ~10x en rendimiento del ranking.
Empieza con un vertical acotado, crea un golden dataset y política, entrena un policy model como juez, destila a un alumno rápido y planifica indexación en GPU si habrá recuperación vectorial.
¿Quieres profundizar? Suscríbete a nuestro podcast técnico y mantente atento al post técnico de Wenjing Zhang con más detalles prácticos.
Es el momento de pasar de palabras a intención. Lleva la Búsqueda de personas con IA en LinkedIn —y su receta— a tu producto.
La búsqueda léxica tradicional empareja palabras exactas, así que un sinónimo puede excluir talento válido. La búsqueda semántica usa LLMs para entender la intención: una consulta como "quién sabe sobre curar el cáncer" reconoce conceptos relacionados como oncología, ensayos clínicos o biología molecular.
Opera en dos etapas: un enrutador de consultas impulsado por LLM decide si la búsqueda va a la pila semántica o a la léxica tradicional, y luego un modelo de unos 8.000 millones de parámetros genera embeddings para recuperar candidatos relevantes en todo el grafo de 1.300 millones de miembros.
Tras recuperar miles de candidatos, un modelo alumno destilado hace el ranking fino. Reducir el modelo de unos 440 millones a 220 millones de parámetros permitió bajar la latencia con menos del 1% de pérdida de relevancia en los resultados finales.
Un agente de IA no es un chatbot con otro nombre: qué es exactamente, qué hace bien hoy con casos reales, dónde falla y cómo saber si te sirve.
Por qué “más parámetros” no gana si faltan tokens. Resumen claro del paper de entrenamiento compute-óptimo y sus implicaciones hoy.
Lo bueno, lo malo y lo peligroso: feedback loops, degradación por recursividad y reglas para usar sintéticos sin cargarte el modelo.