De la IA a los LLMs: poniendo orden a la terminología

Cuando entro a una sala con un cliente y alguien dice "queremos que auditen nuestra IA", yo todavía no sé qué me están pidiendo. Y no es pedantería: es que "IA" en 2026 abarca cosas tan distintas que empezar sin aclarar el término es empezar a ciegas. Antes de tocar un solo payload necesito saber exactamente qué tengo enfrente, porque cada capa de esta tecnología abre su propia superficie de ataque, exige sus propias herramientas y se mide contra marcos de referencia distintos. Por eso quiero arrancar este libro poniendo orden en la terminología: no para lucirnos con definiciones, sino porque sin ese mapa no sabrás contra qué estás disparando.

🎯 Objetivos de aprendizaje

Cuando cierres este capítulo vas a poder:

  • Distinguir con precisión IA, ML, DL, Generative AI y LLMs.

  • Reconstruir la cronología que llevó del Transformer (2017) a los agentes autónomos (2026).

  • Justificar por qué cuando hoy se dice "IA" lo más probable es que se hable de LLMs.

  • Explicar por qué cada capa de la taxonomía abre una superficie de ataque distinta.

2.1 · El árbol genealógico de la inteligencia artificial

Déjame empezar por el principio. En 2026 el término IA se usa de forma tan amplia que puede significar cosas radicalmente distintas según con quién hables. Y aquí está mi regla de oro antes de atacar cualquier sistema con IA: necesito saber con exactitud qué tipo de IA tengo delante, porque cada capa carga con su propia superficie de ataque, sus propias herramientas y sus propios marcos de referencia. Vamos a recorrer esas capas una por una.

📖 Definición técnica: Inteligencia Artificial (IA)

Disciplina de las ciencias de la computación que estudia la construcción de sistemas capaces de realizar tareas que, ejecutadas por un ser humano, requerirían inteligencia: percepción, razonamiento, aprendizaje, toma de decisiones, generación de lenguaje, etcétera. Incluye desde sistemas expertos basados en reglas hasta redes neuronales profundas.

📖 Definición técnica: Machine Learning (ML)

Subcampo de la IA centrado en algoritmos que aprenden patrones a partir de datos, en lugar de ser programados explícitamente con reglas. Incluye regresión, árboles de decisión, Random Forest, máquinas de vectores de soporte (SVM), clustering y, en su variante moderna, redes neuronales.

📖 Definición técnica: Deep Learning (DL)

Sub-rama del ML basada en redes neuronales artificiales con múltiples capas (de ahí "deep"). Es la tecnología que sostiene hoy el reconocimiento de imagen (CNNs), la traducción automática, speech recognition y los LLMs.

📖 Definición técnica: Generative AI

Familia de modelos de DL cuya tarea es generar contenido nuevo (texto, imagen, audio, video, código) que se parece estadísticamente al contenido sobre el que fueron entrenados. Engloba a los LLMs, a los modelos de difusión (Stable Diffusion, DALL-E, Midjourney) y a los modelos generativos de audio.

📖 Definición técnica: Large Language Model (LLM)

Modelo generativo de deep learning, basado típicamente en la arquitectura Transformer, entrenado sobre cantidades masivas de texto para predecir el próximo token dado un contexto. Ejemplos: GPT-4o, Claude 3.7, Gemini 2.0, Llama 3.3, Mistral, DeepSeek.

💡 Concepto clave

Quiero que te quedes con una imagen mental: estas capas no son hermanas, son muñecas rusas. La relación es de inclusión estricta:

text
LLMs ⊂ Generative AI ⊂ DL ⊂ ML ⊂ IA

Cuando alguien dice "IA" en 2026, en el 95 % de los casos está hablando de Generative AI, y dentro de ella, en el 80 % de los casos, está hablando específicamente de LLMs. Por eso, cuando te digan "audita nuestra IA", lo más probable es que te estén señalando un LLM sin saber nombrarlo.

2.2 · Por qué importa para seguridad

Ahora te muestro por qué insisto tanto en el mapa: cada capa de la taxonomía tiene una superficie de ataque diferente, y mezclarlas te hace perder el rumbo. Mira esta tabla con calma, porque resume el terreno que vas a pisar el resto del libro:

CapaVectores de ataque típicosMarco
ML clásicoAdversarial examples, model extraction, evasionMITRE ATLAS
DLAdversarial patches, backdoor attacks, poisoningMITRE ATLAS
Generative AI (imagen)Prompt-to-image jailbreaks, deepfake, NSFW bypassNIST AI RMF
LLMsPrompt injection, jailbreak, tool abuse, RAG poisoningOWASP LLM Top 10

El error que me encuentro una y otra vez en el pentester web tradicional cuando entra a un engagement de AI Security es asumir que "proteger el chatbot" equivale a "proteger toda la IA del cliente". No es así. Un cliente típico de banca LATAM tiene los cinco niveles desplegados al mismo tiempo: modelos clásicos de scoring crediticio (ML), detección de fraude con CNN (DL), generación de imágenes de campañas (Generative), LLMs para soporte al cliente y agentes para back-office. Cada uno te pide un enfoque ofensivo distinto, y si solo miras el chatbot dejas cuatro frentes abiertos.

💡 Tip profesional

Un consejo que te va a ahorrar discusiones incómodas: en la fase de scoping (Capítulo 38), pregúntale siempre al cliente por su inventario completo de modelos de IA, no solo por el chatbot. Suele aparecer un 70 % más de superficie de la que el cliente había considerado contratar —y eso cambia por completo el alcance del engagement.

2.3 · Cómo llegamos hasta aquí: línea de tiempo 2017–2026

Para que entiendas dónde estamos parados, déjame contarte cómo llegamos hasta aquí. Toda la IA generativa moderna nació de un único paper publicado el 12 de junio de 2017 por investigadores de Google. Su título, Attention is All You Need, parecía técnico y discreto; en realidad introducía la arquitectura Transformer, sobre la que se construye hoy prácticamente todo modelo generativo de relevancia. Sigue conmigo esta cronología, porque cada hito explica una pieza del mundo que vas a auditar:

AñoHito
2017Google publica Attention is All You Need · nace el Transformer.
2018BERT (Google) · encoder-only para comprensión de lenguaje.
2020GPT-3 (OpenAI) · escala masiva, primeras aplicaciones comerciales.
2022ChatGPT alcanza 1 M de usuarios en 5 días · momento iPhone de la IA.
2023Llama 2 (Meta) · explosión del ecosistema open-weights.
2024GPT-4o multimodal · Claude 3 · agentes tool-using.
2025MCP (Model Context Protocol) estandarizado · agentes en producción.
2026DeepSeek revoluciona el costo por token · OAIF se lanza en LATAM.

Fíjate en lo que esa tabla esconde: en nueve años pasamos de un paper académico a agentes autónomos que gestionan dinero, ejecutan código y firman contratos en producción. La seguridad —como industria— no alcanzó ese ritmo, y justo en esa brecha está la oportunidad profesional que te abre este programa.

2.4 · Por qué los LLMs cambian todo el paradigma

Quiero ser directo contigo, sobre todo si vienes del pentest clásico: hay tres razones por las que un equipo de pentesting tradicional, sin formación en AI Security, está estructuralmente mal equipado para auditar un sistema basado en LLMs. No es falta de talento; es que el terreno cambió bajo sus pies.

  • Razón 1. El LLM no separa código de datos. En SQL Injection clásico, separamos código y datos con prepared statements. En LLMs, las instrucciones del desarrollador y la entrada del usuario comparten el mismo flujo de tokens. No hay prepared statement posible (Capítulo 6).

  • Razón 2. El LLM es no-determinista por diseño. La misma entrada puede producir respuestas distintas. Los pentests tradicionales asumen determinismo: "si esta entrada disparó este bug ayer, lo dispara hoy". En LLMs eso no se sostiene.

  • Razón 3. El LLM tiene agency. Ya no solo responde: ejecuta. Con tool calling, agentes LangChain o servidores MCP, el LLM ejecuta código, envía correos y mueve dinero. Un jailbreak ya no extrae información —causa daño real.

⚠️ Advertencia

Si vienes del pentest web tradicional, quiero que tengas claro algo que repito en cada formación: cerca del 80 % de lo que ya sabes sigue aplicando —las vulnerabilidades web clásicas también aparecen detrás del LLM, como verás en el Capítulo 27. Pero ese 20 % restante —el modelo probabilístico, la agency, las arquitecturas agentic— es genuinamente nuevo, y es justo lo que vamos a trabajar juntos a lo largo de este libro.

2.5 · Familias de modelos relevantes en 2026

El ecosistema de LLMs en 2026 se diversificó muchísimo desde aquel dominio inicial de OpenAI, y eso es bueno para ti como atacante: cada familia tiene un perfil ofensivo propio. Para fines ofensivos yo los agrupo en cuatro categorías, y vale la pena que te las grabes:

  1. Comerciales cerrados (API). GPT-4o, GPT-5 (OpenAI); Claude 3.7, Claude 4 (Anthropic); Gemini Pro/Ultra (Google). Se consumen por API, los datos salen de la organización, calidad top, costo por query.

  2. Open-weights. Llama 3/4 (Meta), Mistral/Mixtral (Mistral), Command R+ (Cohere). Pesos descargables, uso comercial libre, requieren GPU propia, ideales para self-hosting.

  3. Open-source comunidad. Phi-3/4 (Microsoft), Qwen (Alibaba), DeepSeek R1/V3, Falcon (TII). Costo cero, calidad variable, ideales para experimentar y estudiar.

  4. Modelos en español LATAM. Llama-es y fine-tunes regionales (UNAM, ITESM, UBA), Bertin (BERT en español), modelos académicos. Mejor rendimiento en español, ecosistema aún incipiente.

💡 Tip profesional

Antes de elegir tus técnicas, identifica el modelo que tienes debajo: lo que en este oficio llamamos fingerprinting —reconocer qué modelo responde del otro lado. Te lo digo porque el perfil cambia todo: Llama 3.3 abierto es —según mediciones internas de la Academia de Ciberseguridad— el modelo más vulnerable de los actuales, mientras que Claude 3.7 es el más resistente. Las técnicas que funcionan contra uno pueden fracasar estrepitosamente contra el otro (véase Capítulo 25).

🧭 Síntesis del capítulo

  1. IA ⊃ ML ⊃ DL ⊃ Generative AI ⊃ LLMs: cada capa tiene una superficie de ataque distinta.

  2. En 2026, "IA" suele significar LLM, pero un cliente real tiene los cinco niveles desplegados simultáneamente.

  3. El Transformer de 2017 es el origen genealógico de toda la revolución actual.

  4. Los LLMs cambian el paradigma de seguridad por tres razones: no separan código/datos, no son determinísticos y tienen agency.

  5. El ecosistema 2026 incluye comerciales cerrados, open-weights, open-source y modelos específicos para español LATAM, cada uno con un perfil ofensivo propio.

Preguntas de repaso

  1. Define con precisión IA, ML, DL, Generative AI y LLM, y explica la relación de inclusión entre ellos.

  2. ¿Qué paper y qué año marcan el origen genealógico de los LLMs modernos?

  3. Enuncia las tres razones por las que un LLM no se puede pentestear con técnicas web tradicionales puras.

  4. Clasifica GPT-4o, Llama 3.3, Mistral y Qwen en las cuatro familias del ecosistema 2026.

  5. ¿Por qué fingerprintear el modelo subyacente afecta la elección de técnicas ofensivas?

¿Te interesó? Continúa el programa

Esto es solo una muestra. Crea tu cuenta para desbloquear todo el contenido y obtener tu credencial verificable al aprobar el examen.

El resto del temario se desbloquea al registrarte.