Una idea técnica por vídeo. El artículo completo a un clic.
Explora las 76 explicaciones publicadas en 5sigmas. Cada página de vídeo incluye un resumen, ideas clave, el capítulo original y el siguiente contenido recomendado.
76 vídeos disponibles
0:36
Observabilidad, taxonomías de fallos y feedback loops
Telemetría no es un veredicto: señales de producción se convierten en fallos reproducibles, eval cases y reparaciones que vuelven a pasar por el mismo gate antes de regresar a producción.
Observabilidad y evaluación responden preguntas distintas · Primero conserva una identidad reproducible del sistema
0:36
Evaluación online: shadow, canary, A/B y regression gates
La evaluación online aumenta exposición de forma controlada: shadow observa sin decidir, canary limita blast radius, A/B estima efecto y guardrails o regression gates detienen una promoción insegura.
Antes de exponer tráfico, fija la unidad de cambio · Shadow: primero observa el candidato sin darle autoridad sobre la respuesta
0:36
Trayectorias de agentes: éxito, eficiencia, recovery y policy
Una trayectoria agentic se evalúa por outcome y por proceso: tools y estados observados explican cómo se llegó al resultado, mientras recovery, coste y policy separan éxito limpio de éxito corrupto.
Una trayectoria es una secuencia de transiciones, no una lista de tool names · Empieza por el outcome: ¿la tarea terminó realmente resuelta?
0:36
Benchmarking: coste, throughput, latencia y energía
Un benchmark de inferencia sólo es comparable si fija workload, frontera de medida y hardware, y reporta distribución de latencia, throughput útil, coste y energía.
Un benchmark es un protocolo, no un escalar · El workload debe parecerse al problema que quieres resolver
0:36
Routing, fallback, caching y serving adaptativo
Un router asigna cada request según capacidad, calidad, coste y latencia; cache y fallback cambian la ruta sin eliminar verificación ni límites de política.
La política empieza por lo que no puede elegir · Model routing elige antes del primer intento
0:36
Speculative decoding y prefix caching
Speculative decoding propone varios tokens baratos y el modelo objetivo los verifica; prefix caching reutiliza trabajo de prefill cuando el prefijo realmente coincide.
El presupuesto de latencia vuelve a ser el punto de partida · Prefix caching reutiliza estado de un prefijo ya calculado
0:36
Quantization, paralelismo y trade-offs
Quantization reduce bytes por parámetro; tensor y pipeline parallelism reparten cómputo y memoria. Cada elección mueve memoria, calidad, comunicación y latencia.
Cuantización no significa que todo el modelo tenga la misma precisión · La operación básica introduce error de representación
0:36
KV cache, jerarquía de memoria y continuous batching
El KV cache intercambia memoria por menos cómputo repetido; paging y continuous batching coordinan capacidad, admisión y reutilización entre requests activos.
Qué guarda realmente el KV cache · Una fórmula útil para estimar memoria — con límites explícitos
0:36
Prefill, decode y presupuesto de latencia
Prefill procesa el contexto en paralelo; decode genera tokens secuencialmente. TTFT, TPOT y throughput miden fases distintas del mismo servicio.
La petición cambia de forma después del prefill · TTFT mide una frontera visible para el cliente, no una sola operación
0:36
LLM-as-judge, evaluación humana y calibración
Un judge sólo es útil cuando su criterio se calibra contra evidencia humana, se mide su desacuerdo y se separan sesgo, varianza y estabilidad antes de usarlo como señal de aceptación.
Primero define qué significa «calibrar» · Elige primero el tipo de grader más estrecho que resuelva la pregunta
0:36
Eval sets: curación, hard negatives, leakage y versionado
Un eval set fiable conserva provenance, separa bancos por función y congela una release; hard pairs y canales de leakage distintos prueban fallos distintos sin mutar la comparación.
El objeto correcto: una versión del eval, no «el dataset» · La unidad mínima debe poder auditarse
0:36
Modelo, componente, workflow, trayectoria y sistema
La frontera correcta contiene el mecanismo que quieres atribuir: una trayectoria es evidencia de una ejecución, mientras el outcome confirma si el cambio importa al sistema.
La evaluación empieza definiendo el objeto, no la métrica · Nivel 1 — Evaluar el modelo
0:36
Skills, plugins, subagentes y aislamiento de contexto
Extensiones y subagentes sólo escalan bien cuando el contexto, la autoridad y la evidencia de cada worker permanecen explícitos y evaluables.
1. Cuatro primitives, cuatro preguntas distintas · 2. Una skill es una unidad de expertise reutilizable; no es una frontera de seguridad
0:36
MCP: lifecycle, capacidades y trust boundaries
MCP separa host, clientes y servidores; el descubrimiento de capacidades no elimina autorización, validación ni fronteras de confianza.
1. Empieza por las responsabilidades: host, client y server no son sinónimos · Host
0:36
Retrieval, frescura, conflictos y grounding
Recuperar candidatos no basta: hay que ponderar relevancia y frescura, resolver conflictos y ensamblar evidencia trazable.
1. Retrieval no es ensamblado de contexto · 2. Léxico, semántico y estructurado resuelven problemas diferentes
0:36
Arquitecturas de memoria y estado persistente
Memoria de trabajo, episodios, conocimiento semántico y estado persistente tienen ciclos de escritura, recuperación y caducidad distintos.
Working state: lo que la ejecución necesita ahora · Episodic memory: hechos situados en el tiempo
0:36
Presupuesto, prioridad, compactación y procedencia
Un presupuesto finito obliga a seleccionar, compactar o expulsar contexto conservando la procedencia de lo que sobrevive.
El máximo de contexto no es tu presupuesto operativo · Un item de contexto necesita más que texto
0:36
Context engineering frente a prompt engineering
La calidad depende de qué evidencia, estado y herramientas entran en cada turno, no sólo de cómo se redacta el prompt.
Primero: qué significa aquí «contexto» · Prompt engineering es una parte del problema
0:36
Tareas largas, subagentes, recuperación y observabilidad
Estado durable, ownership explícito y evidencia por candidate permiten reiniciar, coordinar workers e integrar sobre un target que avanza.
Una tarea larga es una máquina de estados durable, no una conversación infinita · «Memoria» no es un único objeto
0:36
Tests, verifiers y revisión de diffs
La aceptación deriva de evidencia conjunta y fresca sobre el mismo candidate SHA; un cambio invalida la evidencia que ya no corresponde.
Test, verifier, reviewer y stop condition no son sinónimos · «Los tests pasan» sólo tiene significado respecto a un contrato
0:36
Tools, permisos, approvals y trust boundaries
La intención del modelo sólo produce efectos tras cruzar validación, policy, approvals, sandbox y autoridad externa independientes.
La pregunta correcta no es «¿qué tools tiene el agente?» · Tool availability y permission son controles diferentes
0:36
Specs, planes, checkpoints y stop conditions
Un contrato fija el éxito; el plan puede cambiar con evidencia; los checkpoints y stop conditions hacen la trayectoria recuperable.
La petición no es todavía el contrato · Instrucciones persistentes y spec resuelven problemas diferentes
0:36
Workspace, worktrees y sandboxing
El aislamiento separa estado Git, filesystem, procesos y recursos; la integración final vuelve a validar el estado combinado.
Cinco objetos que conviene nombrar por separado · 1. Repositorio y revisión base
0:36
Qué añade un agent harness al modelo
El harness convierte propuestas del modelo en una trayectoria operativa con política, tools, estado y observaciones reales.
El modelo no posee el repositorio · 1. Modelo
0:36
Evaluación, observabilidad y reliability
La unidad útil es el turno trazable: evidencia correlacionada, taxonomía y bucle producción→eval→reparación.
Una transcripción no es la verdad del sistema · El objeto mínimo de análisis debe ser el turno lógico
0:36
WebRTC, SIP y red
El transporte decide dónde viven media, jitter, codecs y fronteras de telefonía.
Empieza por dibujar el camino, no por elegir un acrónimo · WebRTC: la ruta elegida por ICE importa
0:36
Tools, estado y acciones asíncronas
La conversación puede cambiar antes de que una acción termine; identidad y estado evitan aplicar resultados stale.
Una tool call no es el efecto externo · Separa cuatro tipos de estado
0:36
Presupuesto de latencia
Mide el camino crítico del mismo turno y separa trabajo solapado de bloqueos.
Una métrica de latencia necesita dos fronteras explícitas · El reloj también forma parte de la definición
0:36
Turn-taking e interrupciones
VAD detecta actividad; endpointing decide turnos; barge-in no revierte negocio.
VAD responde «¿hay habla?», no «¿ha terminado la idea?» · Un timeout es una política, no una prueba semántica
0:36
Arquitecturas de voz
Dónde aparece el texto y por qué full-duplex es un eje distinto.
Tres arquitecturas de modalidad · 1. Full cascade: audio → STT → LLM → TTS → audio
1:00
Controles de producción
Cómo mínimo privilegio, autorización independiente, kill paths, observabilidad y gates ligados a evidencia limitan el daño cuando el modelo falla.
Separar la lectura de documentos y las acciones · Dar a cada herramienta solo los permisos que necesita
1:00
Red-teaming
Cómo probar la cadena causal completa desde una entrada adversaria hasta autorización, efecto externo, recuperación y una regresión reproducible de release.
El threat model viene antes que el benchmark · Separar lo que el modelo sabe hacer de lo que el sistema ejecuta
1:00
Envenenamiento
Cómo una entrada no confiable puede convertirse en memoria persistente, reaparecer en una decisión futura y sobrevivir a un borrado incompleto mediante estado derivado.
Guardar un dato no lo convierte en verdad · La memoria persistente ya es una superficie de ataque medible
1:00
Jailbreaks
Cómo los intentos repetidos y adaptativos cambian la superficie de ataque y por qué la autorización y los límites de intentos siguen importando después de una negativa.
Rechazar una petición no crea una frontera perfecta · Probar muchas variantes cambia el coste del ataque
1:00
Seguridad en IA
Cómo una entrada no confiable puede influir en un sistema con IA y qué fronteras de autorización limitan que esa influencia se convierta en una acción.
1. Una orden escondida en un documento puede cambiar lo que hace el sistema · 2. Pedir al modelo que ignore sus límites
1:00
De la demo a producción
Qué hace operable a un agente bajo fallos: presupuestos, retries, idempotencia, trazas, cierres honestos y criterio para preferir un workflow determinista.
Presupuestos antes que promesas · Retries, idempotencia y fallos terminales
0:59
Seguridad de agentes
Cómo el contenido no confiable puede influir en una acción, y por qué autorización, mínimo privilegio y verificaciones independientes deben vivir fuera del prompt.
Prompt injection directa e indirecta · La autorización debe vivir fuera del prompt
1:00
Tutorial: cómo evaluar un agente de IA
Tutorial práctico para evaluar la tarea completa de un agente: resultado, trayectoria, permisos, coste, recuperación y abstención. Una respuesta final correcta no basta.
La unidad de evaluación es una tarea · Cuatro dimensiones que conviene medir
1:00
La anatomía de un agente
Separa lo que propone el modelo de lo que decide el runtime y muestra cómo tools, memoria, estado, contexto, permisos y salida forman contratos distintos.
El bucle mínimo · Tool calling: del texto a un contrato
1:00
Qué es un agente de IA y qué no lo es
Diferencia entre respuesta, workflow y agente acotado, mostrando que la autonomía depende del sistema, los permisos, la evidencia y una condición de parada.
Una escala de autonomía · 1. Respuesta directa
1:00
Agentes de IA
Mapa visual de qué convierte un modelo que responde en un sistema que decide acciones: bucle, evaluación, seguridad y operación con límites.
1. Qué es un agente y qué no lo es · 2. La anatomía de un agente
0:52
La huella real de un datacenter
Agua, energía, minerales y ciclo de vida de los datacenters: qué consume la IA, por qué varía por ubicación y cómo medir su huella.
1. La comparación que calibra la conversación · 2. Agua: el retiro, el consumo y la tecnología que lo determina
1:00
Qué es un datacenter en el espacio
Qué significa realmente procesar datos en órbita, qué casos de uso tienen sentido hoy, almacenamiento resiliente y los megaproyectos con visión de décadas.
1. Qué significa procesar datos en órbita · Procesamiento de datos de observación
0:52
Energía, calor y conectividad en órbita
Por qué el frío del espacio no significa refrigeración gratis, dónde está la ventaja real de la energía orbital y qué límites impone la conexión con la Tierra.
1. Por qué el frío del espacio no implica enfriar gratis · La escala real de los radiadores
1:00
Por qué ahora — demanda de cómputo y cuellos de botella en tierra
Por qué el cómputo en órbita se discute ahora mismo. La presión de la demanda de IA sobre la infraestructura terrestre y los límites que hacen el espacio relevante.
1. La explosión de la demanda de cómputo · 2. Los cuellos de botella en tierra
0:49
Datacenters en el espacio
Análisis técnico de los datacenters en órbita: disipación de calor, latencia, coste de lanzamiento y viabilidad real frente a la infraestructura terrestre.
1. Por qué ahora · 2. Energía, calor y conectividad
1:00
Prompt injection
Cómo una orden escondida en un documento puede entrar en un sistema con IA y qué controles separan la lectura de una acción.
1. El problema empieza cuando un documento llega al modelo · 2. La orden puede aparecer en una búsqueda de documentos
0:20
Agente Reactivo, Proactivo y Tool calls
Un recorrido técnico por Reactive / Proactive Agent y por el contrato conversacional que encapsula: respuesta inmediata, trabajo asíncrono y cierre diferido.
El problema no es la tool, es el tiempo · El primer turno acepta trabajo, no promete resultados
2:01
Riesgos — overthinking, coste, ataques y alineamiento
Overthinking, prompt injection y hijacking de agente en modelos razonadores con herramientas. Criterios para acotar el riesgo en producción.
1. Sobrepensamiento: cuando más razonamiento deteriora la respuesta · 2. Calidad vs coste vs latencia en producto real
1:55
Tiempo físico — latencia, streaming e interacción humana
TTFT, streaming y umbrales de latencia percibida en modelos razonadores. RouteLLM, patrones de diseño y gestión de coste de sesión en producción.
1. Umbrales de latencia percibida · Enrutamiento dinámico: RouteLLM
2:09
Test-Time Compute
Test-time compute como segunda ley de escala. Las tres palancas (más pasos, más candidatos, más estructura) y su perfil de calidad, coste y latencia en modelos razonadores.
1. Qué es test-time compute y por qué importa · 2. Las tres palancas
0:52
IA y PIB hoy — impacto real y señales tempranas
Por qué el impacto macroeconómico de la IA tarda en aparecer en el PIB, dónde sí aparece antes, y qué señales son más indicativas de lo que está pasando.
1. Por qué el impacto macro tarda en llegar · Los cuatro mecanismos del desfase
1:48
Cómo se ven los fallos de los modelos razonadores
Sycophancy, shortcut learning, specification gaming y fallos en cadena: los tipos de fallo de los modelos razonadores, cómo detectarlos y mitigarlos.
1. Tipos de fallos · 1.1 Atajos (shortcut learning)
0:52
Medición — PIB vs bienestar
Por qué el PIB no captura el bienestar real, qué dimensiones importan más, y cuándo el bienestar subjetivo diverge del material.
1. Qué mide el PIB y qué deja fuera · Lo que queda fuera del PIB
1:22
Qué significa razonar en un LLM
Qué significa razonar para un modelo de lenguaje, qué aportan o1 y DeepSeek R1, y por qué evaluar razonamiento exige mirar pasos, coste y fallos.
1. Qué significa "razonar" para un humano · 2. Qué pueden hacer los LLMs que se parece al razonamiento
1:15
Modelos razonadores — test-time compute, cadenas de pensamiento y fallos sistemáticos
Cinco capítulos sobre cómo razonan los LLMs: test-time compute, fallos, latencia, coste y riesgos cuando usan herramientas.
1. Qué es “razonar” para un LLM · 2. Cómo se ven los fallos de estos sistemas
0:52
IA como tecnología eléctrica
Qué implica la IA en términos de cómputo y energía, por qué la demanda puede crecer aunque mejore el hardware, y cuáles son los cuellos de botella reales.
1. Qué implica "compute" en la práctica · Entrenamiento
1:15
Electricidad y bienestar
Por qué el acceso a electricidad fiable y barata habilita saltos reales en salud, logística e industria, y qué diferencia hay entre tener kilovatios y tener calidad de suministro.
1. Los cuatro canales principales · Salud
1:00
IA, PIB, bienestar y energía
Impacto cuantitativo de la IA en energía, productividad y bienestar. Análisis con datos reales del Banco Mundial, IEA y Penn World Table, sin proyecciones especulativas.
1. Electricidad → bienestar (los mecanismos reales) · 2. IA como tecnología eléctrica
0:52
Riesgos de seguridad en sistemas multimodales
Prompt injection visual, privacidad, fugas de contexto y manipulación de herramientas cuando un sistema multimodal puede observar y actuar.
1. Prompt injection visual · 2. Fugas de sistema y manipulación de herramientas
1:14
Evaluación de sistemas multimodales
Cómo evaluar sistemas multimodales sin confundir benchmarks con capacidad real: OCR, audio, grounding, razonamiento y fallos de las métricas.
1. Qué significa evaluar el grounding · 2. El problema de la contaminación de benchmarks
0:52
Arquitecturas de sistemas multimodales
Cuatro familias de arquitectura multimodal, sus diferencias en calidad, coste y latencia, y cuándo conviene cada forma de combinar modalidades.
1. Encoder visual + conector + modelo de lenguaje · 2. Fusión mediante cross-attention
0:52
Alineamiento de pares a interacciones multimodales
Cómo aprende un modelo que señales distintas describen lo mismo y por qué los datos determinan la robustez del alineamiento multimodal.
1. Pares imagen-texto: la base y sus límites · 2. Más allá del par: alineamiento de múltiples modalidades
1:15
El problema real de la multimodalidad
Qué significa integrar texto, imagen, audio y otras modalidades, y cómo ordenar percepción, alineamiento, razonamiento, generación y acción.
1. Una modalidad no es solo un tipo de input · 2. El problema no es añadir modalidades, sino cruzarlas sin destruirlas
1:07
Multimodalidad en IA generativa
Qué significa construir sistemas capaces de percibir, alinear, razonar, generar y actuar entre texto, imagen, audio, vídeo, documentos y otras señales del mundo.
1. El problema real: qué cuenta como multimodalidad · 2. Alineamiento: de pares a interacciones
1:25
Más allá del Transformer — memoria y modelos del mundo
Cómo el campo intenta ir más allá del puro escalado del Transformer combinando herramientas, búsqueda, memoria en inferencia, modelos del mundo y robótica.
1. Por qué el Transformer ya no basta como mapa completo · 1.1 Verdad, incertidumbre y alucinación
1:09
Escalar - de AlexNet a los modelos fundacionales
Cómo datos, cómputo y arquitecturas escalables cambiaron la IA desde 2012. AlexNet, Transformer, preentrenamiento, leyes de escala y el nacimiento de los modelos fundacionales.
1. 2012: cuando la escala dejó de ser un detalle · 2. El Transformer y el preentrenamiento masivo
1:15
Aprender — de las reglas a los datos
Cómo la IA pasó de reglas escritas a mano al aprendizaje con datos: sistemas expertos, estadística, redes neuronales y el salto de AlexNet.
1. La era de las reglas: cuando la inteligencia se escribía a mano · Los primeros sistemas simbólicos
1:26
Mecanizar — de Babbage a Turing
Cómo la humanidad automatizó el cálculo: de los primeros mecanismos físicos a la separación de programa y hardware, y los fundamentos teóricos de la computación moderna.
1. De automatizar cuentas a programar procedimientos · Las primeras calculadoras: automatizar no es programar
1:22
Representar — del conteo al cálculo
Cómo símbolos, números, álgebra y cálculo hicieron posible representar y manipular el mundo hasta construir la base matemática de la IA moderna.
1. Inventamos lenguajes para describir el mundo · Antes de escribir, ya contábamos
1:15
De las cavernas a la AGI
Historia intelectual de la IA: desde las primeras abstracciones matemáticas hasta los modelos fundacionales. Matemáticas, filosofía y computación en contexto.
1. Representar (≈ 40 000 a. C. – 1700) · 2. Mecanizar (≈ 1700 – 1956)
1:10
Qué es AGI: inteligencia artificial general
AGI significa inteligencia artificial general. Este capítulo explica sus definiciones, los niveles de DeepMind y OpenAI, y qué faltaría para alcanzarla.
1. El problema de la definición · 2. Las definiciones en disputa
1:15
IA clásica vs IA Generativa
Comparativa técnica entre IA clásica e IA generativa: entradas, salidas, determinismo, explicabilidad y cuándo usar reglas, ML, LLM, RAG o agentes.
1. Las cinco diferencias · 1.1 Entradas y salidas
1:14
Qué es IA Generativa
Cómo funciona la IA generativa: del embedding y el Transformer a los modelos fundacionales. Leyes de escala, LLMOps y diferencias entre LLM, RAG y agentes.
1. Embeddings: Traduciendo el texto a números · 2. El Transformer: La arquitectura que lo cambia todo
1:26
Qué es la Inteligencia Artificial
Qué es la Inteligencia Artificial, cómo funciona y cómo ha evolucionado: desde heurísticas y Machine Learning hasta redes neuronales y modelos fundacionales.
1. El Marco General: IA, ML, DL y GenAI · 2. ¿Cómo aprenden estos sistemas?
0:59
Fundamentos de IA e IA generativa
Serie introductoria sobre IA e IA generativa: qué son, cómo funcionan, en qué se diferencian y qué es la AGI. Para profesionales técnicos y decisores.
1. Qué es la IA y su evolución · 2. Qué es IA generativa exactamenteNo hay vídeos que coincidan con la búsqueda.