inteligencia artificial · las 6 historias del día · 24 de julio
storyflo · A.I.
Jul 24, 2026 · 2 min listen · Last updated July 24, 2026
De storyflo. Este es tu resumen diario de audio para el 24 de julio. Estas son las 6 historias principales de inteligencia artificial de hoy. Vamos a ello. Primero, de AI News. OpenAI Presence vende agentes de IA empresariales con ingenieros adjuntos.
Listen · storyflo · A.I.
inteligencia artificial · las 6 historias del día · 24 de julio
0:00-2:14
Pick your daily storyteller
Subscribe to match with Theo, Jessica, Chloe, Mason, Brock — your voice, every brief.
inteligencia artificial · las 6 historias del d... · Storyflo
culture
Audio pre-rendered by Storyflo · cached + delivered from the edge
OpenAI Presence vende agentes de IA empresariales con ingenieros adjuntos
El nuevo Presence de OpenAI no es un producto que se pueda ordenar con un clic; es un compromiso gestionado donde sus Forward‑Deployed Engineers (y algunos integradores socios) implementan un agente de IA personalizado para una única tarea empresarial—piense en manejar una disputa de facturación o un ticket de TI. El agente solo recibe los datos y el acceso al sistema que necesita, y el cliente escribe las reglas que determinan cuándo puede actuar, cuándo debe pausar para obtener aprobación y cuándo interviene un humano. Después del lanzamiento, Codex monitorea las sesiones, señala anomalías y sugiere ajustes que el equipo del cliente puede probar antes de desplegar.
OpenAI describe un flujo de trabajo de seis etapas: definir el resultado, realizar revisiones de seguridad y legales, simular, prueba de aceptación, despliegue por etapas y luego iterar después del lanzamiento. Las salvaguardas y los caminos de escalamiento están incorporados, y cada interacción se registra para auditoría. El modelo en sí no es fijo; se configura por flujo de trabajo y puede evolucionar, lo que implica que los contratos deben especificar a qué versión se “sujeta” el agente.
Dado que el servicio depende de ingenieros incrustados en el entorno del cliente, la disponibilidad es limitada y el precio se mantiene privado. Los primeros pilotos con BBVA, SoftBank e IAG aún están en fases de diseño, no en despliegues a gran escala, por lo que la verdadera prueba será cómo la solución gestionada escala cuando la capacidad de consultoría se agote.
Evaluación de alucinaciones de modelos de lenguaje con GraphEval
Convertir los principios clave y las etapas metodológicas de GraphEval en un escenario práctico simulado para comprender mejor su utilidad y sus principales implicaciones en la comprensión y combate de las alucinaciones de LLM.
Kimi K3 deja atrás a los modelos estadounidenses de vanguardia por un amplio margen en exploits cibernéticos, y la destilación podría explicar el porqué
Acabo de ver la última prueba de Kimi K3 de Moonshot AI y pensé que querrías los detalles. El British AI Security Institute se asoció con el U.S. Center for AI Standards and Innovation para lanzar una serie de tareas ofensivas de ciberseguridad a Kimi K3. En ExploitBench, que mide qué tan bien un modelo puede generar o reconocer código de exploit, Kimi K3 obtuvo alrededor del 32 por ciento, mientras que los principales modelos estadounidenses rondaban el 76 por ciento. Aún más llamativo, sus capas de seguridad no impidieron que el modelo construya o simule ataques.
Lo curioso es que Kimi K3 sigue obteniendo puntuaciones sólidas en los habituales benchmarks de lenguaje, por lo que la caída es específica del ámbito de ciberseguridad. Los investigadores sospechan que la causa podría ser la “destilación”, esencialmente una copia simplificada de los modelos de Anthropic que perdió algunas de las defensas matizadas incorporadas en el original. Si la destilación eliminó esas redes de seguridad, podría explicar por qué el modelo se muestra fuerte en tareas generales pero falla cuando se le lleva al territorio de exploits.
El modo de voz de Claude ahora funciona en los modelos más capaces de Anthropic en todas las plataformas
Las conversaciones de voz ahora se ejecutan en los modelos más potentes Opus y Sonnet con acceso a Gmail, Google Calendar y Slack. Claude es actualmente el único asistente de IA que puede redactar y enviar correos electrónicos directamente por voz, lo que le brinda una ventaja sobre OpenAI y Google, cuyos resultados de voz todavía suenan más naturales.
El artículo Claude's voice mode now runs on Anthropic's most capable models across all platforms apareció primero en The Decoder.
Las ventanas de contexto olvidan lo que importa — Construí un motor de decaimiento reforzado por uso para la memoria de agentes de IA
He estado pensando en cómo los LLM solo conservan los fragmentos más recientes en su ventana de contexto, incluso cuando los hechos más antiguos son los que realmente necesitas. El autor tomó la clásica curva de olvido de Ebbinghaus y la convirtió en un motor de decaimiento reforzado por uso, de modo que los recuerdos se desvanecen a menos que se recuperen repetidamente.
En lugar de una ventana deslizante plana, el sistema etiqueta cada pieza de información con un temporizador de decaimiento que se reinicia cada vez que el agente la referencia. Cuando el temporizador expira, los datos desaparecen, dejando espacio para contexto más nuevo pero aún relevante. El truco es que la tasa de decaimiento se adapta según la frecuencia de acceso al recuerdo, de modo que los hechos más útiles permanecen más tiempo.
En la práctica, lo integraron en un agente de IA sencillo y ejecutaron algunas tareas de referencia. El agente mantuvo los detalles correctos por más tiempo, lo que redujo la cantidad de indicaciones necesarias y disminuyó las alucinaciones. Es una forma ingeniosa de permitir que el modelo “olvide” de manera inteligente en lugar de solo por recencia.
Ingeniería de bucle para generación RAG: una cascada de LLM desde un modelo local económico hasta un modelo insignia alojado
Enterprise Document Intelligence [Vol.1 #8quater] - Dos enfoques sobre la cascada, costo y un bucle de validación, respaldados por un estudio real de veinte modelos locales frente a una bandera alojada
El artículo Loop Engineering for RAG Generation: An LLM Cascade from a Cheap Local Model Up to a Hosted Flagship apareció primero en Towards Data Science.