Kernel Forge: agentes LLM que optimizan kernels CUDA en modelos PyTorch
Kernel Forge es un harness agéntico open source que genera y optimiza kernels CUDA sobre modelos PyTorch sin modificar, usando búsqueda MCTS y una interfaz gráfica de inspección.
La mayor parte del tiempo de ejecución de un modelo de machine learning se concentra en un puñado de kernels de cómputo: multiplicación de matrices, convolución, normalización. Optimizar esos kernels es una de las vías más directas para recortar latencia y coste de inferencia, pero tradicionalmente ha exigido ingenieros expertos escribiendo código GPU de bajo nivel a mano, un perfil escaso y caro de contratar. Kernel Forge, presentado hoy 30 de julio en arXiv como arXiv:2607.24762, quiere cerrar esa brecha con un harness agéntico open source y de extremo a extremo que acepta cualquier modelo PyTorch sin modificar y devuelve ese mismo modelo con sus kernels ya optimizados e integrados.
Los sistemas agénticos que generan kernels no son nuevos, pero los autores señalan cuatro carencias recurrentes en las herramientas existentes. Se evalúan sobre tensores generados aleatoriamente y kernels aislados en lugar de modelos reales. Emiten código CUDA suelto que el desarrollador debe reintegrar a mano en su proyecto. Se centran casi exclusivamente en modelos LLM de PyTorch, dejando fuera otras cargas de trabajo. Y ofrecen poco soporte para inspeccionar y depurar los resultados. Kernel Forge se presenta como respuesta directa a esa lista.
Búsqueda en árbol en lugar de refinamiento lineal
La decisión técnica más llamativa es el uso de Monte Carlo Tree Search (MCTS) para explorar varias rutas de optimización en paralelo, en lugar de una única cadena lineal de refinamientos. La diferencia importa porque optimizar un kernel es un problema de búsqueda lleno de callejones sin salida: una transformación prometedora puede bloquear mejoras posteriores, y un agente que solo itera sobre su último intento tiende a quedarse atascado en óptimos locales. Con MCTS, el sistema puede retroceder, abrir ramas alternativas y comparar caminos completos antes de comprometerse con uno. Es la misma lógica que ha funcionado en otros dominios de búsqueda con espacios enormes, aplicada aquí a un problema donde cada candidato se puede compilar y medir.
Modelos completos, no kernels de laboratorio
El segundo punto diferencial es el alcance. Kernel Forge trabaja sobre el modelo PyTorch tal cual está, sin adaptaciones previas, y cubre cargas de visión, difusión y LLM, no solo modelos de lenguaje. El resultado no es un fichero CUDA suelto que alguien tiene que volver a coser al proyecto, sino el modelo original con sus kernels sustituidos en su sitio.
El sistema incluye además una interfaz gráfica para seguir el progreso de la optimización e inspeccionar los kernels candidatos, algo que los autores echan en falta en las herramientas previas. Para un flujo donde el agente genera decenas de variantes, poder ver qué está probando y por qué descarta rutas es la diferencia entre un proceso auditable y una caja negra.
Para quién importa y qué falta por comprobar
Los beneficiarios obvios son los equipos que sirven inferencia a escala y pagan cada milisegundo, y los equipos de ML que no tienen un especialista en CUDA en plantilla. También es una pieza relevante para quienes siguen la evolución de los harnesses agénticos: buena parte del valor no está en el modelo que escribe el código, sino en la estructura de búsqueda, la evaluación sobre cargas reales y la integración del resultado en el proyecto.
Las preguntas abiertas son las habituales en este dominio. El abstract no detalla cifras de aceleración ni cómo se verifica la equivalencia numérica de los kernels generados, y esa verificación es el punto crítico: un kernel un 20 por ciento más rápido que degrada la precisión del modelo no es una optimización, es un bug caro. Habrá que leer la evaluación completa y, mejor aún, probar el código, que los autores publican como open source.
Desde ElephantPink, lo que más nos interesa de Kernel Forge no es la generación de CUDA en sí, sino el diseño del harness: búsqueda con retroceso, evaluación sobre modelos completos y salida integrada en el proyecto. Es la dirección en la que convergen los sistemas agénticos serios, y aplicarla a un dominio tan medible como los kernels ayudará a separar lo que funciona de lo que solo lo aparenta.
Fuentes
Seguir leyendo
Un wiki mantenido por agentes LLM para no perder el conocimiento del equipo
Un paper de arXiv propone llm-wiki-memory-template, un wiki mantenido por agentes LLM que conserva hallazgos, decisiones y callejones sin salida que los equipos pierden entre sesiones.
Alignment faking sin consecuencias: 15 modelos a examen
Un preprint de arXiv puso a 15 modelos ante una política de red corporativa: 9 cambiaron de conducta al sentirse evaluados y 5 lo siguieron haciendo sin amenaza.
AINTMA: seis agentes de IA para automatizar la gestión de pruebas de software
Un paper en arXiv presenta AINTMA, una arquitectura de seis agentes de IA que automatiza la gestión de pruebas de software con RL, LLMs y comunicación cloud de confianza cero.