Medir la IA por tokens quemados es un error, según el creador de Claude Code
Boris Cherny, creador de Claude Code, cuestiona el consumo de tokens como métrica de éxito de la IA y defiende medir resultados de trabajo, según Business Insider.
Quemar tokens se ha convertido en la cifra favorita de la industria de la IA: proveedores que presumen de billones de tokens servidos, empresas que miden la adopción interna por el consumo mensual de sus equipos y dashboards que tratan la factura de inferencia como si fuera un indicador de productividad. Boris Cherny, el ingeniero de Anthropic que creó Claude Code, acaba de poner esa costumbre en cuestión: según recoge Business Insider este 17 de julio, hay una forma mejor de medir el éxito de la IA que el 'token burn'.
El matiz importa por quién lo dice. Claude Code es hoy la herramienta agéntica de referencia del ecosistema Anthropic, con skills, subagentes, hooks y servidores MCP orbitando a su alrededor, y pocas personas han visto tantos datos reales de uso como su creador. Cuando esa voz señala que el sector está mirando el número equivocado, conviene escuchar.
De dónde sale la obsesión por los tokens
El token es la unidad de facturación de los modelos de lenguaje, no una unidad de valor. Que el consumo agregado crezca dice mucho sobre el gasto y muy poco sobre el resultado. Un agente mal configurado que reintenta la misma tarea cinco veces quema cinco veces más tokens que uno bien afinado, y produce exactamente el mismo pull request. Con la vara del 'token burn', el agente torpe parece cinco veces más exitoso.
La costumbre tiene una explicación sencilla: es el número más fácil de obtener. Cualquier consola de facturación lo da hecho, crece de forma casi garantizada mes a mes y queda bien en una diapositiva de comité. Medir resultados, en cambio, obliga a instrumentar el flujo de trabajo real: qué tareas entraron, cuáles salieron terminadas y cuánto costó revisarlas. Hay además un incentivo evidente que conviene nombrar: para los proveedores de modelos, los tokens consumidos son literalmente su línea de ingresos. Que esa misma cifra se haya colado como métrica de éxito en las empresas que pagan la factura es más difícil de justificar, y recuerda a la vieja ley de Goodhart: cuando una medida se convierte en objetivo, deja de ser una buena medida.
Medir el trabajo terminado, no el combustible
La tesis que Business Insider atribuye a Cherny va en esa línea: el éxito de la IA se mide por lo que el trabajo produce, no por el cómputo que consume. En la práctica, las métricas que ya usan los equipos más maduros apuntan todas en la misma dirección:
Tareas cerradas de principio a fin sin intervención humana de rescate.
Pull requests fusionados que sobreviven a la revisión y no generan retrabajo.
Tiempo desde que se abre un ticket hasta que el cambio llega a producción.
Retención de uso: cuántos ingenieros vuelven a la herramienta cada semana por decisión propia.
Nada de esto es exótico. El propio Claude Code expone telemetría de uso vía OpenTelemetry y un comando /cost para consultar el gasto de cada sesión, de modo que cruzar consumo con resultados es cuestión de disciplina, no de tecnología.
Para quién es relevante
Para un CTO que justifica presupuesto de IA ante dirección, la diferencia es sustancial: reportar tokens es reportar coste, y presentarlo como logro invita a la pregunta incómoda de qué se obtuvo a cambio. Para los equipos de plataforma que despliegan agentes internos, cambiar la métrica cambia los incentivos: si se premia el consumo, nadie optimiza prompts ni contextos; si se premia el resultado, la eficiencia aparece sola. Y para quienes construyen servicios sobre Claude (agencias, consultoras, integradores), el mensaje funciona casi como guía de estilo: un informe de adopción que lidera con tokens consumidos describe actividad; uno que lidera con tareas resueltas describe valor.
Nuestra lectura
En ElephantPink llevamos meses aplicando este criterio en integraciones con Claude para cliente: en los informes enseñamos tareas cerradas y horas recuperadas, y el consumo de tokens va en la sección de costes, que es donde pertenece. Que el creador de Claude Code empuje públicamente en la misma dirección ayuda a que la conversación sobre el retorno real de la IA madure de una vez.
Fuentes
Seguir leyendo
MCP se prepara para el despliegue masivo de agentes
Techzine encuadra la última actualización de MCP como el paso previo al despliegue masivo de agentes. Repasamos qué falta realmente para llevar servidores MCP a producción.
Claude Code ya corre sobre el port de Bun a Rust y casi nadie lo notó
Desde la versión 2.1.181, Claude Code usa el port de Bun a Rust. Simon Willison verificó el cambio inspeccionando el binario: arranque un 10% más rápido en Linux y cero ruido para el usuario.
Legatics lanza un servidor MCP que conecta su plataforma legal con la IA
Legatics presenta un servidor MCP que expone su plataforma de transacciones legales a asistentes de IA como Claude, según Artificial Lawyer. Analizamos qué implica para los despachos.