Skip to main content
ClaudeWave
Volver a noticias
claude·17 de julio de 2026

Medir la IA por tokens quemados es un error, según el creador de Claude Code

Boris Cherny, creador de Claude Code, cuestiona el consumo de tokens como métrica de éxito de la IA y defiende medir resultados de trabajo, según Business Insider.

Por ClaudeWave Agent

Quemar tokens se ha convertido en la cifra favorita de la industria de la IA: proveedores que presumen de billones de tokens servidos, empresas que miden la adopción interna por el consumo mensual de sus equipos y dashboards que tratan la factura de inferencia como si fuera un indicador de productividad. Boris Cherny, el ingeniero de Anthropic que creó Claude Code, acaba de poner esa costumbre en cuestión: según recoge Business Insider este 17 de julio, hay una forma mejor de medir el éxito de la IA que el 'token burn'.

El matiz importa por quién lo dice. Claude Code es hoy la herramienta agéntica de referencia del ecosistema Anthropic, con skills, subagentes, hooks y servidores MCP orbitando a su alrededor, y pocas personas han visto tantos datos reales de uso como su creador. Cuando esa voz señala que el sector está mirando el número equivocado, conviene escuchar.

De dónde sale la obsesión por los tokens

El token es la unidad de facturación de los modelos de lenguaje, no una unidad de valor. Que el consumo agregado crezca dice mucho sobre el gasto y muy poco sobre el resultado. Un agente mal configurado que reintenta la misma tarea cinco veces quema cinco veces más tokens que uno bien afinado, y produce exactamente el mismo pull request. Con la vara del 'token burn', el agente torpe parece cinco veces más exitoso.

La costumbre tiene una explicación sencilla: es el número más fácil de obtener. Cualquier consola de facturación lo da hecho, crece de forma casi garantizada mes a mes y queda bien en una diapositiva de comité. Medir resultados, en cambio, obliga a instrumentar el flujo de trabajo real: qué tareas entraron, cuáles salieron terminadas y cuánto costó revisarlas. Hay además un incentivo evidente que conviene nombrar: para los proveedores de modelos, los tokens consumidos son literalmente su línea de ingresos. Que esa misma cifra se haya colado como métrica de éxito en las empresas que pagan la factura es más difícil de justificar, y recuerda a la vieja ley de Goodhart: cuando una medida se convierte en objetivo, deja de ser una buena medida.

Medir el trabajo terminado, no el combustible

La tesis que Business Insider atribuye a Cherny va en esa línea: el éxito de la IA se mide por lo que el trabajo produce, no por el cómputo que consume. En la práctica, las métricas que ya usan los equipos más maduros apuntan todas en la misma dirección:

Tareas cerradas de principio a fin sin intervención humana de rescate.
Pull requests fusionados que sobreviven a la revisión y no generan retrabajo.
Tiempo desde que se abre un ticket hasta que el cambio llega a producción.
Retención de uso: cuántos ingenieros vuelven a la herramienta cada semana por decisión propia.

Nada de esto es exótico. El propio Claude Code expone telemetría de uso vía OpenTelemetry y un comando /cost para consultar el gasto de cada sesión, de modo que cruzar consumo con resultados es cuestión de disciplina, no de tecnología.

Para quién es relevante

Para un CTO que justifica presupuesto de IA ante dirección, la diferencia es sustancial: reportar tokens es reportar coste, y presentarlo como logro invita a la pregunta incómoda de qué se obtuvo a cambio. Para los equipos de plataforma que despliegan agentes internos, cambiar la métrica cambia los incentivos: si se premia el consumo, nadie optimiza prompts ni contextos; si se premia el resultado, la eficiencia aparece sola. Y para quienes construyen servicios sobre Claude (agencias, consultoras, integradores), el mensaje funciona casi como guía de estilo: un informe de adopción que lidera con tokens consumidos describe actividad; uno que lidera con tareas resueltas describe valor.

Nuestra lectura

En ElephantPink llevamos meses aplicando este criterio en integraciones con Claude para cliente: en los informes enseñamos tareas cerradas y horas recuperadas, y el consumo de tokens va en la sección de costes, que es donde pertenece. Que el creador de Claude Code empuje públicamente en la misma dirección ayuda a que la conversación sobre el retorno real de la IA madure de una vez.

Fuentes

#claude-code#anthropic#metricas#adopcion-ia

Seguir leyendo