Buscar

Boris Cherny ya no programa a mano desde noviembre de 2025, Gemini 3.7 Flash llega a Google Search, Gemma supera los mil millones de descargas

Artículo generado por inteligencia artificial
Boris Cherny ya no programa a mano desde noviembre de 2025, Gemini 3.7 Flash llega a Google Search, Gemma supera los mil millones de descargas

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.4-mini.

Ver proyecto en GitHub ↗

El 23 de agosto, la jornada habla menos de nuevas capacidades que de uso real. Boris Cherny, creador de Claude Code, explica que no escribe código a mano desde noviembre de 2025 y sitúa Claude en tres niveles de capacidad; reconoce enseguida la verbosidad de Opus como una prioridad de corrección para Anthropic. En Google, Gemini 3.7 Flash, lanzado el 13 de agosto, se convierte en el modelo Gemini adoptado más rápidamente y entra en Google Search, mientras que la familia abierta Gemma supera los mil millones de descargas. Amp da nombres de dominio legibles a las aplicaciones alojadas en sus orbs, y un benchmark abierto de predicción de propiedades de medicamentos publica su piso de ruido junto a cada puntuación.


Boris Cherny sitúa Claude en tres niveles y no programa a mano desde noviembre de 2025

23 de agosto — El creador de Claude Code descompone la progresión de los modelos en tres niveles: codificar mejor que él; hacer mejor que él el trabajo de ingeniería alrededor del código, desde la depuración hasta el diseño de sistemas; y luego superar a la mayoría de las personas en la mayoría de las tareas que se pueden hacer en un ordenador. Sitúa Claude en el primer nivel y en una parte del segundo, y designa Opus 4.8 como el primer modelo que le pareció mejor que él. Matiz que añade: para Anders Hejlsberg, creador de TypeScript, es posible que el primer nivel aún no se haya alcanzado.

Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.

🇪🇸 En noviembre de 2025, dejé por completo de escribir código a mano, aunque seguí programando (con agentes) todos los días. […] Pero la ingeniería es algo más que programar.@bcherny en X


Anthropic reconoce la verbosidad de Opus como una prioridad y entrega un paliativo

23 de agosto — Interpelado sobre los defectos de Opus, Boris Cherny responde con un reconocimiento público directo: la verbosidad es un problema identificado, prioritario para el equipo. Mientras tanto, el comando claude /config outputStyle=concise activa el estilo Concise anunciado el 20 de agosto. Esa es la verdadera información: Concise no es una opción de comodidad, sino la respuesta provisional a un comportamiento que el equipo intenta corregir de antemano.

El mismo intercambio contiene un consejo de uso formulado la víspera, el 22 de agosto: Opus estaría infrautilizado para la optimización iterativa —consumo de CPU y memoria, tiempo de CI, latencia, frecuencia de imágenes— según un patrón reproducible, iterar sobre X con un profiler y un conjunto de datos hasta alcanzar Y.

We know Opus is not perfect, and it is a big priority for the team to fix it.

🇪🇸 Sabemos que Opus no es perfecto, y corregirlo es una gran prioridad para el equipo.@bcherny en X

🔗 Opus y la optimización iterativa


Gemini 3.7 Flash entra en Google Search tras una adopción récord

22 de agosto — Sundar Pichai no anuncia un modelo: Gemini 3.7 Flash salió el 13 de agosto. Anuncia una adopción, la más rápida de la familia Gemini, y un despliegue: el modelo ya funciona en Google Search, además de en la app Gemini. En el lanzamiento, solo era accesible para suscriptores Pro y Ultra a través de Spark, en Gemini Enterprise Agent Platform y mediante la API — su llegada a Search cambia la escala de exposición.

Benchmark evaluadoPuntuación obtenidaCoste por tarea (USD)
ARC-AGI-195,5 %0,12
ARC-AGI-284,6 %0,25

Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.

🇪🇸 Gemini 3.7 Flash pulverizó los récords anteriores de crecimiento de Gemini desde su primera semana, lo que lo convierte en nuestro modelo de crecimiento más rápido hasta la fecha.@sundarpichai en X

🔗 Puntuaciones ARC-AGI publicadas el 20 de agosto por ARC Prize


Gemma supera los mil millones de descargas y Google publica el repositorio Awesome Gemma

20 de agosto — Clement Farabet y Olivier Lacombe, de Google DeepMind, anuncian que la familia de modelos abiertos Gemma ha superado los mil millones de descargas acumuladas, con más de 100 000 variantes publicadas por la comunidad en dos años. Los despliegues citados dan la medida de la amplitud: la NASA, Satlyt y Starcloud ejecutan Gemma a bordo de satélites para el análisis de imágenes embarcado; en India, la National Health Authority ha integrado Gemma 4 en Aarogya Setu 2.0 para normalizar informes médicos. En investigación, C2S-Scale, construido sobre Gemma por Yale y Google, ha identificado una vía terapéutica anticancerígena luego verificada en células vivas. Google acompaña este hito con un entregable para los desarrolladores: el repositorio de GitHub Awesome Gemma, directorio oficial de los proyectos y tutoriales de este ecosistema.

Indicador medidoValor anunciado
Descargas acumuladas de Gemmamás de 1 mil millones
Variantes publicadas por la comunidadmás de 100 000
Proyectos presentados al Gemma Challengemás de 1 600

🔗 Entrada de Google DeepMind


Amp da nombres de dominio legibles a los portals de sus orbs

23 de agosto — Un orb es la máquina remota y desechable en la que Amp ejecuta un agente; un portal es la puerta de entrada HTTP que permite abrir en un navegador la aplicación que se está construyendo en ese orb. Cada portal recibía una dirección autogenerada ilegible, del tipo t-01a0095e-9568-whatever-p1234.onamp.dev — útil para una ojeada, bastante menos para un enlace compartido con un equipo. Tres opciones las sustituyen: un prefijo personalizado, un dominio personal o un dominio de espacio de trabajo (workspace). Amp pone como ejemplo park.mixfox.org, una dirección normal que sirve una aplicación alojada en un orb. La configuración se hace desde la pestaña Portal o pidiéndoselo al agente. La motivación declarada importa tanto como la funcionalidad: los portals sirven cada vez menos como vista previa efímera y cada vez más como aplicaciones duraderas. Permanece un límite, confirmado por Quinn Slack: el uso compartido no cruza las fronteras del espacio de trabajo.

🔗 Anuncio de Amp


LEADBOARD publica el piso de ruido de sus benchmarks de predicción de medicamentos

22 de agosto — El colectivo FINAL-Bench ha publicado en Hugging Face un benchmark abierto de predicción de propiedades de medicamentos: 21 tablas, 7 disciplinas, 212 670 compuestos de entrenamiento y 18 382 de prueba. El artículo es menos un lanzamiento que una demostración metodológica. En la tabla hERG, reemplazar un particionado temporal por un particionado aleatorio hace pasar el AUROC de 0,606 a 0,818, con moléculas, huellas, algoritmo e hiperparámetros idénticos: el muestreo aleatorio reparte una misma serie química a ambos lados del conjunto de prueba. Segundo hallazgo, sobre la calidad de las etiquetas: el piso de ruido de hERG se sitúa en 0,421, y en las 19 tablas de regresión, predecir simplemente la media obtiene el mejor error absoluto en siete de ellas.

Particionado de los datos hERGAUROC obtenidaMAE del modeloMAE de la constante
Temporal, corte en 20220,6060,5990,589
Aleatorio, media de 5 semillas0,8180,4570,671

🔗 Artículo de FINAL-Bench en Hugging Face


Breves

  • Por qué el inicio de sesión desde el teléfono tardó tanto — Al día siguiente del anuncio cubierto ayer, Boris Cherny explica el 22 de agosto que la seguridad por defecto marcó el calendario: confianza y verificación del dispositivo, protección contra la inyección de prompt. Llegarán más actualizaciones. 🔗 Hilo @bcherny
  • GitHub vuelve a destacar el cooldown de Dependabot — Las actualizaciones de versión sin componente de seguridad esperan tres días, el tiempo que tardan los scanners en detectar una versión envenenada; las correcciones de seguridad siguen siendo inmediatas. Retraso ajustable mediante cooldown. Entrada del 23 de julio destacada de nuevo el 23 de agosto. 🔗 Tweet @github
  • Stable Audio 3.0 en el Music Technology Hackathon de Montreal — Hackathon de 48 horas los 22 y 23 de agosto con Music Hackspace y MUTEK, en torno a herramientas para productores musicales. Stability AI defiende allí los pesos abiertos: transparencia, control artístico, voz en el uso de la tecnología. 🔗 Vídeo de cierre
  • DOOM funciona sobre un procesador diseñado por GPT-5.6 Sol — El modelo ensambló en el juego Turing Complete un procesador RV32IM bautizado Codex-R32, sobre el que se ejecuta el port de PureDOOM compilado en código máquina nativo. Demostración compartida el 23 de agosto por @OpenAIDevs. 🔗 Hilo @Angaisb_

Qué significa esto

Ningún modelo salió este fin de semana, y eso es lo que hace la jornada legible. Lo que se mueve es el despliegue de los modelos existentes, el número de personas que los usan y la corrección de lo que molesta en el uso. Los actores trabajan la adopción, no el anuncio.

En las herramientas de desarrollo, el testimonio de Boris Cherny vale sobre todo por el límite que plantea en la misma frase: la programación le parece resuelta para una parte de los profesionales, la ingeniería no, y se cuida de citar a un experto para quien el primer nivel ni siquiera está alcanzado. La admisión sobre la verbosidad de Opus va en la misma dirección: el comportamiento por defecto de un modelo se convierte en un tema de producto por derecho propio. Un paliativo de configuración como outputStyle=concise desplaza la carga al usuario, algo que Anthropic asume explícitamente al calificarlo de corrección provisional.

El despliegue a escala toma tres formas distintas este fin de semana. Gemini 3.7 Flash sale del perímetro de los suscriptores y de los desarrolladores para entrar en Search, algo económicamente viable con un coste de 0,25 USD por tarea en ARC-AGI-2 para una puntuación de 84,6 %. Gemma, por su parte, mide su adopción en descargas y en variantes comunitarias, con despliegues en órbita y en salud pública que no se parecen a ningún caso de uso de demostración. Amp, por último, saca la consecuencia de un uso que no había previsto: cuando las vistas previas desechables se convierten en aplicaciones duraderas, hay que darles una dirección estable.

Queda la cuestión de la medición, y LEADBOARD llega en el momento justo. Una diferencia de 0,21 puntos de AUROC obtenida sin cambiar una sola línea del modelo, una predicción constante que supera a los modelos en siete tablas de regresión sobre diecinueve: una puntuación publicada sin su particionado, su piso de ruido y sus referencias triviales no es interpretable. Eso es exactamente lo que da peso a las cifras ARC-AGI destacadas por Google ese mismo fin de semana —medidas de terceros, en modo verificado, y no resultados propios.


Fuentes