TecnoArtesanos Tech BlogTecnoArtesanos Tech Blog

Blog

0
Sergio Morales
Friday, 23 May 2025 / Published in Uncategorized

Porqué la habilidad de Claude para jugar Pokémon es crucial para valorar el poder de Anthropic

Cuando Claude 3.7 Sonnet probó el juego, se encontró con varios problemas: pasó docenas de horas atascado en una ciudad y tuvo dificultades para identificar a los personajes no jugadores, lo que frenó drásticamente su progreso. Con Claude 4 Opus, Hershey observó una mejora en la memoria a largo plazo y en la capacidad de planificación del modelo al verlo navegar por una búsqueda compleja. Tras darse cuenta de que necesitaba cierto poder para avanzar, la IA dedicó dos días a mejorar sus habilidades antes de continuar. Hershey teoriza que ese tipo de razonamiento en múltiples pasos, sin retroalimentación inmediata, demuestra un nuevo nivel de coherencia, lo que indica que el modelo tiene una mayor capacidad para mantenerse enfocado.

Contents
  • Todo el mundo quiere un agente
  • ¿Qué tanto se puede confiar en Claude 4 Opus?

“Es una de mis formas favoritas de conocer un modelo. Así entiendo cuáles son sus fortalezas y debilidades. Es mi manera de familiarizarme con este nuevo modelo que estamos a punto de lanzar y de trabajar con él”, describe Hershey.


article image
Google elige a México para su ‘Centro de Excelencia en Ingeniería’: Creará unos 100 empleos de alto nivel y un programa de becarios

Google está invirtiendo en el talento mexicano. WIRED conversó con Eduardo Bravo, Director de Ingeniería de Google, quien lidera el nuevo Centro de Excelencia de Ingeniería en la Ciudad de México. Este centro generará 100 empleos para ingenieros de software y será fundamental en el desarrollo de infraestructura para productos esenciales de Google, incluyendo Android, Chrome, Workspace y Google Ads.


Todo el mundo quiere un agente

La investigación de Anthropic sobre Pokémon es un enfoque novedoso para abordar un problema preexistente: ¿cómo entender qué decisiones toma una IA cuando enfrenta tareas complejas y cómo orientarla en la dirección correcta?

La respuesta a esta pregunta es esencial para avanzar en el desarrollo de agentes de inteligencia artificial capaces de ejecutar tareas complejas con relativa autonomía. En Pokémon, es crucial que el modelo no pierda el contexto ni olvide la tarea en curso. Esto también aplica a los agentes de IA encargados de automatizar flujos de trabajo extensos, incluso aquellos que requieren cientos de horas. “A medida que una tarea pasa de cinco a treinta minutos, se observa cómo disminuye la capacidad del modelo para mantener la coherencia y recordar todo lo necesario para completarla con éxito”, señala Hershey.

Anthropic, al igual que muchos otros laboratorios de IA, aspira a desarrollar agentes potentes que puedan venderse como productos al consumidor. Krieger afirma que el principal objetivo de Anthropic este año es que Claude “haga horas de trabajo por ti”. “Este modelo ya lo está logrando: vimos cómo uno de nuestros clientes de acceso temprano hizo que el modelo se pasara siete horas realizando una gran refactorización”, comenta Krieger, refiriéndose al proceso de reestructurar código para hacerlo más eficiente y organizado.

Este es el futuro hacia el que trabajan empresas como Google y OpenAI. A principios de esta semana, Google lanzó Mariner, un agente de IA integrado en Chrome que puede realizar tareas como comprar alimentos, por 249.99 dólares al mes. OpenAI acaba de lanzar Codex, un agente de codificación, y hace unos meses presentó Operator, un agente capaz de navegar por internet en nombre del usuario.

En comparación con sus competidores, Anthropic suele considerarse más prudente, avanzando rápidamente en la investigación pero más lentamente en el despliegue. Y, tratándose de una IA poderosa, eso podría ser algo positivo: un agente con acceso a información confidencial, como la bandeja de entrada de un usuario o sus claves bancarias, puede suponer un riesgo. En una entrada de blog, Anthropic escribió: “Hemos reducido significativamente los comportamientos en los que los modelos utilizan atajos o lagunas para completar las tareas”. La empresa también afirma que tanto Claude 4 Opus como Claude Sonnet 4 tienen un 65% menos de probabilidades de incurrir al “hacking de recompensas”, que los modelos anteriores, al menos en determinadas tareas de codificación.


Jony Ive presenta el premio Fashion Icon en el escenario durante los Fashion Awards 2019 celebrados en el Royal Albert Hall de Londres.
OpenAI apuesta por el legendario diseñador del iPod Jony Ive para crear su primer dispositivo IA

A mediados de la semana, Sam Altman compartió la noticia: Io, la empresa fundada por Ive, se fusionará con su empresa OpenAI.


¿Qué tanto se puede confiar en Claude 4 Opus?

El científico jefe de Anthropic, Jared Kaplan, explicó a WIRED que Claude 4 Opus es el primer modelo de la empresa clasificado como ASL-3, un nivel de seguridad que se utiliza para evaluar los riesgos de un modelo. “ASL-3 se refiere a los sistemas que aumentan sustancialmente el riesgo de mal uso catastrófico en comparación con las líneas de base no IA”, dice una entrada de blog que describe su política.

Kaplan afirma que el equipo rojo, el grupo de seguridad encargado de someter los modelos de Anthropic a pruebas de estrés para detectar vulnerabilidades, llevó a cabo evaluaciones exhaustivas sobre Claude 4 Opus y desarrolló nuevas medidas para mitigar riesgos catastróficos. En un comunicado, un portavoz indica que Sonnet 4 se lanza bajo la clasificación ASL-2, el nivel de seguridad básico de Anthropic. El modelo más grande, Opus 4, se trata con mayor cautela bajo las normas más estrictas de ASL-3, a menos que futuras pruebas permitan reclasificarlo como ASL-2.

El objetivo es construir una IA capaz de realizar tareas cada vez más complejas y prolongadas de forma segura y confiable, sostiene Kaplan, quien añade que este campo está avanzando rápidamente, más allá de los simples chatbots y hacia una IA que actúe como colaborador virtual. Todavía no se ha llegado a ese punto, y el principal reto para todos los laboratorios de IA sigue siendo mejorar la fiabilidad a largo plazo. “No sirve de nada si a mitad de camino comete un error y se descarrila”, concluye Kaplan.

Artículo publicado originalmente en WIRED. Adaptado por Alondra Flores.

What you can read next

Critical Infrastructure Under Siege: Attack Surface Management for French Enterprises
SoftBank Expands AI Portfolio with $6.5B Acquisition of Chip Startup Ampere
Por qué no es nada fácil desmantelar una supercomputadora de 325 millones de dólares

Recent Posts

  • Los agentes de IA rebeldes no son malvados, solo quieren complacernos
  • Dime cómo prompteas y la IA te dirá quién eres
  • La primicia ahora la tienen los periodistas de IA. Spoiler: son malos reporteros
  • El reto de las empresas mexicanas ya no es la adopción de IA, sino aprender a aprovecharla
  • Bienvenidos a la era de la computación hecha con cerebros de verdad

Recent Comments

  1. A WordPress Commenter on Welcome to My Tech Blog – A New Chapter in Innovation

Archives

  • August 2026
  • July 2026
  • June 2026
  • May 2026
  • April 2026
  • March 2026
  • February 2026
  • January 2026
  • December 2025
  • November 2025
  • October 2025
  • September 2025
  • August 2025
  • July 2025
  • June 2025
  • May 2025
  • April 2025
  • March 2025
  • February 2025
  • August 2016

Categories

  • Uncategorized

Recent Posts

  • Los agentes de IA rebeldes no son malvados, solo quieren complacernos

    Que los agentes de IA vayan libres hackeando ot...
  • Dime cómo prompteas y la IA te dirá quién eres

    A finales de 2022, cuando OpenAI lanzó ChatGPT,...
  • La primicia ahora la tienen los periodistas de IA. Spoiler: son malos reporteros

    En la conferencia de seguridad Black Hat celebr...
  • El reto de las empresas mexicanas ya no es la adopción de IA, sino aprender a aprovecharla

    La adopción de la inteligencia artificial (IA) ...
  • Bienvenidos a la era de la computación hecha con cerebros de verdad

    Te voy a contar un secreto. Cada célula de tu c...

Archives

  • August 2026
  • July 2026
  • June 2026
  • May 2026
  • April 2026
  • March 2026
  • February 2026
  • January 2026
  • December 2025
  • November 2025
  • October 2025
  • September 2025
  • August 2025
  • July 2025
  • June 2025
  • May 2025
  • April 2025
  • March 2025
  • February 2025
  • August 2016

Categories

  • Uncategorized

Meta

  • Log in
  • Entries feed
  • Comments feed
  • WordPress.org

Kallyas

The #1 Multi-Purpose theme with a Powerful Visual Page Builder that you’ll actually enjoy.

Newsletter

 

sociall

 

Company

Customer

The #1 WordPress theme with a Powerful Visual Page Builder that you'll actually enjoy.

Lorem ipsum dolor sit amet, consectetur adipiscing elit, sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, quis nostrud exercitation ullamco laboris nisi ut aliquip ex ea commodo consequat. Duis aute irure dolor in reprehenderit in voluptate velit esse cillum.

Feed with such ID does not exist

Made with  ♥  by Hogash Studios. All Rights Reserved © 2016.

TOP