# Modelos de reserva para agentes de IA: como manter o agente em funcionamento quando um modelo falha

> Como funcionam os modelos de reserva para agentes de IA, que erros devem acionar uma alternativa, porque o modelo de reserva se comporta de forma diferente e como testá-lo antes de uma interrupção.

Last updated: 2026-09-28T14:00:00

Canonical URL: https://crevio.co/pt/blog/ai-agent-backup-models

*Última atualização: setembro de 2026. Páginas de estado, relatórios de incidentes e documentação verificados em 28 de setembro de 2026.*

**O modelo do seu agente vai falhar — e o modelo de reserva que configurou para o substituir não se vai comportar como o modelo com que fez os testes.** Em 28 de setembro de 2026, a página de estado da API da Claude indicava 99,52% de disponibilidade nos 90 dias anteriores. Parece quase perfeito, até fazer as contas: 0,48% de 90 dias equivale a cerca de 10 horas de serviço degradado ou indisponível num trimestre. Um modelo de reserva para agentes de IA permite que o seu agente continue a funcionar durante essas horas. Se for configurado sem cuidado, também pode fazer com que uma tarefa fique silenciosamente concluída apenas a meio, com um modelo que ninguém chegou a testar.

Este guia destina-se a proprietários e responsáveis operacionais de empresas que executam agentes segundo um calendário ou perante clientes. Explica o que pode falhar, que erros devem acionar uma mudança, como as principais ferramentas de routing lidam com o problema e como confirmar que a alternativa funciona antes de precisar dela.

- **Três falhas diferentes parecem iguais do lado de fora:** interrupções, limites de utilização e modelos retirados. Apenas algumas exigem um modelo de reserva
- **Tente novamente primeiro; mude depois.** Muitas falhas desaparecem após uma nova tentativa breve ou recorrendo a outro host que execute o mesmo modelo
- **Um modelo de reserva não é uma cópia pronta a usar.** Os modelos mais recentes rejeitam parâmetros aceites pelos mais antigos, o tool calling é diferente e a cache de prompts aquecida desaparece
- **As alternativas custam mais por passo do que seria de esperar,** porque começam com a cache fria
- **Uma alternativa não testada é apenas uma suposição.** Provoque uma falha de propósito, execute tarefas reais com o modelo de reserva e registe qual foi o modelo que respondeu

## O que é um modelo de reserva para agentes de IA

Um modelo de reserva para agentes de IA, muitas vezes chamado de LLM fallback, é um segundo modelo configurado antecipadamente para assumir o controlo quando o modelo principal do agente não consegue responder. A mudança costuma ser automática: um router ou gateway deteta o erro, envia o mesmo pedido para o modelo seguinte de uma lista e devolve a resposta como se nada tivesse acontecido.

É uma de quatro camadas de proteção e deve ser a terceira a que recorre, não a primeira:

| Camada | O que faz | Resolve | Muda o modelo? |
|---|---|---|---|
| **Nova tentativa** | Envia novamente o mesmo pedido após uma breve espera | Picos breves, timeouts ocasionais | Não |
| **Failover de host** | Envia o pedido para outro fornecedor que execute o mesmo modelo | Falha de um centro de dados ou host | Não |
| **Alternativa de modelo** | Envia o pedido para um modelo diferente | Interrupções totais, quotas esgotadas | Sim |
| **Migração planeada** | Transfere deliberadamente o agente para um modelo novo | Retiradas e descontinuações | Sim, permanentemente |

A ordem é importante, porque cada passo abaixo na tabela altera mais o comportamento do agente. Uma nova tentativa não muda nada. Um modelo diferente muda quase tudo, como veremos nas secções seguintes.

## Três formas de o modelo principal falhar

### Interrupções

Todos os principais fornecedores já tiveram interrupções, e os relatórios dos incidentes são públicos. Em 11 de dezembro de 2024, [todos os serviços da OpenAI apresentaram degradação significativa ou ficaram indisponíveis](https://status.openai.com/incidents/ctrsv3lwd797) entre as 15:16 e as 19:38, hora do Pacífico: 4 horas e 22 minutos a afetar o ChatGPT, a API e o Sora. A causa foi um novo serviço de telemetria que sobrecarregou o plano de controlo do Kubernetes da OpenAI. O erro só se manifestava em clusters grandes, pelo que não foi detetado nos testes.

![Página de estado da OpenAI relativa ao incidente de 11 de dezembro de 2024, marcada como Resolvido e Interrupção total, mostrando 9 componentes da API e 5 componentes do ChatGPT afetados, com barras de estado vermelhas e âmbar](https://crevio.co/vite/assets/openai-status-december-2024-incident-gqiohlkd.png)

Os incidentes mais curtos são muito mais comuns. Em 4 de março de 2026, a OpenAI comunicou [30 minutos de erros elevados na API](https://status.openai.com/incidents/01KJXQDJ6P1CG5YNXKZRY2H6RX/write-up), depois de um lote de alterações de capacidade atrasadas ter sido executado de uma só vez e retirado motores de inferência do serviço. A página de estado da Anthropic mostra o mesmo padrão: longos períodos a verde, pontuados por dias curtos a vermelho e âmbar.

![Página de estado da Claude a mostrar Todos os sistemas operacionais, com barras de disponibilidade de 90 dias para claude.ai a 99,43%, Claude Console a 99,95% e a API da Claude a 99,52%](https://crevio.co/vite/assets/claude-status-page-eal06oie.png)

Uma interrupção de 30 minutos quase não se nota quando está a conversar. Mas é muito importante quando uma tarefa agendada é executada nesse intervalo, porque não está ninguém presente para premir o botão de nova tentativa.

### Limites de utilização e erros 429

Um erro 429 significa que o fornecedor está operacional, mas não lhe pode prestar o serviço naquele momento. Na maioria dos casos, trata-se de um limite por minuto: a API da Anthropic utiliza um [token bucket que é reabastecido continuamente](https://platform.claude.com/docs/en/api/rate-limits) e envia um cabeçalho `retry-after` que indica quantos segundos deve esperar. Esperar esse período e tentar novamente com o mesmo modelo é a decisão certa.

No entanto, nem todos os erros 429 são temporários. Quando uma organização da Anthropic atinge o limite mensal de despesas, a API devolve um erro 429 **sem** um cabeçalho `retry-after`, e a documentação é clara: "As novas tentativas, incluindo as tentativas automáticas dos SDK, falham até o acesso ser reposto." O acesso é reposto no início do mês seguinte. Um agente que trate todos os erros 429 como "esperar e tentar novamente" ficará a tentar durante toda a noite contra um limite que pode não ser reposto durante semanas.

### Descontinuações e retiradas

Os modelos são retirados segundo um calendário, e um modelo retirado não degrada de forma gradual. A [política de descontinuação da Anthropic](https://platform.claude.com/docs/en/about-claude/model-deprecations) promete um aviso prévio de, pelo menos, 60 dias para os modelos disponibilizados publicamente e afirma que "os pedidos a modelos depois da data de retirada vão falhar". O Claude Opus 4.1 é um exemplo recente: os programadores foram notificados em 5 de junho de 2026 e o modelo foi retirado em 5 de agosto de 2026.

![Página da documentação da Claude Platform sobre a descontinuação de modelos, que explica as fases Ativo, Legado, Descontinuado e Retirado, com um aviso de que os modelos descontinuados tendem a ser menos fiáveis do que os ativos](https://crevio.co/vite/assets/claude-model-deprecations-gt44ujck.png)

A [página de descontinuações da OpenAI](https://developers.openai.com/api/docs/deprecations) dá aos modelos disponíveis de forma geral um aviso prévio de, pelo menos, seis meses, mas os modelos de pré-visualização "podem ser retirados com um aviso muito mais curto, como duas semanas". Em junho de 2026, anunciou que os snapshots GPT-5 e o3 seriam encerrados em 11 de dezembro de 2026. Um modelo de reserva não resolve uma retirada. Apenas a esconde até chegar a data de retirada do próprio modelo de reserva.

### A falha que nenhuma alternativa deteta

A falha mais dispendiosa nunca gera um erro. Em 2025, a Anthropic publicou [uma análise posterior a três erros de infraestrutura](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) que degradaram as respostas da Claude durante semanas. Na pior hora, 16% dos pedidos ao Sonnet 4 foram afetados por um deles. Uma das razões pelas quais demorou tanto tempo a ser descoberto foi que "a Claude recupera frequentemente bem de erros isolados", o que ocultou o problema.

Nenhuma cadeia de alternativas é acionada por uma resposta pior, porque uma resposta pior continua a devolver um 200. Isso é trabalho para [verificações pontuais do que o agente produz](/pt/blog/human-in-the-loop-ai-agents), não para o routing.

## Que falhas devem acionar um modelo de reserva para agentes de IA

Leia o erro antes de reagir. A mesma mensagem de que "o modelo falhou" pode significar esperar cinco segundos, mudar imediatamente ou corrigir o seu próprio pedido.

![Cinco falhas de fornecedores e a resposta certa para cada uma: esperar e tentar novamente num erro 429 com retry-after, mudar para o modelo de reserva num erro 429 sem retry-after, tentar novamente, mudar de host e depois mudar de modelo num erro 5xx ou timeout, corrigir o pedido num erro 400 e promover o modelo de substituição antes da data de retirada](https://crevio.co/vite/assets/which-failures-need-a-backup-model-mvzdhotu.svg)

Há duas linhas que merecem uma análise mais detalhada:

- **Erros 5xx, de sobrecarga e timeouts.** A [referência de erros](https://platform.claude.com/docs/en/api/errors) da Anthropic lista um `overloaded_error` para tráfego elevado entre todos os utilizadores, e os respetivos SDK já tentam novamente as falhas transitórias duas vezes, com recuo exponencial. Mais uma tentativa é razoável. Cinco são a forma de transformar uma falha de 30 segundos numa paragem de 10 minutos
- **Erros 400.** Um parâmetro inválido ou um pedido malformado também falha no modelo de reserva, muitas vezes pelo mesmo motivo. A exceção é um prompt demasiado longo: alguns routers enviam-no para um modelo com uma janela de contexto maior, o que constitui uma alternativa útil

## Como funcionam as cadeias de alternativas e o routing

Raramente terá de criar a lógica de alternativas por si. Uma camada de routing entre o agente e os fornecedores trata disso, e há quatro ferramentas comuns:

| Ferramenta | Como configura a alternativa | O que a aciona | Como vê qual foi o modelo que respondeu |
|---|---|---|---|
| **OpenRouter** | Um array `models` por ordem de prioridade | Indisponibilidade, limites de utilização, erros de comprimento de contexto, sinalizações de moderação | O campo `model` na resposta |
| **LiteLLM** | `fallbacks`, além de alternativas separadas para janela de contexto e política de conteúdo | Limites de utilização e erros do servidor, com períodos de arrefecimento após falhas repetidas | Registos do proxy e callbacks |
| **Vercel AI Gateway** | Um array `models` combinado com um `order` do fornecedor | Qualquer falha de todos os fornecedores de um modelo | Uma lista `modelAttempts` nos metadados do fornecedor |
| **Cloudflare AI Gateway** | Uma lista de passos no endpoint Universal | Erros e timeouts dos pedidos | O cabeçalho de resposta `cf-aig-step` |

Os [modelos de reserva do OpenRouter](https://openrouter.ai/docs/guides/routing/model-fallbacks) são os mais fáceis de visualizar: transmite uma lista de IDs de modelos e "se o primeiro modelo devolver um erro, o OpenRouter tenta automaticamente o modelo seguinte da lista". Os pedidos são cobrados ao preço do modelo que respondeu finalmente. Separadamente, o seu [routing de fornecedores](https://openrouter.ai/docs/guides/routing/provider-selection) trata do failover de host para o mesmo modelo. Por predefinição, dá preferência a fornecedores que "não tenham sofrido interrupções significativas nos últimos 30 segundos", e `allow_fallbacks` permanece ativo, a menos que o desative.

![Página da documentação do OpenRouter relativa aos Model Fallbacks, que explica que o parâmetro models tenta automaticamente outros modelos quando os fornecedores do modelo principal estão indisponíveis, limitados ou recusam responder](https://crevio.co/vite/assets/openrouter-model-fallbacks-docs-k3qy0sqx.png)

As [definições de fiabilidade do LiteLLM](https://docs.litellm.ai/docs/proxy/reliability) dividem o problema de forma mais detalhada. O `fallbacks` normal trata dos limites de utilização e dos erros do servidor, o `context_window_fallbacks` encaminha um prompt demasiado grande para um modelo maior e o `content_policy_fallbacks` deteta erros de política de conteúdo. O `allowed_fails` e o `cooldown_time` retiram temporariamente da rotação um modelo com falhas, para que um fornecedor com problemas não seja sobrecarregado a cada pedido.

Os [modelos de reserva do Vercel AI Gateway](https://vercel.com/docs/ai-gateway/models-and-providers/model-fallbacks) combinam as duas camadas: tenta todos os fornecedores permitidos para o modelo principal, passa depois para o modelo seguinte no array `models` e regista cada tentativa. As [alternativas do Cloudflare AI Gateway](https://developers.cloudflare.com/ai-gateway/configuration/fallbacks/) funcionam no endpoint Universal e indicam num cabeçalho a origem da resposta: `cf-aig-step: 0` significa que respondeu o modelo principal; `1` significa que respondeu a primeira alternativa.

Há uma ressalva que se aplica às quatro ferramentas. **O gateway também é uma dependência.** A própria rede da Cloudflare sofreu uma grande interrupção em [18 de novembro de 2025](https://blog.cloudflare.com/18-november-2025-outage/), entre as 11:20 e as 17:06 UTC, depois de um ficheiro de configuração inválido se ter propagado pela rede. Uma cadeia de alternativas protege-o contra a falha de um fornecedor de modelos. Não o consegue proteger da camada que executa a cadeia.

## Porque é que um modelo de reserva para agentes de IA se comporta de forma diferente

Uma alternativa que devolve uma resposta não cumpriu necessariamente a tarefa. Os agentes são mais frágeis neste aspeto do que os chatbots, porque um agente está a meio de uma tarefa com vários passos quando ocorre a mudança, transportando um longo histórico de chamadas de ferramentas que o novo modelo tem de retomar.

![O que muda quando um agente troca de modelo: passar para o mesmo modelo noutro host mantém o comportamento do prompt, o formato das chamadas de ferramentas, os parâmetros e a janela de contexto; um modelo mais recente do mesmo fornecedor ou um modelo de outro fornecedor altera a maioria desses elementos, e todas as mudanças perdem a cache de prompts aquecida](https://crevio.co/vite/assets/what-changes-when-an-agent-switches-models-nxjdqm6x.svg)

### Parâmetros que um modelo aceita e outro rejeita

Isto acontece até dentro do mesmo fornecedor. De acordo com as [notas de descontinuação](https://platform.claude.com/docs/en/about-claude/model-deprecations) e a [referência de erros](https://platform.claude.com/docs/en/api/errors) da Anthropic:

- Definir `temperature`, `top_p` ou `top_k` com um valor diferente do predefinido devolve um erro 400 no Claude Opus 4.7 e versões posteriores
- Forçar uma ferramenta específica com `tool_choice` devolve um erro 400 no Claude Opus 5.5, Sonnet 5.5 e Fable 5.1
- Pré-preencher o início da resposta do assistente devolve um erro 400 no Claude 4.6 e nos modelos posteriores

Assim, uma cadeia que muda de um modelo mais antigo para um modelo mais recente e "melhor" pode falhar imediatamente com um erro que o modelo principal nunca produziu. A opção [`require_parameters` do OpenRouter](https://openrouter.ai/docs/guides/routing/provider-selection) existe, em parte, para resolver esta situação: encaminha apenas para fornecedores que suportem todos os parâmetros enviados.

### Chamadas de ferramentas e prompts

Os diferentes fornecedores esperam ferramentas, resultados e raciocínio em formatos diferentes, pelo que uma alternativa entre fornecedores depende de o gateway traduzir corretamente a conversa. Mesmo quando o formato é preservado, o modelo de reserva não é aquele em que afinou as instruções. Pode chamar ferramentas por uma ordem diferente, parar mais cedo ou interpretar "seja breve" como "ignore a verificação". Alguns dados de raciocínio não são transferidos de todo: a Anthropic informa que um bloco de pensamento "de um modelo que o modelo de destino não consegue ler é descartado".

### Janelas de contexto

Se o modelo de reserva ler menos contexto do que o principal, uma execução longa do agente pode tornar-se demasiado grande no momento em que assume o controlo. É por isso que o OpenRouter inclui os erros de comprimento de contexto nos acionadores de alternativas e o LiteLLM lhes atribui uma lista de alternativas própria. Inclua na cadeia um modelo de reserva com, pelo menos, a mesma janela de contexto do modelo principal ou faça com que o agente condense o histórico mais antigo antes de mudar de modelo.

## Quanto custam as alternativas

Um modelo de reserva altera a fatura de três formas, e nenhuma delas aparece numa tabela de comparação de preços.

**A cache aquecida desaparece.** A colocação de prompts em cache é uma parte importante da acessibilidade dos agentes: as instruções, as definições das ferramentas e o histórico são reenviados a cada passo e, na sua maioria, cobrados à tarifa de cache. As caches estão associadas a um modelo específico num fornecedor específico, razão pela qual o OpenRouter utiliza [sticky routing](https://openrouter.ai/docs/guides/best-practices/prompt-caching) "para encaminhar os pedidos seguintes para o mesmo endpoint do fornecedor depois de um pedido colocado em cache". Se mudar de modelo, o passo seguinte é cobrado ao preço total. Ao [preço de tabela do Claude Sonnet 5.5](https://platform.claude.com/docs/en/about-claude/pricing), de 2,00 $ por milhão de tokens de entrada e 0,20 $ em cache, um histórico de agente com 50 000 tokens custa cerca de 0,01 $ para ser reenviado a partir da cache e cerca de 0,10 $ sem ela. São dez vezes mais por passo até a cache própria do modelo de reserva aquecer.

**Paga pelo modelo que respondeu, com os tokens desse modelo.** O OpenRouter cobra o modelo que respondeu finalmente, pelo que mudar para um modelo mais caro aumenta o custo; e um modelo de reserva mais barato que precise de passos adicionais para concluir a tarefa também pode sair mais caro. As contagens de tokens também não são diretamente comparáveis: a [página de preços](https://platform.claude.com/docs/en/about-claude/pricing) da Anthropic indica que os modelos Claude 4.7 e posteriores utilizam um tokenizer mais recente, que produz aproximadamente mais 30% de tokens para o mesmo texto.

**As novas tentativas também são cobradas.** Um pedido que falhe a meio de um stream já terá frequentemente produzido tokens pagos, e cada nova tentativa reenvia todo o contexto. Explicámos como isto se acumula em [Custos de execução de agentes de IA](/pt/blog/ai-agent-running-costs): as execuções falhadas e os ciclos podem constituir uma cauda de custos superior à média.

Nada disto é um argumento contra os modelos de reserva. É um argumento para os manter como reservas, usando novas tentativas e failover de host para absorver os erros quotidianos, de modo que a mudança dispendiosa só ocorra durante interrupções reais.

## Teste a alternativa antes de precisar dela

A maioria das cadeias de alternativas é testada pela primeira vez durante um incidente — o pior momento para descobrir que o modelo de reserva não consegue chamar as suas ferramentas. Um breve exercício uma vez por trimestre e depois de cada alteração ao modelo deteta a maioria dos problemas:

1. **Provoque a falha.** Aponte o modelo principal para um ID de modelo inexistente ou utilize o mecanismo de teste do router. O LiteLLM disponibiliza `mock_testing_fallbacks=True` no respetivo SDK e recomenda acionar um erro real do fornecedor num ambiente que não seja de produção para o proxy
2. **Execute tarefas reais, não um prompt de olá-mundo.** Escolha três ou quatro tarefas efetivas do agente, incluindo uma execução longa e com muitas ferramentas, e deixe-as terminar integralmente no modelo de reserva
3. **Compare os resultados.** Chamou as mesmas ferramentas, parou no mesmo ponto e respeitou as suas regras de formatação? Leia as transcrições, não apenas a resposta final
4. **Confirme qual foi o modelo que respondeu.** Verifique o campo `model`, a lista `modelAttempts` ou o cabeçalho `cf-aig-step` da resposta. Um exercício em que o modelo principal respondeu silenciosamente não prova nada
5. **Crie alertas para as alternativas.** Uma alternativa acionada todos os dias já não é uma alternativa. É o seu modelo real, não testado nesse volume, e precisa de saber disso
6. **Adicione as datas de retirada ao calendário.** Consulte as páginas de descontinuação do modelo principal e do modelo de reserva e mude para o substituto bastante antes de qualquer uma das datas

Para trabalhos agendados, combine isto com um plano para a execução que, ainda assim, falhar. O nosso guia sobre [como agendar tarefas recorrentes de agentes de IA](/pt/blog/schedule-recurring-ai-agent-tasks) explica o que é uma boa falha: um resultado parcial, uma mensagem clara e uma tarefa que para por si própria em vez de tentar novamente para sempre.

## Como o agente da Crevio lida com falhas de modelos

A [Crevio](https://crevio.co/) é uma plataforma de criação de negócios com IA: descreve o que quer vender e o respetivo agente cria, lança e executa o trabalho associado. A Crevio escolhe e executa os modelos por detrás desse agente, pelo que não tem de gerir contas de fornecedores, chaves ou versões de modelos. Eis o que acontece quando um modelo se comporta de forma inesperada, explicado de forma simples — incluindo aquilo que o agente não faz.

**O que faz atualmente:**

- **Tenta novamente o mesmo modelo de forma automática.** Quando uma chamada ao modelo falha devido a sobrecarga, limite de utilização, erro do servidor, timeout ou resposta interrompida a meio do stream, o agente tenta novamente até três vezes, esperando um pouco mais a cada tentativa (até cerca de 2, 4 e 8 segundos). Os erros que uma nova tentativa não consegue resolver, como um pedido malformado, não são repetidos
- **Evita um host que acabou de falhar.** Nos modelos que podem ser disponibilizados a partir de mais do que um host, uma nova tentativa depois de um erro do host ignora o host que acabou de o produzir
- **Condensa conversas longas.** Se uma conversa ultrapassar o que o modelo consegue ler, o agente resume o histórico mais antigo e tenta novamente uma vez, em vez de parar
- **Verifica a lista de modelos em cada lançamento.** Sempre que a Crevio lança uma atualização, confirma que todos os modelos de que o agente depende continuam disponíveis; se algum tiver desaparecido, o lançamento é assinalado como falhado

![Formulário de nova tarefa da Crevio para um resumo diário das vendas da manhã, com instruções para indicar qual a fonte de dados que não foi possível contactar, definido para repetir todos os dias e com Notificar através de definido como notificação na aplicação e email](https://crevio.co/vite/assets/crevio-task-failure-notifications-cq6okyoe.png)

**O que acontece quando continua a falhar:** uma execução falhada de uma tarefa agendada é comunicada através dos canais definidos em **Notificar através de**, juntamente com o que foi concluído e o que correu mal. Por predefinição, uma tarefa recorrente desativa-se depois de três execuções falhadas consecutivas e avisa-o, em vez de falhar todas as manhãs sem que ninguém perceba. Numa conversa em direto, uma resposta que esgote as novas tentativas simplesmente para, e o utilizador envia novamente a mensagem.

**O que ainda não faz:** o agente da Crevio não muda automaticamente para outro modelo a meio de uma tarefa quando o modelo principal está indisponível. Atualmente, a proteção consiste em novas tentativas e failover de host no mesmo modelo. Também não é possível escolher o modelo do agente nem ligar a sua própria chave de fornecedor. Se precisar de uma cadeia de alternativas afinada entre vários fornecedores, uma ferramenta de routing da tabela acima, na sua própria stack, dá-lhe esse controlo.

A [Crevio](https://crevio.co/) começa por ser gratuita, e o plano Starter inclui 20 créditos de IA por mês.

## Perguntas frequentes

### Preciso de um modelo de reserva se já utilizo um gateway de IA?

O gateway é o local onde configura a alternativa, não é uma alternativa por si só. Alguns gateways tentam novamente ou fazem failover entre hosts do mesmo modelo, mas uma alternativa de modelo só acontece se indicar um modelo. Também acrescentam uma dependência própria, pelo que deve verificar o comportamento do seu gateway durante incidentes anteriores.

### O modelo de reserva de um agente de IA deve ser de outro fornecedor?

Para interrupções, sim: um modelo de reserva do mesmo fornecedor costuma ficar indisponível no mesmo incidente. Para limites de utilização, um segundo modelo do mesmo fornecedor pode ser suficiente, uma vez que os limites são normalmente definidos por modelo. O compromisso é a compatibilidade: quanto mais distante o modelo de reserva estiver do principal, mais terá de testar os prompts, as chamadas de ferramentas e os parâmetros nesse modelo.

### Com que frequência devo testar a minha alternativa de LLM?

Faça um exercício depois de cada alteração ao modelo principal, ao modelo de reserva ou às instruções e ferramentas do agente, e pelo menos uma vez por trimestre nos restantes casos. Verifique também as datas de descontinuação de ambos os modelos em cada exercício, pois um modelo de reserva que tenha sido retirado falha precisamente quando mais precisa dele.

## Uma alternativa que nunca executou é apenas uma suposição

As interrupções, os limites de utilização e as retiradas são agora situações normais, e um bom modelo de reserva para agentes de IA transforma um relatório matinal perdido num relatório ligeiramente mais lento. Mas o valor está na ordem pela qual aplica as medidas: tente novamente, mude para outro host, mude depois para outro modelo — e apenas se tiver observado anteriormente esse modelo de reserva a concluir trabalho real. Se nunca o testou, não tem uma alternativa. Tem uma segunda coisa que pode falhar.

## Artigos relacionados

- [Custos de execução de agentes de IA: quanto custa realmente um agente por mês](/pt/blog/ai-agent-running-costs)
- [Como agendar tarefas recorrentes de agentes de IA para serem executadas sem si](/pt/blog/schedule-recurring-ai-agent-tasks)
- [Agentes de IA com intervenção humana: o que aprovar e o que deixar executar](/pt/blog/human-in-the-loop-ai-agents)
- [Agentes de IA para empresas: o que implementar primeiro, departamento a departamento](/pt/blog/ai-agents-for-business)
