Provedor e modelo
- Provedor - selecione o provedor de LLM de origem.
- Modelo - selecione o modelo específico desse provedor. Modelos diferentes têm pontos fortes distintos: modelos grandes de raciocínio para tarefas que exigem mais planejamento e modelos menores e mais rápidos para consultas rotineiras.
Contexto e limites de saída
- Máximo de tokens de contexto - limita o contexto total que o agente envia ao modelo. Deixe como System para usar o padrão do modelo. Reduza para diminuir o custo; aumente para agentes que precisam processar entradas grandes.
- Máximo de tokens de saída - limita o tamanho da resposta do agente. System usa o padrão do modelo. Defina um valor menor se as respostas estiverem muito longas e um maior se estiverem sendo cortadas.
- Limite de tokens por arquivo - limita quantos tokens um único arquivo enviado adiciona ao contexto. Útil quando os usuários anexam arquivos grandes e você não quer que eles ocupem o espaço do restante da conversa.
Amostragem
- Temperature - aleatoriedade. Valores mais altos (0.7–1.0) = mais aleatório, enquanto valores mais baixos (0.0–0.3) = mais focado e determinístico. Recomendamos alterar este parâmetro ou o Top P, mas não ambos.
- Top P - amostragem por núcleo. Altera como o modelo seleciona tokens na saída.
- Top K - restringe a amostragem aos K tokens mais prováveis em cada passo. Compatível com alguns provedores; controla o determinismo em um eixo diferente da Temperature.
Controles de raciocínio
- Thinking - alterna o modo de raciocínio estendido do modelo. Quando ativado, o modelo produz tokens internos de Thinking antes da resposta final; isso geralmente melhora a precisão em tarefas difíceis, à custa de latência e tokens.
- Thinking Budget - define um orçamento de tokens para a fase de Thinking. O modelo para de pensar e responde quando atingir essa quantidade de tokens.
- Effort - controle de alto nível do esforço de raciocínio (Auto, baixo, médio, alto). Usado por modelos de raciocínio que não expõem diretamente um orçamento de tokens de Thinking.
- Thought Visibility - controla se o Thinking do modelo é mostrado ao usuário inline, oculto em uma visualização recolhida ou omitido por completo.
Comportamento da conversa
- Reenviar arquivos - quando ativado, os arquivos anexados em interações anteriores são reenviados em cada interação seguinte para que o modelo não os perca de vista. Desative para economizar tokens se a conversa for curta ou se o modelo estiver resumindo os arquivos ao longo da conversa.
- Usar Prompt Caching - quando houver suporte do provedor, armazena em cache partes reutilizáveis do prompt para reduzir custo e latência em conversas nas quais instruções e descrições de ferramentas se repetem entre interações.
- Web Search - ativa ou desativa a busca na web nativa do provedor em modelos compatíveis. Isso é diferente da ferramenta Web search, que é executada como uma das ferramentas do agente, e não como um recurso do provedor.