La "latency" (latenza) si riferisce al tempo necessario al modello per elaborare un prompt e generare un output. La latenza può essere influenzata da vari fattori, come la dimensione del modello, la complessità del prompt e l'infrastruttura sottostante che supporta il modello e il punto di interazione.
Quando si parla di latenza, potresti incontrare diversi termini e misurazioni:
Per una comprensione più approfondita di questi termini, consulta il glossario.
Uno dei modi più diretti per ridurre la latenza è selezionare il modello appropriato per il tuo caso d'uso. Anthropic offre una gamma di modelli con diverse capacità e caratteristiche di prestazione. Considera i tuoi requisiti specifici e scegli il modello che meglio si adatta alle tue esigenze in termini di velocità e qualità dell'output.
Per le applicazioni in cui la velocità è critica, Claude Haiku 4.5 offre i tempi di risposta più rapidi mantenendo un'elevata intelligenza:
client = anthropic.Anthropic()
# Per applicazioni sensibili ai tempi di risposta, usa Claude Haiku 4.5
message = client.messages.create(
model="claude-haiku-4-5",
max_tokens=100,
messages=[
{
"role": "user",
"content": "Summarize this customer feedback in 2 sentences: [feedback text]",
}
],
)
print(message.content[0].text)Per maggiori dettagli sulle metriche dei modelli, consulta la pagina panoramica dei modelli.
Minimizza il numero di token sia nel prompt di input che nell'output previsto, mantenendo comunque prestazioni elevate. Meno token il modello deve elaborare e generare, più veloce sarà la risposta.
Ecco alcuni suggerimenti per aiutarti a ottimizzare i tuoi prompt e output:
max_tokens per impostare un limite rigido sulla lunghezza massima della risposta generata. Questo impedisce a Claude di generare output eccessivamente lunghi.
temperature controlla la casualità dell'output. Valori più bassi (ad esempio, 0.2) possono talvolta portare a risposte più mirate e brevi, mentre valori più alti (ad esempio, 0.8) potrebbero produrre output più diversificati ma potenzialmente più lunghi.Trovare il giusto equilibrio tra chiarezza del prompt, qualità dell'output e numero di token potrebbe richiedere un po' di sperimentazione.
Lo streaming è una funzionalità che consente al modello di iniziare a inviare la sua risposta prima che l'output completo sia terminato. Questo può migliorare significativamente la reattività percepita della tua applicazione, poiché gli utenti possono vedere l'output del modello in tempo reale.
Con lo streaming abilitato, puoi elaborare l'output del modello man mano che arriva, aggiornando la tua interfaccia utente o eseguendo altre attività in parallelo.
Visita Streaming dei messaggi per scoprire come puoi implementare lo streaming per il tuo caso d'uso.
Minimizza le allucinazioni negli output di Claude consentendo l'incertezza, basando le risposte su citazioni dirette e verificando le affermazioni con le citazioni.
Ricevi in streaming le risposte dell'API Messages in modo incrementale con eventi server-sent, inclusi i delta di testo, uso degli strumenti e pensiero esteso.
Was this page helpful?