Un résultat indique à la session à quoi doit ressembler le résultat final et comment mesurer sa qualité. L'agent travaille vers cet objectif, en s'auto-évaluant et en itérant jusqu'à ce que le résultat soit atteint.
Lorsque vous définissez un résultat, le harnais provisionne automatiquement un grader (évaluateur) pour évaluer l'artefact par rapport à une grille d'évaluation. L'évaluateur utilise une « context window » (fenêtre de contexte) distincte pour éviter d'être influencé par les choix d'implémentation de l'agent principal.
L'évaluateur renvoie une explication résumant quels critères ont réussi ou échoué, ou confirmant que l'artefact satisfait la grille d'évaluation. Ce retour est transmis à l'agent pour l'itération suivante.
Une « rubric » (grille d'évaluation) est un document markdown décrivant la notation par critère. La grille d'évaluation est obligatoire.
Exemple de grille d'évaluation :
# DCF Model Rubric
## Revenue Projections
- Uses historical revenue data from the last 5 fiscal years
- Projects revenue for at least 5 years forward
- Growth rate assumptions are explicitly stated and reasonable
## Cost Structure
- COGS and operating expenses are modeled separately
- Margins are consistent with historical trends or deviations are justified
## Discount Rate
- WACC is calculated with stated assumptions for cost of equity and cost of debt
- Beta, risk-free rate, and equity risk premium are sourced or justified
## Terminal Value
- Uses either perpetuity growth or exit multiple method (stated which)
- Terminal growth rate does not exceed long-term GDP growth
## Output Quality
- All figures are in a single .xlsx file with clearly labeled sheets
- Key assumptions are on a separate "Assumptions" sheet
- Sensitivity analysis on WACC and terminal growth rate is includedTransmettez la grille d'évaluation sous forme de texte en ligne dans user.define_outcome (voir Créer une session avec un résultat), ou téléversez-la via l'API Files pour la réutiliser dans plusieurs sessions.
import time
from pathlib import Path
from anthropic import Anthropic
client = Anthropic()
RUBRIC = """# DCF Model Rubric
## Revenue Projections
- Uses historical revenue data from the last 5 fiscal years
- Projects revenue for at least 5 years forward
## Output Quality
- All figures are in a single .xlsx file with clearly labeled sheets
"""
Path("/tmp/rubric.md").write_text(RUBRIC)
rubric = client.files.upload(file=Path("/tmp/rubric.md"))
print(f"Uploaded rubric: {rubric.id}")Les exemples suivants créent une session pour un agent et un environnement existants (tous deux créés séparément), puis envoient un événement user.define_outcome. L'agent commence à travailler immédiatement. Aucun événement de message utilisateur supplémentaire n'est requis.
# Create a session
session = client.beta.sessions.create(
agent=agent.id,
environment_id=environment.id,
title="Financial analysis on Costco",
)
# Define the outcome — agent starts working on receipt
client.beta.sessions.events.send(
session_id=session.id,
events=[
{
"type": "user.define_outcome",
"description": "Build a DCF model for Costco in .xlsx",
"rubric": {"type": "text", "content": RUBRIC},
# or: "rubric": {"type": "file", "file_id": rubric.id},
"max_iterations": 5, # optional; default 3, max 20
}
],
)La progression d'une session orientée résultat est exposée sur le flux d'événements.
agent.* (tels que les messages et l'utilisation d'outils) montrent la progression vers le résultat.span.outcome_evaluation_* ne sont émis que pour les sessions orientées résultat et montrent le nombre de boucles d'itération et le processus de retour de l'évaluateur.user.message à une session orientée résultat pour orienter le travail de l'agent au fur et à mesure de sa progression, mais ce n'est pas obligatoire : l'agent travaille vers le résultat de lui-même, en itérant jusqu'à ce qu'il réussisse ou épuise ses itérations.user.interrupt met en pause le travail sur le résultat en cours et marque le span.outcome_evaluation_end.result comme interrupted, ce qui vous permet de lancer un nouveau résultat.Il s'agit de l'événement que vous envoyez pour initier un résultat. Il est renvoyé en écho à sa réception, incluant un horodatage processed_at et un outcome_id.
{
"type": "user.define_outcome",
"description": "Build a DCF model for Costco in .xlsx",
"rubric": { "type": "file", "file_id": "file_01..." },
"max_iterations": 5
}Émis lorsque l'évaluateur démarre une évaluation sur une boucle d'itération. Le champ iteration est un compteur de révision indexé à partir de 0 : 0 est la première évaluation, 1 est la réévaluation après la première révision, et ainsi de suite.
{
"type": "span.outcome_evaluation_start",
"id": "sevt_01def...",
"outcome_id": "outc_01a...",
"iteration": 0,
"processed_at": "2026-03-25T14:01:45Z"
}Signal de vie (heartbeat) émis pendant que l'évaluateur s'exécute. Le raisonnement interne de l'évaluateur est opaque : vous voyez qu'il travaille, pas ce qu'il pense.
{
"type": "span.outcome_evaluation_ongoing",
"id": "sevt_01ghi...",
"outcome_id": "outc_01a...",
"iteration": 0,
"processed_at": "2026-03-25T14:02:10Z"
}Émis lorsqu'un cycle d'évaluation de résultat se termine : après que l'évaluateur a fini d'évaluer une itération, ou lorsque la session est interrompue alors qu'un résultat est actif. Le champ result indique ce qui se passe ensuite.
| Résultat | Suite |
|---|---|
satisfied | La session passe à l'état idle. |
needs_revision | L'agent démarre un nouveau cycle d'itération. |
max_iterations_reached | Un dernier tour d'acquittement suit avant que la session ne passe à l'état idle. Aucune autre évaluation n'est exécutée. |
failed | La session passe à l'état idle. Renvoyé lorsque la grille d'évaluation ne s'applique pas aux livrables, par exemple si la description et la grille d'évaluation se contredisent. |
interrupted | Émis lorsque la session est interrompue alors qu'un résultat est actif, même si l'évaluation n'avait pas encore commencé. Si aucun outcome_evaluation_start n'a été déclenché avant l'interruption, outcome_evaluation_start_id est une chaîne vide. |
{
"type": "span.outcome_evaluation_end",
"id": "sevt_01jkl...",
"outcome_evaluation_start_id": "sevt_01def...",
"outcome_id": "outc_01a...",
"result": "satisfied",
"explanation": "All 12 criteria met: revenue projections use 5 years of historical data, WACC assumptions are stated, sensitivity table is included...",
"iteration": 0,
"usage": {
"input_tokens": 2400,
"output_tokens": 350,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 1800
},
"processed_at": "2026-03-25T14:03:00Z"
}Vous pouvez soit écouter le flux d'événements pour span.outcome_evaluation_end, soit interroger GET /v1/sessions/{session_id} et lire outcome_evaluations[].result. Tant qu'une évaluation n'est pas terminée, result indique pending, running ou evaluating :
session = client.beta.sessions.retrieve(session.id)
for outcome in session.outcome_evaluations:
print(f"{outcome.outcome_id}: {outcome.result}")
# outc_01a...: satisfiedL'agent écrit les fichiers de sortie dans /mnt/session/outputs/ à l'intérieur du bac à sable. Une fois la session à l'état idle, récupérez-les via l'API Files limitée à la session.
# List files produced by this session
# scope_id filtering requires the managed-agents beta on the files request
files = client.beta.files.list(scope_id=session.id, betas=["managed-agents-2026-04-01"])
for file in files:
print(file.id, file.filename)
# Download a file
if files.data:
content = client.files.download(files.data[0].id)
content.write_to_file("/tmp/output.txt")Enregistrez des identifiants par utilisateur lors de la création de sessions.
Envoyez des événements, diffusez les réponses en streaming, et interrompez ou redirigez votre session en cours d'exécution.
Téléversez des fichiers et montez-les dans votre bac à sable pour les lire et les traiter.
Was this page helpful?