Skip to content

Upgrade Vally evaluations to 0.14 - #419

Open
Larry Osterman (LarryOsterman) wants to merge 1 commit into
mainfrom
larryosterman-update-vally
Open

Upgrade Vally evaluations to 0.14#419
Larry Osterman (LarryOsterman) wants to merge 1 commit into
mainfrom
larryosterman-update-vally

Conversation

@LarryOsterman

Copy link
Copy Markdown
Member

Summary

  • upgrade Vally packages and CI installation to 0.14.0
  • consolidate Rust skill experiments onto their canonical eval files and use experiment-compatible graders
  • parameterize generator and grader models, defaulting to gpt-5.6-terra and claude-sonnet-4.6
  • invoke the package-local Vally executable directly from sequential and parallel workers
  • add repository-wide validation for execution/grader model separation

Validation

  • 145 Vally model-policy tests pass
  • Python and Rust experiment dry runs resolve baseline and skill variants
  • Rust canonical evals lint and experiment plans resolve without grader plugins
  • PowerShell runner parses and accepts model overrides

Update experiment configuration, consolidate Rust evals, parameterize execution and grader models, and make workers invoke the package-local Vally executable.

Co-authored-by: Copilot App <223556219+Copilot@users.noreply.github.com>

Copilot AI left a comment

Copy link
Copy Markdown
Contributor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Copilot review overview

Review tier: Balanced
Findings: 1 Medium severity

New issues introduced by this change (1)
Severity Finding
Medium severity tests/​run-skill-experiments.ps1 — These overrides can set the generator and grader to the same value (for example, `-Model foo…
What changed in this PR

Upgrades Vally evaluations to 0.14 and standardizes model separation and skill experiments across Python and Rust scenarios.

Changes:

  • Parameterizes generator and grader models across 49 eval specifications.
  • Consolidates Rust experiments onto canonical evals with standard program graders.
  • Updates Vally dependencies, CI, PowerShell execution, and model-policy validation.
File Description
.github/​workflows/​run-vally-evaluations.yml Upgrades CI Vally CLI to 0.14.
tests/​package.json Upgrades Vally dependencies.
tests/​pnpm-workspace.yaml Allows required native dependency builds.
tests/​plugins/​vally-eval-models.test.ts Adds model-separation policy tests.
tests/​run-skill-experiments.ps1 Adds model overrides and local Vally execution.
tests/​scenarios/​_shared/​vally/​grader-plugins/​rust-cargo-build-failure/​package.json Upgrades plugin Vally dependency.
tests/​scenarios/​agent-framework-azure-ai-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​agent-framework-azure-ai-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-contentsafety-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-contentsafety-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-contentunderstanding-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-contentunderstanding-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-language-conversations-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-language-conversations-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-ml-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-ml-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-projects-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-projects-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-textanalytics-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-textanalytics-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-transcription-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-transcription-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-translation-document-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-translation-document-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-translation-text-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-translation-text-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-vision-imageanalysis-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-vision-imageanalysis-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-ai-voicelive-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-ai-voicelive-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-appconfiguration-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-appconfiguration-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-containerregistry-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-containerregistry-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-cosmos-db-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-cosmos-db-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-cosmos-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-cosmos-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-cosmos-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-cosmos-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-cosmos-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​azure-data-tables-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-data-tables-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-eventgrid-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-eventgrid-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-eventhub-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-eventhub-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-eventhub-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-eventhub-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-eventhub-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​azure-identity-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-identity-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-identity-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-identity-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-identity-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​azure-keyvault-certificates-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-keyvault-certificates-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-keyvault-certificates-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​azure-keyvault-keys-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-keyvault-keys-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-keyvault-keys-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​azure-keyvault-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-keyvault-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-keyvault-secrets-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-keyvault-secrets-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-keyvault-secrets-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​azure-messaging-webpubsubservice-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-messaging-webpubsubservice-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-mgmt-apicenter-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-mgmt-apicenter-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-mgmt-apimanagement-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-mgmt-apimanagement-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-mgmt-botservice-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-mgmt-botservice-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-mgmt-fabric-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-mgmt-fabric-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-monitor-ingestion-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-monitor-ingestion-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-monitor-opentelemetry-exporter-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-monitor-opentelemetry-exporter-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-monitor-opentelemetry-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-monitor-opentelemetry-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-monitor-query-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-monitor-query-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-search-documents-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-search-documents-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-servicebus-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-servicebus-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-speech-to-text-rest-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-speech-to-text-rest-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-storage-blob-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-storage-blob-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-storage-blob-rust/​vally/​eval-keyvault-encryption.yaml Parameterizes models.
tests/​scenarios/​azure-storage-blob-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-storage-blob-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-storage-blob-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​azure-storage-file-datalake-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-storage-file-datalake-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-storage-file-share-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-storage-file-share-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-storage-queue-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​azure-storage-queue-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​azure-storage-queue-rust/​vally/​eval.yaml Consolidates environment and compatible graders.
tests/​scenarios/​azure-storage-queue-rust/​vally/​skill_effectiveness_eval.yaml Removes duplicate legacy eval.
tests/​scenarios/​azure-storage-queue-rust/​vally/​skill_effectiveness_experiment.yaml Targets the canonical eval.
tests/​scenarios/​fastapi-router-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​fastapi-router-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​m365-agents-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​m365-agents-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
tests/​scenarios/​pydantic-models-py/​vally/​eval.yaml Parameterizes models.
tests/​scenarios/​pydantic-models-py/​vally/​skill_effectiveness_experiment.yaml Standardizes experiment variants.
Files not reviewed (1)
  • tests/package-lock.json: Generated file

💡 Add a code-review agent skill or configure MCP servers for context-aware, tailored reviews. Learn more in the docs.

Comment on lines +1081 to +1086
$vallyArgs = @(
"experiment", "run", "skill_effectiveness_experiment.yaml",
"--output-dir", $skillOutputRoot,
"--param", "MODEL=$Model",
"--param", "GRADER_MODEL=$GraderModel"
)
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants