|
| 1 | +"""Unit tests for ChaosExperiment.""" |
| 2 | + |
| 3 | +import pytest |
| 4 | + |
| 5 | +from strands_evals import Case |
| 6 | +from strands_evals.chaos import ChaosExperiment, ChaosScenario |
| 7 | +from strands_evals.chaos._context import _current_scenario |
| 8 | +from strands_evals.chaos.effects import CorruptValues, ToolCallFailure |
| 9 | +from strands_evals.evaluators.evaluator import Evaluator |
| 10 | +from strands_evals.types import EvaluationData, EvaluationOutput |
| 11 | + |
| 12 | + |
| 13 | +class MockChaosEvaluator(Evaluator): |
| 14 | + """Simple evaluator that always passes.""" |
| 15 | + |
| 16 | + def evaluate(self, evaluation_case: EvaluationData) -> list[EvaluationOutput]: |
| 17 | + return [EvaluationOutput(score=1.0, test_pass=True, reason="Mock pass")] |
| 18 | + |
| 19 | + |
| 20 | +@pytest.fixture |
| 21 | +def cases(): |
| 22 | + return [ |
| 23 | + Case(name="case_a", input="hello"), |
| 24 | + Case(name="case_b", input="world"), |
| 25 | + ] |
| 26 | + |
| 27 | + |
| 28 | +@pytest.fixture |
| 29 | +def scenarios(): |
| 30 | + return [ |
| 31 | + ChaosScenario( |
| 32 | + name="search_timeout", |
| 33 | + effects={"search_tool": [ToolCallFailure(error_type="timeout")]}, |
| 34 | + ), |
| 35 | + ChaosScenario( |
| 36 | + name="db_corrupt", |
| 37 | + effects={"db_tool": [CorruptValues(corrupt_ratio=0.8)]}, |
| 38 | + ), |
| 39 | + ] |
| 40 | + |
| 41 | + |
| 42 | +@pytest.fixture |
| 43 | +def evaluator(): |
| 44 | + return MockChaosEvaluator() |
| 45 | + |
| 46 | + |
| 47 | +class TestChaosExperiment: |
| 48 | + """Tests for ChaosExperiment initialization and execution.""" |
| 49 | + |
| 50 | + def test_expanded_cases_count_with_baseline(self, cases, scenarios, evaluator): |
| 51 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator], include_baseline=True) |
| 52 | + # 2 cases × (2 scenarios + 1 baseline) = 6 |
| 53 | + assert len(experiment._expanded_cases) == 6 |
| 54 | + |
| 55 | + def test_expanded_cases_count_without_baseline(self, cases, scenarios, evaluator): |
| 56 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator], include_baseline=False) |
| 57 | + # 2 cases × 2 scenarios = 4 |
| 58 | + assert len(experiment._expanded_cases) == 4 |
| 59 | + |
| 60 | + def test_expanded_case_names_include_scenario(self, cases, scenarios, evaluator): |
| 61 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator], include_baseline=True) |
| 62 | + names = [c.name for c in experiment._expanded_cases] |
| 63 | + assert "case_a|baseline" in names |
| 64 | + assert "case_a|search_timeout" in names |
| 65 | + assert "case_a|db_corrupt" in names |
| 66 | + assert "case_b|baseline" in names |
| 67 | + assert "case_b|search_timeout" in names |
| 68 | + assert "case_b|db_corrupt" in names |
| 69 | + |
| 70 | + def test_each_expanded_case_has_unique_session_id(self, cases, scenarios, evaluator): |
| 71 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator]) |
| 72 | + session_ids = [c.session_id for c in experiment._expanded_cases] |
| 73 | + assert len(session_ids) == len(set(session_ids)) |
| 74 | + |
| 75 | + def test_get_scenario_for_session(self, cases, scenarios, evaluator): |
| 76 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator], include_baseline=True) |
| 77 | + # Pick an expanded case and verify its scenario maps correctly |
| 78 | + for expanded_case in experiment._expanded_cases: |
| 79 | + scenario = experiment.get_scenario_for_session(expanded_case.session_id) |
| 80 | + assert scenario is not None |
| 81 | + assert scenario.name in expanded_case.name |
| 82 | + |
| 83 | + def test_get_scenario_for_unknown_session(self, cases, scenarios, evaluator): |
| 84 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator]) |
| 85 | + assert experiment.get_scenario_for_session("nonexistent-id") is None |
| 86 | + |
| 87 | + def test_get_original_case_name(self, cases, scenarios, evaluator): |
| 88 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator], include_baseline=True) |
| 89 | + for expanded_case in experiment._expanded_cases: |
| 90 | + original_name = experiment.get_original_case_name(expanded_case.session_id) |
| 91 | + assert original_name in ("case_a", "case_b") |
| 92 | + |
| 93 | + def test_get_original_case_name_unknown_session(self, cases, scenarios, evaluator): |
| 94 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator]) |
| 95 | + assert experiment.get_original_case_name("nonexistent-id") is None |
| 96 | + |
| 97 | + def test_context_var_set_and_reset(self, cases, scenarios, evaluator): |
| 98 | + """Verify the ContextVar is set to the correct scenario during task execution and reset after.""" |
| 99 | + observed_scenarios = [] |
| 100 | + |
| 101 | + def capturing_task(case: Case): |
| 102 | + scenario = _current_scenario.get() |
| 103 | + observed_scenarios.append((case.name, scenario.name if scenario else None)) |
| 104 | + return "output" |
| 105 | + |
| 106 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator], include_baseline=True) |
| 107 | + experiment.run_evaluations(task=capturing_task) |
| 108 | + |
| 109 | + # Should have 6 observations (2 cases × 3 scenarios) |
| 110 | + assert len(observed_scenarios) == 6 |
| 111 | + |
| 112 | + # Verify baseline scenarios observed |
| 113 | + baseline_obs = [(name, sn) for name, sn in observed_scenarios if sn == "baseline"] |
| 114 | + assert len(baseline_obs) == 2 |
| 115 | + |
| 116 | + # Verify chaos scenarios observed |
| 117 | + timeout_obs = [(name, sn) for name, sn in observed_scenarios if sn == "search_timeout"] |
| 118 | + assert len(timeout_obs) == 2 |
| 119 | + |
| 120 | + # After all runs, the ContextVar should be back to None |
| 121 | + assert _current_scenario.get() is None |
| 122 | + |
| 123 | + def test_context_var_reset_on_task_exception(self, evaluator): |
| 124 | + """Verify the ContextVar is reset even if the task raises.""" |
| 125 | + cases = [Case(name="failing", input="x")] |
| 126 | + scenarios_list = [ChaosScenario(name="chaos", effects={"t": [ToolCallFailure()]})] |
| 127 | + |
| 128 | + call_count = [0] |
| 129 | + |
| 130 | + def failing_task(case: Case): |
| 131 | + call_count[0] += 1 |
| 132 | + if call_count[0] == 1: |
| 133 | + raise RuntimeError("Task failed") |
| 134 | + return "output" |
| 135 | + |
| 136 | + experiment = ChaosExperiment( |
| 137 | + cases=cases, scenarios=scenarios_list, evaluators=[evaluator], include_baseline=True |
| 138 | + ) |
| 139 | + |
| 140 | + # The base Experiment should handle the exception internally |
| 141 | + # ContextVar should still be reset |
| 142 | + try: |
| 143 | + experiment.run_evaluations(task=failing_task) |
| 144 | + except Exception: |
| 145 | + pass |
| 146 | + |
| 147 | + assert _current_scenario.get() is None |
| 148 | + |
| 149 | + def test_returns_evaluation_reports(self, cases, scenarios, evaluator): |
| 150 | + """Verify run_evaluations returns reports.""" |
| 151 | + |
| 152 | + def task(case: Case): |
| 153 | + return "output" |
| 154 | + |
| 155 | + experiment = ChaosExperiment(cases=cases, scenarios=scenarios, evaluators=[evaluator], include_baseline=True) |
| 156 | + reports = experiment.run_evaluations(task=task) |
| 157 | + |
| 158 | + assert len(reports) >= 1 |
| 159 | + report = reports[0] |
| 160 | + # 2 cases × 3 scenarios = 6 scores |
| 161 | + assert len(report.scores) == 6 |
0 commit comments