[kbn-evals] Fix CI LLM triage silently dropping suites: forced tool call, truncation detection, raw-output logging - #290495
Conversation
|
Pinging @elastic/nightshift-context-and-research-team (Team:nightshift-context-and-research) |
2f84642 to
74fdadc
Compare
There was a problem hiding this comment.
LGTM @arturoliduena
Thanks for fixing this.
I left a couple of comments, please take a look before merging. Thanks
| console.error( | ||
| `Raw triage model reply: ${redactSecrets(JSON.stringify(message ?? responseJson)).slice( | ||
| 0, | ||
| 500 |
There was a problem hiding this comment.
Should we consider 1000 here? 500 is a bit too low I feel and may lose some information.
| return { groups: parseTriageGroups(raw), modelId }; | ||
| const message = responseJson?.choices?.[0]?.message; | ||
| try { | ||
| return { groups: parseTriageGroups(message?.tool_calls?.[0]?.function?.arguments), modelId }; |
There was a problem hiding this comment.
When the model returns a text response instead of a tool call, message?.tool_calls?.[0]?.function?.arguments is undefined. parseTriageGroups(undefined) then throws "Triage model did not return valid JSON", which is accurate for the JSON parse failure but misleading about why. The issue is that there was no tool call at all, not that the arguments were malformed JSON. Distinguishing these two cases in the logged output would make CI debugging faster.
Something like:
const args = message?.tool_calls?.[0]?.function?.arguments;
if (args === undefined) {
console.error(`Triage model ignored the tool call. Raw reply: ${redactSecrets(JSON.stringify(message ?? responseJson)).slice(0, 500)}`);
throw new Error('Triage model did not call the report_triage tool');
}
return { groups: parseTriageGroups(args), modelId };
This also removes the need for a try/catch around the normal path, making the code cleaner.
WDYT?
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::llm-tasks::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::llm-tasks::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::llm-tasks::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::llm-tasks::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::llm-tasks::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::llm-tasks::google-gemini-3.0-flash
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::llm-tasks::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::llm-tasks::google-gemini-3.1-pro
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::llm-tasks::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::llm-tasks::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::llm-tasks::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::llm-tasks::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::smoke-tests::anthropic-claude-4.6-sonnet | Baseline (main): 3a5213b38d56fe12::smoke-tests::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (5 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::smoke-tests::google-gemini-3.1-pro | Baseline (main): bk-019fa8d7-5840-4b94-96ff-b651ee8206f0::smoke-tests::google-gemini-3.1-pro
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (5 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::smoke-tests::openai-gpt-5.4 | Baseline (main): bk-01a03501-86fe-4d7d-894d-3e95df37ed0d::smoke-tests::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (5 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::smoke-tests::openai-gpt-oss-120b | Baseline (main): bk-01a03501-86fe-4d7d-894d-3e95df37ed0d::smoke-tests::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (5 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-dashboards::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-dashboards::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (49 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-dashboards::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-dashboards::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (48 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-dashboards::openai-gpt-5.2 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-dashboards::openai-gpt-5.2
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (47 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-dashboards::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-dashboards::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (47 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-visualizations::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-visualizations::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (12 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-visualizations::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-visualizations::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (9 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-visualizations::openai-gpt-5.2 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-visualizations::openai-gpt-5.2
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::agent-builder-visualizations::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::agent-builder-visualizations::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (5 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-analysis-workflow::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-analysis-workflow::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-analysis-workflow::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-analysis-workflow::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-analysis-workflow::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-analysis-workflow::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-analysis-workflow::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-analysis-workflow::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-analysis-workflow::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-analysis-workflow::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-analysis-workflow::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-analysis-workflow::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (3 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (9 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (9 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (9 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::streams::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::streams::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (141 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::streams::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::streams::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (141 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::streams::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::streams::google-gemini-3.0-flash
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (141 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::streams::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::streams::google-gemini-3.1-pro
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (141 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::streams::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::streams::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (141 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::streams::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::streams::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (131 rows)
|
|
🧪 LLM eval (PR) — Streams ( Failing models:
Triage summary: ERROR Error: Playwright exited with code 1
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix-attack-discovery::anthropic-claude-4.6-opus | Baseline (main): bk-019fdc33-33ac-4468-813f-ec408a156454::security-persona-matrix-attack-discovery::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (6 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix-attack-discovery::anthropic-claude-4.6-sonnet | Baseline (main): bk-019fdc33-33ac-4468-813f-ec408a156454::security-persona-matrix-attack-discovery::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (6 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix-attack-discovery::google-gemini-3.0-flash | Baseline (main): bk-019fdc33-33ac-4468-813f-ec408a156454::security-persona-matrix-attack-discovery::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (6 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix-attack-discovery::google-gemini-3.1-pro | Baseline (main): bk-019fdc33-33ac-4468-813f-ec408a156454::security-persona-matrix-attack-discovery::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (6 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix-attack-discovery::openai-gpt-5.4 | Baseline (main): bk-019fdc33-33ac-4468-813f-ec408a156454::security-persona-matrix-attack-discovery::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (6 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix-attack-discovery::openai-gpt-oss-120b | Baseline (main): bk-019fdc33-33ac-4468-813f-ec408a156454::security-persona-matrix-attack-discovery::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (6 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::pci-compliance::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::pci-compliance::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (16 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::pci-compliance::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::pci-compliance::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (16 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::pci-compliance::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::pci-compliance::google-gemini-3.0-flash
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (16 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::pci-compliance::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::pci-compliance::google-gemini-3.1-pro
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (16 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::pci-compliance::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::pci-compliance::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (16 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::pci-compliance::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::pci-compliance::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (16 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-triage::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-triage::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (34 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-triage::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-triage::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (31 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-triage::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-triage::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (32 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-triage::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-triage::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (32 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-triage::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-triage::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (34 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alert-triage::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alert-triage::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (32 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-esql-generation-regression::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-esql-generation-regression::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (9 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-esql-generation-regression::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-esql-generation-regression::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-esql-generation-regression::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-esql-generation-regression::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (9 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-esql-generation-regression::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-esql-generation-regression::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-esql-generation-regression::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-esql-generation-regression::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (9 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-esql-generation-regression::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-esql-generation-regression::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (8 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alerts-rag-regression::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alerts-rag-regression::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (54 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alerts-rag-regression::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alerts-rag-regression::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (50 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alerts-rag-regression::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alerts-rag-regression::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (54 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alerts-rag-regression::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alerts-rag-regression::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (55 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alerts-rag-regression::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alerts-rag-regression::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (50 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-alerts-rag-regression::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::security-alerts-rag-regression::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (54 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::alerting-v2::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::alerting-v2::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (28 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::alerting-v2::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::alerting-v2::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (28 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::alerting-v2::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::alerting-v2::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (28 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::alerting-v2::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::alerting-v2::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (27 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::alerting-v2::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::alerting-v2::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (28 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::alerting-v2::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::alerting-v2::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (28 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix::anthropic-claude-4.6-opus | Baseline (main): sweep-1788679167-rja-s1of3::security-persona-matrix::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix::anthropic-claude-4.6-sonnet | Baseline (main): sweep-1788679167-rja-s2of3::security-persona-matrix::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (6 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix::google-gemini-3.0-flash | Baseline (main): sweep-1788685888-rj3-s1of3::security-persona-matrix::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix::google-gemini-3.1-pro | Baseline (main): sweep-1788685888-rj3-s2of3::security-persona-matrix::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (6 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix::openai-gpt-5.4 | Baseline (main): sweep-1788679167-rja-s2of3::security-persona-matrix::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (7 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-persona-matrix::openai-gpt-oss-120b | Baseline (main): bk-019fdc33-33ac-4468-813f-ec408a156454::security-persona-matrix::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (11 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::siem-readiness::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::siem-readiness::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (47 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::siem-readiness::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::siem-readiness::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (45 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::siem-readiness::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::siem-readiness::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (49 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::siem-readiness::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::siem-readiness::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (48 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::siem-readiness::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::siem-readiness::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (53 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::siem-readiness::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::siem-readiness::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (47 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::security-automatic-migrations::openai-gpt-5.4 | Baseline (main): cf2eccfa9472f4cd::security-automatic-migrations::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (18 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery-agent-builder::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery-agent-builder::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (54 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery-agent-builder::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery-agent-builder::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (54 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery-agent-builder::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery-agent-builder::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (54 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery-agent-builder::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery-agent-builder::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (55 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery-agent-builder::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery-agent-builder::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (53 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::attack-discovery-agent-builder::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::attack-discovery-agent-builder::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (49 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::workflows::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::workflows::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (282 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::workflows::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::workflows::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (283 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::workflows::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::workflows::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (281 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::workflows::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::workflows::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (283 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::workflows::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::workflows::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (283 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::workflows::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::workflows::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (270 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::skill-selection-benchmark::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::skill-selection-benchmark::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (25 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::skill-selection-benchmark::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::skill-selection-benchmark::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (24 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::skill-selection-benchmark::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::skill-selection-benchmark::google-gemini-3.0-flash
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (25 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::skill-selection-benchmark::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::skill-selection-benchmark::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (25 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::skill-selection-benchmark::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::skill-selection-benchmark::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (25 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::skill-selection-benchmark::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::skill-selection-benchmark::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (25 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::endpoint::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::endpoint::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (66 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::endpoint::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::endpoint::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (66 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::endpoint::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::endpoint::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (67 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::endpoint::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::endpoint::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (67 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::endpoint::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::endpoint::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (67 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::endpoint::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::endpoint::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (66 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics-v2::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::entity-analytics-v2::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (100 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics-v2::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::entity-analytics-v2::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (100 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics-v2::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::entity-analytics-v2::google-gemini-3.0-flash
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (100 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics-v2::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::entity-analytics-v2::google-gemini-3.1-pro
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (100 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics-v2::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::entity-analytics-v2::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (100 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics-v2::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::entity-analytics-v2::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (94 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::detection-watch-rule-creation::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::detection-watch-rule-creation::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (22 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::detection-watch-rule-creation::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::detection-watch-rule-creation::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (23 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::detection-watch-rule-creation::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::detection-watch-rule-creation::google-gemini-3.0-flash
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (23 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::detection-watch-rule-creation::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::detection-watch-rule-creation::google-gemini-3.1-pro
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (22 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::detection-watch-rule-creation::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::detection-watch-rule-creation::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (23 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::detection-watch-rule-creation::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::detection-watch-rule-creation::openai-gpt-oss-120b
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (23 rows)
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics::anthropic-claude-4.6-opus | Baseline (main): bk-019ec894-2ea6-46b6-8f45-581d84147ea7::anthropic-claude-4.6-opus
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (28 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics::anthropic-claude-4.6-sonnet | Baseline (main): bk-019ec894-2ea6-46b6-8f45-581d84147ea7::anthropic-claude-4.6-sonnet
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (28 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics::google-gemini-3.0-flash | Baseline (main): bk-019ec894-2ea6-46b6-8f45-581d84147ea7::google-gemini-3.0-flash
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (30 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics::google-gemini-3.1-pro | Baseline (main): bk-019ec894-2ea6-46b6-8f45-581d84147ea7::google-gemini-3.1-pro
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (29 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics::openai-gpt-5.4 | Baseline (main): bk-019ec894-2ea6-46b6-8f45-581d84147ea7::openai-gpt-5.4
Summary View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (28 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::entity-analytics::openai-gpt-oss-120b | Baseline (main): bk-019ec894-2ea6-46b6-8f45-581d84147ea7::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (29 rows)
|
|
🧪 LLM eval (PR) — Security Entity Analytics ( Failing models:
Triage summary: Triage summary could not be generated: Triage model did not call the report_triage tool. See the suite owner notify Buildkite step for details. |
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::observability-ai::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::observability-ai::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (140 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::observability-ai::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::observability-ai::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (137 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::observability-ai::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::observability-ai::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (142 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::observability-ai::google-gemini-3.1-pro | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::observability-ai::google-gemini-3.1-pro
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) No significant changes (146 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::observability-ai::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::observability-ai::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (147 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::observability-ai::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::observability-ai::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (137 rows)
|
|
🧪 LLM eval (PR) — Agent Builder ( Failing models:
Triage summary: ERROR Error: Playwright exited with code 1
|
|
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::anthropic-claude-4.6-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::anthropic-claude-4.6-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (88 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::anthropic-claude-4.6-sonnet | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::anthropic-claude-4.6-sonnet
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (81 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::anthropic-claude-4.7-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::anthropic-claude-4.7-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (79 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::anthropic-claude-4.8-opus | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::anthropic-claude-4.8-opus
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (84 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::google-gemini-3.0-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::google-gemini-3.0-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (83 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::google-gemini-3.1-flash-lite | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::google-gemini-3.1-flash-lite
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (90 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::google-gemini-3.5-flash | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::google-gemini-3.5-flash
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (90 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::openai-gpt-5.2 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::openai-gpt-5.2
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (79 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::openai-gpt-5.4 | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::openai-gpt-5.4
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (80 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::openai-gpt-5.4-mini | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::openai-gpt-5.4-mini
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (82 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::openai-gpt-5.4-nano | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::openai-gpt-5.4-nano
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (82 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::openai-gpt-5.6-luna | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::openai-gpt-5.6-luna
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (70 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::openai-gpt-5.6-terra | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::openai-gpt-5.6-terra
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (89 rows)
PR run: bk-01a0951d-95bd-4b60-b1da-e440f89a96f4::significant-events::openai-gpt-oss-120b | Baseline (main): bk-01a07328-2f89-4201-93fc-e763ec8c96e7::significant-events::openai-gpt-oss-120b
Summary
View full comparison in UI | Refresh baseline against latest main (click Unblock in the eval build) Significant changes
No significant changes (45 rows)
|
|
🧪 LLM eval (PR) — Significant Events ( Failing models:
Triage summary: ERROR Error: Playwright exited with code 1
|
Closes https://github.com/elastic/observability-dev/issues/6094
Summary
The per-suite LLM triage in the evals CI notify step parsed the model's free-text reply with
JSON.parse. Any imperfection in that reply produced the same opaque fallback in Slack, the PR comment and the Buildkite annotation:Weekly builds 72 and 73 both lost some triages in this way.
Changes
Structured output via a forced tool call
report_triagetool whose parameters schema mirrors{ groups: [{ error, location, models, rootCause }] }.runTriageModelStructuredsends it withtool_choice: { type: 'function', function: { name: 'report_triage' } }, so the model must fill tool arguments rather than answer in text.buildOpenrouterChatRequestgains an options argument (tools,toolChoice,maxTokens). Defaults are unchanged, so the weekly cross-suite rollup (runTriageModel) still receives markdown bullets.