open-swe/tests/test_team_settings_grouping.py
Adam Moussa 1c93e5c62b
feat: switch model providers to AWS Bedrock (Claude) and Fireworks (non-Claude)
Migrate off direct provider APIs: AWS Bedrock for Anthropic/Claude via the
cross-region inference profile us.anthropic.claude-opus-4-8, Fireworks AI for
all non-Claude models. Drop OpenAI (gpt-5.5) and Google (gemini-3.5-flash)
entirely. DEFAULT_MODEL_ID is now Bedrock Claude; all Fireworks models stay
freely selectable for the agent and reviewer graphs and via team/profile
defaults.

- pyproject: add langchain-aws (ChatBedrockConverse + boto3)
- options.py: Bedrock Claude entry + default; remove openai/google entries
- model.py: bedrock_converse provider_model_kwargs (effort -> thinking budget),
  region pin in make_model, bedrock<->fireworks fallback pairing, AWS_REGION/
  FIREWORKS_API_KEY local-dev validation
- server.py: provider-aware fallback kwargs build
- sanitize_thinking_blocks: also sanitize ChatBedrockConverse thinking blocks
- model_fallback: treat transient botocore ClientError codes as fallback-worthy
- eval_jobs: repoint hardcoded eval model id to Bedrock Claude
- tests: repoint dropped model ids; drop obsolete google test module
2026-06-29 14:57:14 -04:00

83 lines
2.7 KiB
Python

from __future__ import annotations
from unittest.mock import AsyncMock, patch
import pytest
from pydantic import ValidationError
from agent.dashboard.team_settings import (
TeamSettingsUpdate,
get_team_default_grouping_model,
)
_REVIEWER_SUBAGENT_PAIR = ("fireworks:accounts/fireworks/models/deepseek-v4-pro", "low")
_GROUPING_PAIR = ("fireworks:accounts/fireworks/models/kimi-k2p7-code", "low")
def _settings(**overrides: object) -> dict[str, object]:
base: dict[str, object] = {
"default_reviewer_subagent_model": _REVIEWER_SUBAGENT_PAIR[0],
"default_reviewer_subagent_reasoning_effort": _REVIEWER_SUBAGENT_PAIR[1],
"default_grouping_model": None,
"default_grouping_reasoning_effort": None,
}
base.update(overrides)
return base
@pytest.mark.asyncio
async def test_grouping_inherits_reviewer_subagent_when_unset() -> None:
with patch(
"agent.dashboard.team_settings.get_team_settings",
new_callable=AsyncMock,
return_value=_settings(),
):
assert await get_team_default_grouping_model() == _REVIEWER_SUBAGENT_PAIR
@pytest.mark.asyncio
async def test_grouping_uses_configured_model_when_set() -> None:
with patch(
"agent.dashboard.team_settings.get_team_settings",
new_callable=AsyncMock,
return_value=_settings(
default_grouping_model=_GROUPING_PAIR[0],
default_grouping_reasoning_effort=_GROUPING_PAIR[1],
),
):
assert await get_team_default_grouping_model() == _GROUPING_PAIR
@pytest.mark.asyncio
async def test_grouping_inherits_when_configured_model_invalid() -> None:
with patch(
"agent.dashboard.team_settings.get_team_settings",
new_callable=AsyncMock,
return_value=_settings(
default_grouping_model="bogus:model",
default_grouping_reasoning_effort="high",
),
):
assert await get_team_default_grouping_model() == _REVIEWER_SUBAGENT_PAIR
def test_team_settings_update_accepts_grouping_pair() -> None:
update = TeamSettingsUpdate(
default_grouping_model=_GROUPING_PAIR[0],
default_grouping_reasoning_effort=_GROUPING_PAIR[1],
)
assert update.default_grouping_model == _GROUPING_PAIR[0]
assert update.default_grouping_reasoning_effort == _GROUPING_PAIR[1]
def test_team_settings_update_rejects_grouping_effort_without_model() -> None:
with pytest.raises(ValidationError):
TeamSettingsUpdate(default_grouping_reasoning_effort="high")
def test_team_settings_update_rejects_unsupported_grouping_effort() -> None:
with pytest.raises(ValidationError):
TeamSettingsUpdate(
default_grouping_model=_GROUPING_PAIR[0],
default_grouping_reasoning_effort="max",
)