Remplace TechStepClassifierService's node-nlp (NlpManager) par services/tech-step-intent-service, un microservice FastAPI/spaCy dedie (PhraseMatcher pour le NER par synonymes, textcat pour la classification d'intention). Corpus (TECH_STEP_TRAINING_DATA) toujours possede par apps/api, pousse au service via POST /v1/train a chaque warm-up ; le service ne touche jamais Postgres (meme posture que services/tech-step-llm-worker). Cote apps/api : - intent-service-client.ts : client HTTP vers le nouveau service - tech-step-matcher.ts : delegue NER + intent classification au client, logique pure (splitIntoClauses, seuil/fallback) inchangee - env.ts : INTENT_SERVICE_BASE_URL/INTENT_SERVICE_SECRET (secret requis, service coeur non optionnel) - server.ts : warm-up avec retry/backoff (service Python demarre a part) - scripts/calibrate-tech-step-threshold.ts : recalibration empirique de CONFIDENCE_THRESHOLD contre le jeu d'eval existant - node-nlp retire (package.json, node-nlp.d.ts, model.nlp du .gitignore) docker-compose.yml : nouveau service tech-step-intent-service (pas de port expose, healthcheck, app en depend). CI : job intent-service-test (pytest) + le job test demarre le service en arriere-plan avant la suite Mocha (jamais de mock d'un service interne, cf specs/dev-conventions.md). Verifie : 26/26 tests pytest du service (dont les offsets caracteres exacts de tech-step-matcher.test.ts), lint + build complets du monorepo, smoke test HTTP reel bout en bout. La suite Mocha et docker compose build/up n'ont pas pu etre executes dans cet environnement (pas de Postgres/Docker disponibles ici) — a confirmer via la CI et en local. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
48 lines
2.3 KiB
Python
48 lines
2.3 KiB
Python
"""Détient un `LocalePipeline` par locale supportée — le seul état mutable
|
|
partagé du process (une instance vit pour toute la durée de vie d'`uvicorn`,
|
|
montée sur `app.state`, voir `main.py`).
|
|
|
|
Volontairement une classe "registre" séparée de `LocalePipeline` lui-même :
|
|
`LocalePipeline` ne connaît qu'une seule locale, ce module route
|
|
`train`/`process` vers la bonne instance selon le `locale` reçu dans la
|
|
requête — même séparation de responsabilité que `TechStepClassifierService`
|
|
(une seule instance, un seul `NlpManager` multi-langues) avait implicitement
|
|
via node-nlp, explicitée ici puisque spaCy charge un modèle par langue.
|
|
"""
|
|
|
|
from .locale_pipeline import SUPPORTED_LOCALES, LocalePipeline, ProcessResult, TrainEntry, UnsupportedLocaleError
|
|
|
|
|
|
class PipelineRegistry:
|
|
def __init__(self) -> None:
|
|
self._pipelines: dict[str, LocalePipeline] = {
|
|
locale: LocalePipeline(locale) for locale in SUPPORTED_LOCALES
|
|
}
|
|
|
|
def preload_all(self) -> None:
|
|
"""Charge le modèle spaCy de base de chaque locale connue — appelé
|
|
une fois au démarrage du process (`main.py`), pas paresseusement au
|
|
premier appel, pour que `GET /health` ne réponde `200` qu'une fois
|
|
ce coût payé (voir `LocalePipeline.preload`)."""
|
|
for pipeline in self._pipelines.values():
|
|
pipeline.preload()
|
|
|
|
def train(self, locale: str, entries: list[TrainEntry]) -> tuple[int, int, int]:
|
|
pipeline = self._pipelines.get(locale)
|
|
if pipeline is None:
|
|
raise UnsupportedLocaleError(f"Unsupported locale: {locale!r}")
|
|
return pipeline.train(entries)
|
|
|
|
def process(self, locale: str, text: str) -> ProcessResult:
|
|
pipeline = self._pipelines.get(locale)
|
|
if pipeline is None:
|
|
# Une locale que ce service ne sait structurellement pas
|
|
# charger (pas de modèle spaCy connu) se comporte comme une
|
|
# locale "jamais entraînée" côté `process` — reproduit le test
|
|
# `apps/api` existant ("returns an empty sequence for a locale
|
|
# nothing was trained on"), qui ne distingue pas les deux cas.
|
|
return ProcessResult(entities=[], intent=None, score=0.0)
|
|
return pipeline.process(text)
|
|
|
|
|
|
registry = PipelineRegistry()
|