Docker etant redevenu disponible dans cette session, j'ai pu lancer pour de vrai la suite Mocha d'apps/api (334/334, y compris les tests Phase 1/2 qui n'avaient pu etre executes precedemment) ainsi que les scripts de la Phase 5 contre une vraie base de test. - tech-step-eval-dataset.ts : corrige un vrai bug d'auteur - "Take the plates..." collisionnait avec le synonyme anglais enregistre "plates" (technique plate), invalidant ce cas negatif. Remplace par "dishes". - tech-step-eval-runner.ts : F1 reel mesure = 0.815 (33 TP / 9 FP / 6 FN). Documente ce chiffre et les vraies erreurs de classification decouvertes (ex: "Blanchissez les haricots verts..." classifie a tort comme "peel") - des faiblesses reelles du classifieur que ce harness est cense detecter, pas a masquer en ajustant le jeu de test. - retrain-tech-steps.ts : le script loggait `appliedIds.length`/ `rejectedIds.length` (ce qui a ete demande) au lieu du `count` reel retourne par `updateMany` (ce qui a vraiment ete modifie) - un id inexistant faisait afficher un faux succes. Decouvert en executant le script pour de vrai avec des ids partiellement invalides. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> |
||
|---|---|---|
| .. | ||
| prisma | ||
| src | ||
| test | ||
| test-support | ||
| .env.example | ||
| .env.test.example | ||
| .mocharc.json | ||
| Dockerfile | ||
| package.json | ||
| tsconfig.json | ||