Rodeo
Get started

Braintrust

Principal Coding Annotator / LLM Evaluation Engineer

London
Posted 1 day ago
Sign up to applySee more jobs like this

How your CV stacks up

1Upload CV
2Analyse CV
3Improve CV

Upload your CV to see how well it fits this job role

?%

Contrat de 6 mois avec possibilité de prolongation

Lieu: Poste basé à Paris ou Londres de préférence; possibilité de télétravail en Europe pour les candidats les plus qualifiés.

Nous développons et évaluons des modèles de langage de grande taille (LLM) de pointe et recherchons des ingénieurs logiciels expérimentés pour rejoindre notre équipe d'évaluation et d'annotation. Ce poste se situe à l'intersection du génie logiciel, de l'évaluation de modèles et de l'IA appliquée, et est essentiel à l'amélioration de la fiabilité des modèles, du raisonnement et de la qualité du code.

Vous concevrez des tâches de programmation stimulantes, évaluerez les résultats des modèles par rapport à des benchmarks rigoureux, identifierez les modes de défaillance et contribuerez aux processus d'apprentissage par renforcement et d'amélioration des modèles.

Ce poste ne s'adresse pas aux annotateurs juniors. Nous recherchons des professionnels possédant une solide expérience pratique en programmation, capables d'adopter une approche à la fois ingénieure et évaluatrice.

Reasons to use Rodeo

I’m in my final year doing Economics and I don’t know whether to apply for grad schemes now or do a masters first. What do you think?

Honest answer — it depends on where you want to end up. A lot of top grad schemes (Big 4, civil service, banking) don’t need a masters. Let’s look at the ones you’d be competitive for now, and we can decide if a masters actually adds anything.

Also worth knowing: most autumn 2026 applications are open now. Timing matters more than you think.

Start with a chat, not a search bar

Grad scheme, placement, apprenticeship? Not sure what you want yet — that's fine. Your agent talks it through with you and turns "I have no idea" into a shortlist.

P

Graduate Consultant — 2026 Scheme

PwC·London, UK
£35,000/yr

Why you're a good match

Strong

Your economics background and your summer at a regional bank line up with what PwC looks for on the consulting scheme. Applications close in four weeks.

See breakdown
Save jobNot relevant
View details

It searches the market for you

Every day your agent scans the market matching roles against what actually matters to you, not just keywords on a CV.

Why you're a good match

You’ve got the grades and the economics background, and your bank internship is exactly the experience this scheme looks for. Apply soon — deadlines close within the month.

See breakdown
Strong

Experience fit

Your summer at the bank plus your econometrics coursework map directly to the day-one responsibilities on this scheme — client modelling, market briefings, and deal support.

See breakdown
Strong

Only hits

No noise. No "maybe this fits." Just roles with a clear explanation of why they're right — and where to focus when applying.

Vos Missions

  • Créer des consignes de programmation et des réponses de référence de haute qualité (de type benchmark, par exemple des problèmes similaires à SWE-Bench).
  • Évaluer les résultats des modèles de langage (LLM) pour la génération de code, la refactorisation, le débogage et l'implémentation.
  • Identifier et documenter les défaillances des modèles, les cas limites et les lacunes de raisonnement.
  • Effectuer des évaluations comparatives directes entre les LLM privés (basés sur Mistral) et les principaux modèles externes.
  • Concevoir ou configurer des environnements de développement pour l'évaluation et l'apprentissage par renforcement (RL).
  • Suivre rigoureusement les directives d'annotation et d'évaluation.

Profil Recherché

Get help with your application

Your very own career expert that helps elevate your application to the next level.

Get help applying for this job
  • Plus de 10 ans d'expérience professionnelle en développement logiciel.
  • Excellente maîtrise de Python (obligatoire).
  • Connaissance d'au moins un autre langage de programmation (un atout).
  • Au moins un an d'expérience en annotation de code et/ou en évaluation de LLM (temps partiel possible) au sein d'un laboratoire d'IA de pointe ou d'une entreprise d'infrastructure d'IA.
  • Une expérience en revue de code est un plus.
  • Capacité avérée à appliquer des critères d'évaluation structurés et à rédiger des retours techniques clairs.
  • Maîtrise de l'anglais (écrit et oral).
  • Une expérience en gestion d'équipe ou en mentorat est un atout majeur.

Pourquoi ce poste?

  • Travaillez concrètement avec des LLM de pointe.
  • Appliquez votre expertise d'ingénieur à l'évaluation et à l'amélioration des modèles.
  • Contribuez à un travail technique à fort impact au sein d'une équipe senior spécialisée.
Trusted by 25,000+ job seekers

“It took my CV and asked me questions relevant to understanding what kind of jobs to suggest for me. Suggestions were almost perfect. Jobs were exactly what I’ve been looking for.”

Jessica, London

Get help applying for this job

Skills

Python
LLM Evaluation
Coding Annotation
Software Development
Code Review
Reinforcement Learning
Technical Feedback
Benchmarking

Location

London, England, United Kingdom

Sign up to applySee more jobs like this