01
Algorithm Engineer
Responsibilities
- Turn existing raw/business data (documents, tables, system fields, logs, conversations, labeled data) into trainable, iterable domain datasets: clean → structure → label/weak-label → instructionize.
- Design training-data standards: instruction templates (single/multi-turn), tool-call formats, structured output schemas (JSON/table fields), refusal and boundary samples, hard cases and contrast sets.
- Build data-quality systems: dedup (semantic/fingerprint), noise filtering, sensitive-data handling, distribution stats, coverage analysis; produce measurable quality reports and improvements.
- Organize labeling and review (with business/ops/experts): guidelines, sampling rules, consistency checks; turn human experience into executable standards.
- Use models to speed work without trusting them blindly: rewriting, expansion, synthesis, first-pass labeling, hard-case mining, plus human review and alignment rules.
- Work with fine-tuning engineers to iterate data from training/eval feedback (fill gaps, add hard cases, fix templates, rebalance) so gains land on the data.
- Manage dataset assets with versioning, traceability, and rollback (data cards, change logs, samples, eval/control sets).
Requirements
- Bachelor’s or above; 2–5 years in data processing / NLP / ML engineering. End-to-end experience from raw data to trainable data is preferred.
- Data and engineering skills (~70%)
- Strong Python (pandas/pyarrow/regex/json) and SQL; can write stable ETL, cleaning, and sampling scripts.
- Text processing and QC: sentence split, token-length control, near-dup, anomaly detection, distribution stats.
- Data versioning hygiene: naming, folders, metadata, change logs, reproducibility.
- LLM training-data literacy (~30%)
- Understand instruction-tuning essentials: task definition, I/O boundaries, format constraints, multi-turn consistency, domain terms and factuality.
- Can design eval/regression sets covering core tasks, boundaries, hard cases, and controls.
- Know common alignment issues and data responses: hallucination control, refusal policy, style consistency, tool-call constraints.
- Communication and abstraction: turn experts’ spoken rules into trainable schemas, taxonomies, and sample rules; drive cross-team data delivery.
Nice to have
- Built labeling/QC systems or used mainstream annotation tools and workflows.
- Organized knowledge bases/graphs or enterprise field systems (business language → data language).
- Familiar with multimodal data organization for LLM training (if we expand later).
- Industry compliance/desensitization practice (audit trails, permission tiers, sensitive-field policy).