Principal Machine Learning Engineer, Large Language Models
Published in SambaNova Systems, 2024
- Research and production deployment of LLM inference optimization techniques, including KV cache optimization, speculative prefill and decoding, prompt compression, test-time adaptation, and latency optimization (TTFT/TPOT).
- Developed agentic AI systems for enterprise applications, spanning context engineering, memory architectures, agent frameworks, and enterprise onboarding, in collaboration with Stanford University.
