Deep Learning Software Engineer
Current• Developed Xeon projections for large language models like GPT-J, ChatGLM, and LLaMA-2 70B, using Python.• Engineered optimization in tensor layouts, enhancing memory utilization in dense layers of large language models from 60% to 90% of STREAM bandwidth, leading to marked improvements in model performance for real-time token generation.• Collaborated closely with the hardware team to diagnose and resolve issues in MHA kernels and enhance uncore scaling.• Developed projections for TransformerLT performance on Intel CPUs, playing a pivotal role in the advancement of hardware-software co-design strategies.