Back to search
广东凯通科技股份有限公司 Linkedin · Posted 2mo ago

软件开发工程师(LLM)

Shenzhen

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

该职位来源于猎聘 岗位职责: 1.负责基于C++和Python的AI推理工程化代码开发,将主流开源大模型(如LLaMA、Qwen、Deepseek等)部署到公司NPU芯片上,实现高性能、低延迟的推理服务。 2.深入理解llama.cpp等开源推理框架的架构,分析其在CPU/GPU上的运行机制,并将相关推理流程迁移或适配到NPU平台,包括模型加载、算子映射、内存管理和流水线调度。 3.基于对Transformer模型(Attention、FFN、LayerNorm、位置编码等核心模块)的充分理解,完成模型在NPU上的推理正确性验证与端到端功能对齐,确保精度符合预期。 4.使用TensorRT(或类似推理后端)作为参考基准,对比分析NPU推理的性能与精度,定位部署过程中的算子不兼容、显存(或NPU内部存储)瓶颈等问题。 5.设计与实现NPU推理服务的高层封装(Python API / RESTful接口),支持动态batch、多流并发、模型热更新等生产环境特性。 6.编写NPU部署相关技术文档,包括模型转换流程、算子支持列表、性能调优指南,并协助测试团队完成稳定性与压测。 任职要求: 1. 语言能力:(1)熟悉C/C++:能高效编写底层推理调度代码,熟悉内存池、多线程同步、跨平台编译(交叉编译经验更佳),具备跨平台(windows/linux)开发经验。(2)熟悉Python:熟悉 transformers、accelerat库能够使用 sentencepiece / tokenizers 库完成大模型文本预处理与后处理(包括特殊 token、padding、attention mask);了解 ONNX Runtime / OpenVINO 等后端的 Python API,便于与 TensorRT 或 NPU SDK 进行基准对比。 2. llama.cpp架构:熟悉llama.cpp的核心组件,ggml张量库、量化方法(Q4_K/ Q5K / Q8_0等)、KV Cache管理;有实际修改llama.cpp源码或将其某个模型推理流程移植到其他硬件(如NPU、DSP、FPGA)的经验者优先。 3. 大模型知识:深入理解Transformer模型结构,Multi-Head Attention、Feed-Forward、残差连接、LayerNorm、Rotary位置编码;清楚大模型推理的关键KV Cache大小随序列长度线性增长、首token延迟与生成token吞吐的权衡;了解常见量化方法(INT8/INT4)对推理精度和存储的影响等。 4. TensorRT相关知识:熟悉TensorRT的基本使用流程:ONNX → TensorRT engine → 推理运行;能够解析TensorRT的层融合日志和性能分析报告,用于对标NPU推理能力(例如:某算子在TensorRT上延迟为ms,在NPU上需达到接近水平);了解TensorRT中的动态shape、显存复用等技术思路,可借鉴到NPU推理优化中。 5.AI工具:熟悉Ai工具的使用,具备skill/prompt等编写能力,善于利用ai进行编码以及解决实际问题的能力。

Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search