AI智能体评测工程师
Indexed description
用微信扫描二维码
可分享职位给微信好友或朋友圈
平安银行-AI智能体评测工程师
城市: 深圳市 经验要求: 3年 招聘人数: 1人 9天前
岗位职责:
- 1. 构建智能化全维评估体系
- (1)体系设计: 主导搭建面向多任务、多模态(文本/视觉/代码)的大模型及智能体自动化评估框架,定义标准化的性能指标(如准确性、鲁棒性、响应延迟、资源消耗)。
- (2)场景覆盖: 深度覆盖逻辑推理、长文本摘要、复杂指令遵循、多轮对话保持等核心场景,通过量化数据精准刻画模型能力边界。
- 2. 深化安全合规与红蓝对抗 (Security & Red Teaming)
- (1)主动防御: 建立金融级 AI 安全合规基线,实施全周期的内容风控测试,精准识别偏见歧视、幻觉生成、敏感数据泄露及隐私侵犯风险。
- (2)对抗演练: 主导红队演练(Red Teaming)与对抗样本攻击测试,模拟极端恶意输入,挖掘模型潜在漏洞,提升系统在复杂对抗环境下的鲁棒性与内容可控性。
- 3. 研发 AI 效能引擎与自动化平台 (AI Efficiency Engine)
- (1)平台构建: 主导/参与 AI 自动化评测平台的研发,探索“以 AI 评测 AI”的创新模式,利用大模型生成测试用例、自动打分及反馈报告,实现评测闭环
- "1. 教育背景与经验
- (1)计算机、人工智能、软件工程、数学或相关专业本科及以上学历。
- (2)3年以上软件测试/QA经验,其中至少 1-2年 专注于 LLM、NLP 或智能体(Agent)评测领域。
- (3)有金融、风控、安全领域 AI 项目落地经验者优先,具备极强的合规意识。
- 2. 硬核技术技能 (Hard Skills)
- (1)编程与自动化: 精通 Python,具备扎实的自动化测试框架开发能力(Pytest);具备 Java 代码阅读能力,能与后端研发无缝协作。
- (2)LLM 原理与架构: 深入理解 Transformer 架构、预训练/微调(Pre-training/Fine-tuning)、上下文学习(In-Context Learning)及推理优化机制;熟悉主流大模型 API 特性及局限性。
- (3)智能体技术栈: 深刻理解 Agent 工作流(ReAct, Chain-of-Thought),熟悉任务规划、工具调用(Tool Calling)、记忆机制及多步推理逻辑。
- (4)安全攻防知识: 熟悉常见大模型攻击向量(Pro
收藏职位
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search