In my freelance AI evaluation and adversarial testing work, I evaluate multilingual AI responses and test LLMs with jailbreaks, prompt injections, and edge cases. I report vulnerabilities, unsafe outputs, and reasoning failures through structured feedback and risk analysis.
As an AI Quality & Evaluation Analyst, I supported Polish and English model development and evaluated conversational and multimodal systems, including Grok, Gemini, and Midjourney. I also built English-language evaluation frameworks for adversarial testing and structured AI assessment.

