Systems Administration SME – Research AI & Applications
Systems Administration SME Research AI & Applications<br><br><strong>Location:</strong> Cambridge, MA Hybrid (3 days onsite/week)<br><br><strong>Type:</strong> Contract<br><br><strong>Job Summary<br><br></strong>We are seeking a hands-on <strong>Systems Administration SME</strong> to support the secure, reliable, and compliant operation of cloud-hosted research applications, AI systems, and scientific SaaS platforms. The role will work across <strong>GCP, AWS, containers, APIs, AI/agentic systems, scientific databases, and third-party platforms</strong>, partnering with IT, developers, scientists, cybersecurity, and vendors.<br><br><strong>Key Responsibilities<br><br></strong><ul><li>Administer GCP, AWS, and SaaS environments, including IAM, networking, storage, compute, quotas, and access controls.</li><li>Manage Cloud Run, Docker/containers, Artifact Registry, DNS, TLS, load balancing, and IAP.</li><li>Support SaaS integrations, APIs, service accounts, secrets, credentials, and least-privilege access.</li><li>Maintain container images, dependencies, CI/CD pipelines, and infrastructure-as-code with proper security and rollback controls.</li><li>Monitor logs, metrics, alerts, system performance, AI/model failures, and cloud usage/costs.</li><li>Troubleshoot production issues, support incident/root-cause analysis, backups, recovery, and disaster recovery.</li><li>Maintain runbooks, documentation, audit trails, and operational processes using ServiceNow and Jira.</li><li>Support security, vulnerability remediation, compliance, and transition of research prototypes into secure production environments.<br><br></li></ul><strong>Required Qualifications:<br><br></strong><ul><li>Bachelor s degree in Computer Science, IT, Engineering, or related field.</li><li>8+ years of production systems administration experience in GCP, AWS, Azure, or similar cloud environments.</li><li>5+ years of experience with Linux, Docker/containers, Python environments, APIs, networking, DNS, TLS, IAM, secrets management, and Kubernetes/Cloud Run.</li><li>Strong knowledge of CI/CD, Infrastructure as Code, monitoring, incident management, backup/recovery, patching, and vulnerability remediation.</li><li>Experience with ServiceNow and Jira.</li><li>Experience with GCP services such as Cloud Run, IAP, Secret Manager, Artifact Registry, Cloud Monitoring, Gemini/Vertex AI is highly desirable.</li><li>Scientific computing, bioinformatics, laboratory automation, research data platforms, or scientific SaaS experience is a plus.<br><br></li></ul><strong>Must be willing to work onsite in Cambridge, MA 3 days per week.</strong>