HiringSources
Remote Posted 1h ago

Remote Data Engineer - AI Data Platform Japan (Python)

SalesNow Inc. Remote Full-time via TopDev
$25.5M–63.8M / month
Apply at the original source (TopDev)

This role was aggregated from a partner source. You apply on their site.

About the role

Mô tả công việc Vì sao có vị trí này Thời kỳ doanh thu tăng tỷ lệ thuận với số lượng nhân sự đã kết thúc. Khi lực lượng lao động thu hẹp, mỗi người cần tạo ra nhiều giá trị hơn. SalesNow đã tái thiết kế tổ chức của chính mình trên nền tảng AI trước khi quy mô trở nên lớn. Chúng tôi đặt mục tiêu tăng ARR trên mỗi nhân viên lên gấp 10 lần trong 3 năm, tính từ tháng 11/2025. Chúng tôi đang tuyển Data Engineer thiết kế cách thu thập, tích hợp và cung cấp dữ liệu doanh nghiệp. Đội ngũ tại Việt Nam Hiện đã có 3 thành viên người Việt đang làm việc cùng chúng tôi. Chúng tôi dự định tuyển thêm 5〜10 người nữa trong thời gian tới. Bạn sẽ không phải là người Việt đầu tiên hay duy nhất: đội ngũ đã có sẵn, quy trình làm việc xuyên ngôn ngữ đã chạy, và bạn tham gia vào một tổ chức đang mở rộng chứ không phải một thử nghiệm. Bạn sẽ xây dựng gì: - Hồ sơ doanh nghiệp kết hợp thông tin tổng quan, tin tuyển dụng, IR, dịch vụ, công nghệ và công cụ đang dùng, quảng cáo, tổ chức và phòng ban, thông tin liên hệ — được đối chiếu và hợp nhất giữa các nguồn. - Tín hiệu nắm bắt động thái doanh nghiệp: tăng tuyển dụng, gọi vốn, mở chi nhánh, mở rộng ra nước ngoài, điều chỉnh giảm dự báo kinh doanh, dừng tin tuyển dụng. - Pipeline crawler điều phối bằng Airflow (MWAA) DAG, bao phủ 55 nguồn dữ liệu. - Nền tảng Databricks và Delta Lake xử lý dữ liệu qua ba lớp (thô, làm sạch, phục vụ), với định nghĩa job quản lý bằng Terraform. - Dữ liệu được cung cấp qua ứng dụng web SalesNow, tích hợp Salesforce và HubSpot, Data API, SalesNow MCP (dùng trực tiếp từ các AI agent như Claude và Cursor), và hỗ trợ triển khai AI. Your role & responsibilities Phạm vi thay đổi công việc phải đảm nhiệm: Có. *Thách thức kỹ thuật: Thu thập và nạp dữ liệu Thiết kế và triển khai hệ thống web scraping quy mô lớn, trích xuất dữ liệu có cấu trúc một cách ổn định từ nhiều nguồn khác nhau. Xây dựng pipeline tích hợp API cho các nguồn dữ liệu đối tác, kèm kiểm tra schema và phát hiện bất thường. Thiết kế pipeline nạp dữ liệu thời gian thực cho cập nhật hằng ngày, với mục tiêu độ trễ dưới một phút. Biến đổi và chất lượng dữ liệu Xây dựng và duy trì các model dbt chuyển dữ liệu thô sang schema thống nhất của SalesNow. Định nghĩa SLA chất lượng dữ liệu (độ chính xác, độ đầy đủ, độ mới) và xây dashboard giám sát cảnh báo trước khi khách hàng nhận ra vấn đề. Triển khai entity resolution và khử trùng lặp ở quy mô lớn: đối sánh bản ghi doanh nghiệp giữa các nguồn có định dạng, quy ước đặt tên và định danh khác nhau. Hạ tầng và điều phối Điều phối các Airflow DAG phức tạp xuyên suốt thu thập, biến đổi, làm giàu và phân phối dữ liệu. Tối ưu cụm PostgreSQL và Elasticsearch / OpenSearch (hơn 100 triệu document trong chỉ mục tìm kiếm) để truy vấn phản hồi ở mức mili giây. Thiết kế pipeline chịu lỗi, tự phục hồi sau sự cố, với khả năng quan sát rõ ràng ở mọi giai đoạn. Tích hợp AI pipeline Đưa dữ liệu có cấu trúc vào các RAG pipeline và hệ thống AI agent thông qua SalesNow MCP. Xây dựng lớp phân phối dữ liệu để AI agent truy vấn theo thời gian thực cho quy trình của khách hàng doanh nghiệp. Làm việc với Amazon Bedrock, Claude và Gemini để cải thiện cách hệ thống AI sử dụng dữ liệu doanh nghiệp có cấu trúc. Bài toán chúng tôi đang giải Xác định một tin tuyển dụng còn mở hay đã đóng. Logic phát hiện đóng tin hiện chia thành ba hệ thống và hành vi khác nhau tùy nguồn. Một số nguồn không hiển thị trạng thái đóng trên trang danh sách, nên phương pháp so sánh chênh lệch có thể đóng nhầm khi crawl bị lỗi tạm thời. Thiết kế quy trình thu thập thông tin website của mọi doanh nghiệp và theo dõi liên tục các thay đổi. Một lần rà soát chất lượng dữ liệu Khi để AI kiểm chứng độc lập logic suy luận doanh nghiệp khách hàng đứng sau các tin tuyển dụng freelance, chỉ 12 trên 100 trường hợp xác định được với bằng chứng rõ ràng. Chúng tôi đã sửa lại logic để chỉ kết luận khi có căn cứ. *Cách chúng tôi làm việc với AI: Mọi người đều dùng được Claude và Gemini. Chúng tôi cũng dùng Codex và chọn model theo từng loại công việc. Chúng tôi nhờ nhiều LLM review công việc, còn con người kiểm tra căn cứ và quyết định áp dụng hay không. Với kiểm tra dữ liệu, chúng tôi dùng LLM as a Judge theo tiêu chí do con người đặt ra. Sau khi thống nhất mục tiêu và ngân sách, người phụ trách tự quyết định cách tiến hành và dùng AI ở đâu. Mọi vị trí đều được kỳ vọng tự tái thiết kế công việc của mình bằng AI. Ban lãnh đạo của chúng tôi cũng viết code. *Môi trường làm việc xuyên ngôn ngữ: Rào cản ngôn ngữ đã được giải quyết bằng quy trình, không phải bằng nỗ lực cá nhân. PRD đầy đủ và chính xác . Công việc được giao kèm PRD, nên bạn biết rõ cần làm gì trước khi bắt đầu, và hai bên thống nhất được thời hạn. GitHub, Notion, Slack đều có dịch thuật. Pull request, tài liệu và trao đổi hằng ngày đều đi qua công cụ dịch, nên bạn đọc và viết bằng ngôn ngữ mình thoải mái nhất. Công cụ dịch AI do công ty chi trả. Thành viên không nói tiếng Nhật trao đổi công việc qua phiên dịch đồng thời bằng AI. Phỏng vấn cũng vậy. Kết quả: bạn dành thời gian cho thiết kế và code, không phải cho việc vật lộn với ngôn ngữ. Your skills & qualifications Ngôn ngữ: Python (FastAPI), SQL, Scala Biến đổi dữ liệu: dbt Điều phối: Airflow (MWAA) Xử lý dữ liệu: Databricks (Spark / Delta Lake), Scrapy Infrastructure as code: Terraform Cơ sở dữ liệu: PostgreSQL, Elasticsearch, OpenSearch Cloud: AWS (chính), Vercel AI/ML: Amazon Bedrock, Claude, Gemini Công cụ phát triển: Claude Code, Codex, Cursor, GitHub Copilot, CodeRabbit CI/CD: GitHub Actions Giao tiếp: Slack, GitHub, Notion Yêu cầu bắt buộc: Từ 2 năm kinh nghiệm data engineering chuyên nghiệp, xây dựng và duy trì pipeline dữ liệu chạy production (không phải đồ án học thuật hay PoC chưa từng triển khai). Thành thạo Python: viết code pipeline sạch, kiểm thử được. Thành thạo SQL: truy vấn phức tạp, window function, tối ưu truy vấn. Kinh nghiệm với ít nhất một công cụ điều phối: Airflow, Dagster, Prefect hoặc tương đương. Kinh nghiệm với cơ sở dữ liệu quan hệ ở quy mô lớn. Ưu tiên PostgreSQL; MySQL hoặc tương tự cũng được nếu bạn sẵn sàng học. Tiếng Anh đủ dùng trong công việc. Yêu cầu ưu tiên: Kinh nghiệm Elasticsearch hoặc OpenSearch ở quy mô lớn. Kinh nghiệm dbt. Web scraping hoặc hệ thống thu thập dữ liệu quy mô lớn. Kinh nghiệm với framework và giám sát chất lượng dữ liệu. Kinh nghiệm AWS (S3, Lambda, ECS, RDS, v.v.). Kinh nghiệm RAG pipeline hoặc vector database. Kinh nghiệm xử lý trên 1 triệu bản ghi mỗi ngày. Tiếng Nhật (JLPT N3 trở lên). Không bắt buộc, nhưng giúp bạn làm việc gần hơn với các đội business và mở rộng lựa chọn nghề nghiệp trong công ty. Chúng tôi tìm người như thế nào Bạn đồng cảm với sứ mệnh của SalesNow「誰もが活躍できる仕組みをつくる。」(Tạo ra cơ chế để ai cũng có thể phát huy năng lực) và các giá trị của chúng tôi (AI Native, Kotoshikou — hướng đến bản chất, và Chất lượng cao nhất). Bạn thích nhịp độ nhanh. Ngay cả khi mọi thứ thay đổi, bạn xuất phát từ mục đích, tìm ra vấn đề và theo đuổi đến khi giải quyết xong. Bạn làm việc với đồng đội và khách hàng bằng sự chính trực và tinh thần làm chủ. Bạn coi trọng chất lượng dữ liệu và bảo vệ nó bằng cơ chế, không chỉ bằng kiểm tra thủ công. Bạn đối chiếu kết quả của AI với bằng chứng trước khi áp dụng. Bạn giải thích được các quyết định thiết kế của mình, bao gồm cả chi phí, cho đồng nghiệp ở ngôn ngữ khác. Benefits for you Tại sao bạn sẽ yêu thích làm việc tại đây Tích lũy kinh nghiệm AI tại một công ty Nhật tự phát triển sản phẩm Đây không phải công ty outsourcing. Bạn xây dựng sản phẩm của chính công ty, cho thị trường Nhật Bản, và tự quyết định thiết kế. Kinh nghiệm đưa LLM vào quy trình xử lý dữ liệu production — vừa kiểm soát chi phí vừa kiểm soát độ chính xác — là thứ hiếm có ở bất kỳ đâu. Bạn sở hữu pipeline từ đầu đến cuối Bạn phụ trách trọn vẹn những phần quan trọng của pipeline. Các đội sales, chủ yếu ở doanh nghiệp lớn và công ty niêm yết, dùng chính dữ liệu đó để quyết định tiếp cận doanh nghiệp nào và vào lúc nào. Bạn quyết định thu thập gì, và dữ liệu phải chính xác đến mức nào thì mới dùng được. Làm việc hoàn toàn từ xa 100% remote. Làm việc từ Thành phố Hồ Chí Minh, Hà Nội, Đà Nẵng hay bất kỳ nơi nào có kết nối internet ổn định. Không yêu cầu lên văn phòng. Ngân sách AI mà bạn thực sự được dùng Chi tiêu cho công cụ AI trung bình trên 600 USD mỗi người mỗi tháng, do công ty chi trả. Đây là số tiền thực tế đã chi, không phải hạn mức trên giấy. Điều tạo ra khác biệt trong vài năm tới là năng lực thiết kế lại công việc bằng AI. Lương 1.000 – 2.500 USD mỗi tháng (25 – 62 triệu VND mỗi tháng), tùy kinh nghiệm và kỹ năng. Điều kiện làm việc: Hình thức: Toàn thời gian, làm việc từ xa thông qua EOR (Employer of Record) — hợp đồng lao động hợp pháp đầy đủ kèm phúc lợi tại địa phương. Giờ làm việc: Giờ cốt lõi 10:00〜19:00 giờ Nhật Bản, tương đương 8:00〜17:00 giờ Việt Nam. Ngoài giờ cốt lõi là flextime. Ngày nghỉ lễ theo lịch Việt Nam. Bạn nghỉ theo các ngày lễ của Việt Nam (Tết Nguyên Đán, Giỗ Tổ Hùng Vương, 30/4, 1/5, Quốc khánh 2/9), không phải theo lịch Nhật Bản. Nghỉ phép: Theo luật lao động Việt Nam. Phạm vi thay đổi địa điểm làm việc: Không có. Hình thức làm việc: Hoàn toàn từ xa. Các vị trí product tại SalesNow (engineering, product management, design) đều làm việc hoàn toàn từ xa. Địa điểm: 100% từ xa. Phúc lợi Công cụ AI: chi tiêu trung bình trên 600 USD mỗi người mỗi tháng (công ty chi trả). Công cụ dịch thuật AI cho giao tiếp xuyên ngôn ngữ (công ty chi trả). Thiết bị làm việc do công ty cấp. Quy trình tuyển dụng 1. Xét hồ sơ (CV + trả lời ngắn 3 câu hỏi kỹ thuật). 2. Ngày tuyển chọn tập trung, tổ chức trực tuyến trong một ngày: bài tập về data pipeline theo tình huống thực tế (2-3 giờ), phỏng vấn kỹ thuật (60 phút) về bài tập và kinh nghiệm của bạn, và trao đổi với engineering lead (30 phút). 3. Offer. Chúng tôi đưa ra offer sau ngày tuyển chọn. Thời gian: khoảng 2 tuần từ khi ứng tuyển đến khi nhận offer, với ngày tuyển chọn diễn ra trong một ngày. Chúng tôi là nhà tuyển