Claude ควบคุม Chrome อัตโนมัติได้แล้ว! ดาวน์โหลดไฟล์-กรอกฟอร์มแทนคนเลย
เบื่อไหมกับการที่ต้องมานั่งดาวน์โหลดไฟล์ทีละเยอะๆ หรือนั่งหลังขดหลังแข็งกรอกฟอร์มเป็นสิบๆ อัน? ในคลิปนี้ผมจะมาแชร์ฟีเจอร์เด็ดของ Claude AI ที่ตอนนี้เก่งขึ้นมาก!
"Claude สามารถเข้าไปสั่งงาน Google Chrome ในเว็บไซต์ของเรา เข้าเว็บ ทำนู่นทำนี่ ควบคุมเบราว์เซอร์อัตโนมัติได้เหมือนคนเลย" — [หมาก ดิจิทัล, Claude ควบคุม Chrome อัตโนมัติได้แล้ว! ดาวน์โหลดไฟล์-กรอกฟอร์มแทนคนเลย, 00:00:05]
(เมื่อบ่ายวานนี้ผมมีงานต้องดาวน์โหลดไฟล์วิดีโอกับเอกสาร 16 ไฟล์จากหน้าเว็บพร้อมกรอกฟอร์มเข้าระบบ เลยลองต่อ Claude Desktop ผูกเข้ากับ Chrome Extension ปล่อยให้มันคุมเมาส์คลิกเอง แล้วผมก็นั่งจิบกาแฟดูมันทำงานเพลินเลยครับ 555)
Note 1: นี่ไม่ใช่แค่การทำ Web Scraping หรือรัน Selenium สคริปต์แบบเดิมๆ แต่เป็นการยกระดับเป็น Vision-based Agentic Browser Control ที่ AI มองเห็น DOM, วิเคราะห์ Layout หน้าเว็บ และตัดสินใจกด Action ตาม Context จริงแบบ Real-time
Note 2: จุดเปลี่ยนสำคัญของการให้อำนาจ AI ควบคุมเบราว์เซอร์ คือเรื่องความรับผิดชอบและความปลอดภัย (Safety Protocol) เพราะถ้าปล่อยให้ Agent ทำงานโดยไม่มีระบบ Guardrails คอยกั้น การกรอกข้อมูลหรือกดปุ่มผิดในระบบ Production อาจสร้างความเสียหายระดับประเมินค่าไม่ได้
Native Agent Setup: ผสาน Claude Desktop เข้ากับ Chrome Extension
การจะสั่งให้ AI ทำงานบนเบราว์เซอร์แทนเรา ไม่ได้ใช้แค่หน้าต่างแชตบนเว็บ แต่ต้องเชื่อมต่อ Environment ระหว่างเครื่อง Local กับ Browser เข้าด้วยกัน [00:00:37]
- ติดตั้ง Claude Desktop บนเครื่องแล้วผูกเข้ากับ Claude in Chrome ผ่าน Chrome Web Store เพื่อเปิดทางให้โมเดลควบคุมเบราว์เซอร์ได้โดยตรง [00:01:04]
- ระบบเปิดให้สั่งงานข้ามแท็บ ไม่ว่าจะให้เข้าไปกวาดสรุปข่าวเทคโนโลยีล่าสุด หรือสั่งงานผ่าน Workspace ของ Claude Cowork [00:02:43]
- เปิดฟังก์ชัน Connector ใน Claude Cowork เพื่อให้อินสแตนซ์มองเห็นหน้าต่าง Chrome และเริ่มรับคำสั่งงานแบบ Multi-step [00:05:30]
เหมือนกับที่ระบบปฏิบัติการต้องมี Driver เพื่อเชื่อมต่อฮาร์ดแวร์ภายนอก ตอนนี้ LLM ก็ต้องมี Browser Extension เป็นสะพานเชื่อมเข้าสู่โลกของเว็บแอปพลิเคชัน
Autonomous Task Execution: ดาวน์โหลดไฟล์และสกัดข้อมูลอัตโนมัติ
งานประเภท Routine ซ้ำซากที่ต้องเปิดทีละลิงก์เพื่อบันทึกไฟล์ สามารถส่งต่อให้ Agent จัดการแบบ End-to-End ได้ทันที [00:05:06]
- สั่งงานด้วย Prompt สั้นๆ ให้กวาดดาวน์โหลดไฟล์วิดีโอและเอกสาร 16 ชิ้นตามรายการลิงก์ โดย Agent จะเปิดแท็บและคลิกปุ่มดาวน์โหลดเองทีละหน้า [00:06:12]
- ตัวโมเดลสามารถตรวจจับประเภทไฟล์ได้อัตโนมัติ พร้อมแจ้งเตือนเมื่อเจอบางแพลตฟอร์มที่ไม่รองรับการดึงไฟล์ตรง [00:06:56]
- เราคาดหวังว่า AI จะทำงานแทนเราได้สมบูรณ์แบบ 100% ทันที... แต่ความเป็นจริงคือยังต้องมีกระบวนการ Verification ตรวจสอบจำนวนและความถูกต้องของไฟล์หลังจบ Task เสมอ [00:07:26]
Human-in-the-Loop & Data Cleaning: กรอกฟอร์มแบบปลอดภัยด้วย CSV Pipeline
ความแตกต่างระหว่างการอ่านข้อมูลกับการเขียนข้อมูลลงระบบ คือระดับความเสี่ยงทางธุรกิจที่ต่างกันอย่างมหาศาล [00:08:23]
- ปรับโหมดการทำงานจาก "Act without asking" เป็น "Asking before acting" เพื่อบังคับให้ Agent ขอการ Approve จากคนก่อนกดปุ่ม Submit ข้อมูลสำคัญ [00:08:52]
- ใช้ไฟล์
.csvป้อนข้อมูลเข้าสู่ Agent แทนไฟล์ PDF หรือ Excel ขนาดใหญ่ ช่วยลดการบริโภค Token และประมวลผลได้แม่นยำกว่าอย่างเห็นได้ชัด [00:11:47] - สั่งให้ Claude Cowork ทำ Data Cleaning สกัดคำผิดและจัดระเบียบตารางฟีดแบ็กลูกค้าก่อนนำค่าไปกรอกลง Google Forms อัตโนมัติ [00:13:07]
ผมเข้าใจดีว่าหลายท่านมองว่าการปล่อยให้ AI มาแย่งคุมเมาส์และหน้าจอเป็นเรื่องที่ยังน่ากังวลเรื่องความปลอดภัย... แต่สิ่งที่ต้องพูดถึงคือความเร็วในการปลดล็อกงานเอกสารซ้ำซากที่กินเวลาวันละหลายชั่วโมงให้กลายเป็นระบบกึ่งอัตโนมัติ
ถ้าเราเริ่มตอนที่ทุกบริษัทปรับกระบวนการ Data Entry เป็น Autonomous Agent กันหมดแล้ว ก็ไม่ทันคนที่นำ Browser Automation มาลดต้นทุนการทำงานตั้งแต่ Day 1
Jensen จินตนาการว่าในอนาคต ซอฟต์แวร์จะไม่ใช่แค่เครื่องมือที่เราต้องคลิกใช้งานเองทีละหน้าจอ แต่ AI จะกลายเป็น Digital Coworker ที่นั่งข้างๆ คอยรับบรีฟและกดใช้งานเบราว์เซอร์แทนเราทุกขั้นตอน และความสามารถของ Claude ในวันนี้ กำลังทำให้ภาพนั้นเกิดขึ้นจริงแล้วครับ
อ้างอิงวิดีโอต้นฉบับ: https://www.youtube.com/watch?v=rO-ZKDfzZoE
