अक्सर पूछे जाने वाले प्रश्न
सेटअप, मॉडल, बिलिंग, सुरक्षा और आपके ब्राउज़र में WebBrain के काम करने के तरीके के बारे में त्वरित उत्तर।
इस खोज से मेल खाने वाला कोई उत्तर नहीं मिला।
WebBrain के बारे में
6क्या WebBrain क्लाउड के ब्राउज़र प्लगइन का एक निःशुल्क विकल्प है?
हाँ. WebBrain समान AI ब्राउज़र एजेंट क्षमताएं प्रदान करता है - पेज पढ़ना, डेटा निकालना, बटन क्लिक करना, फॉर्म भरना और मल्टी-स्टेप वर्कफ़्लो को स्वचालित करना। क्लाउड के मालिकाना ब्राउज़र प्लगइन के विपरीत, जिसके लिए क्लाउड प्रो सदस्यता की आवश्यकता होती है और केवल Anthropic के मॉडल के साथ काम करता है, WebBrain पूरी तरह से मुफ़्त, ओपन-सोर्स (एमआईटी लाइसेंस) है, और स्थानीय मॉडल सहित कई एलएलएम प्रदाताओं का समर्थन करता है जो पूरी तरह से आपकी मशीन पर चलते हैं।
WebBrain की तुलना OpenClaw, ब्राउज़र-यूज़ और अन्य AI एजेंट फ्रेमवर्क से कैसे की जाती है?
वे उपकरणों की विभिन्न श्रेणियां हैं। WebBrain एक ब्राउज़र एक्सटेंशन है - आप इसे Chrome या Firefox में इंस्टॉल करें और साइड पैनल में इसके साथ चैट करें, किसी कोडिंग की आवश्यकता नहीं है। ओपनक्लॉ और ब्राउज़र-यूज़ जैसे फ्रेमवर्क, आमतौर पर हेडलेस ब्राउज़र और सीडीपी का उपयोग करके पायथन में स्वचालित ब्राउज़र पाइपलाइन बनाने के लिए डेवलपर एसडीके हैं। इसे इस तरह से सोचें: WebBrain AI सहायक के साथ दैनिक ब्राउज़िंग के लिए है; एजेंट फ्रेमवर्क स्क्रैपिंग बॉट और टेस्ट ऑटोमेशन के निर्माण के लिए हैं। आप दोनों का उपयोग कर सकते हैं - वे एक दूसरे के पूरक हैं।
क्या WebBrain Firefox पर काम करता है?
हाँ. WebBrain एक Chrome संस्करण (मैनिफेस्ट V3, साइडपैनल एपीआई का उपयोग करके) और एक Firefox संस्करण (मैनिफेस्ट V2, साइडबार_एक्शन का उपयोग करके) दोनों के साथ आता है। दोनों संस्करणों में समान विशेषताएं हैं। Firefox संस्करण को विकास के लिए अस्थायी ऐड-ऑन के रूप में लोड किया जा सकता है, या स्थायी स्थापना के लिए addons.mozilla.org पर प्रकाशित किया जा सकता है।
मैं वेब स्क्रैपिंग और डेटा निष्कर्षण के लिए WebBrain का उपयोग कैसे करूं?
बस कोई भी वेब पेज खोलें, WebBrain साइड पैनल खोलें, और प्राकृतिक भाषा में पूछें: "इस पेज से सभी उत्पाद के नाम और कीमतें निकालें", "इस पेज पर सभी ईमेल पते प्राप्त करें", या "इस लेख को बुलेट बिंदुओं में सारांशित करें"। एआई एजेंट पृष्ठ सामग्री को पढ़ता है, संरचना को समझता है, और निकाले गए डेटा को वापस करता है। अधिक जटिल स्क्रैपिंग के लिए, एक्ट मोड पर स्विच करें और एजेंट पेजों के बीच नेविगेट कर सकता है, पेजिनेशन बटन पर क्लिक कर सकता है और कई पेजों पर डेटा एकत्र कर सकता है।
क्या WebBrain ड्राई-रन मोड का समर्थन करता है?
के रूप में 7.0.0, अभी तक नहीं. ड्राई-रन मोड की योजना बनाई गई है और पहले से ही रोडमैप पर है।
क्या मैं WebBrain में योगदान कर सकता हूँ?
बिल्कुल! WebBrain MIT-लाइसेंस प्राप्त है और योगदान का स्वागत करता है। की जाँच करें GitHub भंडार मुद्दों, सुविधा अनुरोधों और योगदान दिशानिर्देशों के लिए।
क्लाउड और बिलिंग
4WebBrain क्लाउड सदस्यता कितनी है?
WebBrain क्लाउड वर्तमान में है प्रति डिवाइस प्रोफ़ाइल $5/माह, फिलहाल क्लाउड प्रो से काफी सस्ता है। उचित उपयोग नीति के तहत उपयोग वर्तमान में असीमित है: सामान्य व्यक्तिगत उपयोग ठीक है, लेकिन अपमानजनक, स्वचालित, पुनर्विक्रय, या असामान्य रूप से उच्च मात्रा में उपयोग की अनुमति नहीं है।
सदस्यता उस ब्राउज़र + OS GUID के एक्सटेंशन द्वारा उत्पन्न डिवाइस पहचानकर्ता से जुड़ी होती है, उपयोगकर्ता खाते से नहीं। यदि वह पहचानकर्ता खो जाता है क्योंकि आप एक्सटेंशन स्टोरेज को रीसेट करते हैं, ब्राउज़र प्रोफ़ाइल हटाते हैं, ब्राउज़र को फिर से इंस्टॉल करते हैं, ब्राउज़र/ओएस बदलते हैं, या डिवाइस खो देते हैं, तो हम इसे पुनर्प्राप्त या स्थानांतरित नहीं कर सकते हैं और हम उस नुकसान के लिए रिफंड जारी नहीं करते हैं।
मैं अपनी सदस्यता कैसे प्रबंधित या रद्द करूँ?
api.webbrain.one/account पर बिलिंग प्रबंधित करें और अपने ईमेल से लॉग इन करें।
एन्क्रिप्टेड क्लाउड सिंक कैसे काम करता है?
क्लाउड सिंक सक्रिय WebBrain क्लाउड ग्राहकों के लिए एक वैकल्पिक सुविधा है। यह आपकी WebBrain यादों, प्रोफाइल ऑटो-फिल टेक्स्ट और एपीआई कुंजियों सहित समर्थित प्रदाता कॉन्फ़िगरेशन को सिंक करता है। यह होता है नहीं चैट इतिहास, ब्राउज़र इतिहास, पेज स्क्रीनशॉट, या लीगेसी OAuth एक्सेस और ताज़ा टोकन सिंक करें।
आपका ब्राउज़र आपके द्वारा चुने गए पासवर्ड के साथ अपलोड करने से पहले सिंक वॉल्ट को एन्क्रिप्ट करता है। WebBrain क्लाउड केवल एन्क्रिप्टेड वॉल्ट को संग्रहीत करता है; यह आपकी यादें, प्रोफ़ाइल टेक्स्ट, प्रदाता सेटिंग्स, या एपीआई कुंजी नहीं पढ़ सकता है, और यह आपके लिए सिंक पासवर्ड पुनर्प्राप्त नहीं कर सकता है।
ईमेल फ़ील्ड WebBrain क्लाउड मैजिक-लिंक बिलिंग/सदस्यता प्रमाणीकरण के लिए है। यह कोई खाता पासवर्ड नहीं है. यदि यूआई कहता है कि क्लाउड सिंक में पासवर्ड बदलें, तो इसका मतलब है एन्क्रिप्शन पासवर्ड सिंक करें, WebBrain खाता पासवर्ड नहीं।
यदि आप सिंक पासवर्ड भूल जाते हैं, तो पुराने एन्क्रिप्टेड क्लाउड वॉल्ट को डिक्रिप्ट नहीं किया जा सकता है। आप क्लाउड वॉल्ट को रीसेट कर सकते हैं और उस डिवाइस से एक नई एन्क्रिप्टेड कॉपी अपलोड कर सकते हैं जिसमें अभी भी स्थानीय रूप से डेटा मौजूद है।
WebBrain क्लाउड एलएलएम बिलों को कैसे नियंत्रण में रखता है?
तीन स्वतंत्र परतें:
टोकन-सचेत स्क्रीनशॉट। इससे पहले कि कोई छवि आपकी मशीन से बाहर जाए, WebBrain उसका आकार बदलता है (छोटा साइड कैप्ड, पहलू अनुपात को संरक्षित करता है) और इसे पुनरावृत्त रूप से JPEG-संपीड़ित करता है जब तक कि यह प्रति-मोड़ छवि-टोकन बजट में फिट न हो जाए। एक 2000×1200 स्क्रीनशॉट जिसकी कीमत आपको GPT-4o पर ~1,500 इनपुट टोकन होगी, पेज-रीडिंग कार्यों के लिए कोई व्यावहारिक हानि के बिना ~300-500 टोकन तक संपीड़ित हो जाता है। में क्रियान्वित किया गया _fitImageDimensions बजट गणित के लिए इकाई परीक्षणों के साथ।
स्मार्ट संदर्भ ट्रिमिंग. वार्तालाप इतिहास, टूल आउटपुट और इनलाइन DOM डंप को प्रति मोड़ पर सीमित किया जाता है और सक्रिय मॉडल की संदर्भ विंडो पूर्ण होने पर सबसे पहले छंटनी की जाती है। आप 10k टोकन से 100k तक चुपचाप चलने वाला गुब्बारा नहीं देखेंगे क्योंकि a read_page एक उपन्यास-लंबा लेख लौटाया।
समर्पित विज़न मॉडल. योजना और टूल कॉल के लिए एक सस्ते टेक्स्ट मॉडल (जैसे GPT-4o-मिनी) को केवल स्क्रीनशॉट के लिए एक अलग विज़न-सक्षम मॉडल (जैसे GPT-4o) के साथ जोड़ें, ताकि आपको हर एक मोड़ पर मल्टीमॉडल-मॉडल कीमतों का भुगतान न करना पड़े। के अंतर्गत कॉन्फ़िगर करें सेटिंग्स → विजन.
शुद्ध परिणाम: क्लाउड प्रदाताओं के साथ लंबे सत्र पूर्वानुमानित रहते हैं। पूर्ण नियंत्रण के लिए, स्थानीय रूप से llama.cpp का उपयोग करें - शून्य प्रति टोकन लागत।
मॉडल और स्थानीय सेटअप
7क्या मैं WebBrain का पूरी तरह ऑफ़लाइन उपयोग कर सकता हूँ?
हाँ. WebBrain का डिफ़ॉल्ट प्रदाता llama.cpp है, जो आपके कंप्यूटर पर एक स्थानीय AI मॉडल चलाता है। किसी एपीआई कुंजी की आवश्यकता नहीं है, एआई के लिए किसी इंटरनेट की आवश्यकता नहीं है, और कोई भी डेटा आपकी मशीन को कभी नहीं छोड़ता है। बस एक जीजीयूएफ मॉडल डाउनलोड करें, लामा-सर्वर शुरू करें, और आपके पास एक पूरी तरह से निजी एआई ब्राउज़र एजेंट है। आप Ollama का उपयोग इसके OpenAI-संगत समापन बिंदु के साथ भी कर सकते हैं।
WebBrain कौन से AI मॉडल का समर्थन करता है?
WebBrain चार प्रदाता प्रकारों का समर्थन करता है: llama.cpp (कोई भी स्थानीय GGUF मॉडल), OpenAI (GPT-4o, GPT-4, आदि), क्लाउड (मूल एपीआई के माध्यम से क्लाउड ओपस, सॉनेट, हाइकू), और OpenRouter (विभिन्न प्रदाताओं से 100+ मॉडल तक पहुंच)। कोई भी OpenAI-संगत एपीआई एंडपॉइंट काम करता है, इसलिए आप टुगेदर AI, Groq, Mistral, या OpenAI-संगत इंटरफ़ेस वाले किसी भी स्थानीय सर्वर जैसी सेवाओं का भी उपयोग कर सकते हैं।
सर्वाधिक अनुशंसित मॉडल कौन सा है?
के रूप में 21 अप्रैल 2026, शीर्ष सिफ़ारिश है Qwen 3.6 35B. क्यों: हमारे विज़न बेंचमार्क में (विज़न-मॉडल-शूटआउट), स्थानीय अनुमान के लिए व्यावहारिक रहते हुए इसने स्क्रीनशॉट समझ में जेम्मा 4 से बेहतर प्रदर्शन किया।
उपभोक्ता GPU के लिए, RTX 5090 आदर्श है, और RTX 4090 अक्सर INT4 ऑटोराउंड परिमाणीकरण के साथ काम करने योग्य होता है Intel/Qwen3.6-35B-A3B-int4-ऑटोराउंड.
अधिकतम गति के लिए, हम इसे जारी रखने की सलाह देते हैं वीएलएलएम. नमूना आदेश:
python -u -m vllm.entrypoints.openai.api_server --model Intel/Qwen3.6-35B-A3B-int4-AutoRound --served-model-name qwen3.6-35b --quantization auto --dtype bfloat16 --max-model-len 65536 --max-num-batched-tokens 32768 --max-num-seqs 4 --host 0.0.0.0 --port 8000 --gpu-memory-utilization 0.92 --enable-prefix-caching --enable-chunked-prefill --limit-mm-per-prompt '{"image": 4, "video": 1}' --mm-processor-cache-type shm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --trust-remote-code --allowed-origins '["*"]' --speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.6-35B-A3B-DFlash", "num_speculative_tokens": 15}' --attention-backend flash_attn
DFlash सट्टा डिकोडिंग वैकल्पिक है।
WebGPU केवल Apocalypse Mode में ही क्यों उपलब्ध है?
क्योंकि हमें अभी ब्राउज़र में WebGPU आधारित टेक्स्ट इन्फ़रेंस अधिकांश उपयोगकर्ताओं के लिए पर्याप्त अच्छा नहीं लगता, और हम नहीं चाहते कि आपको खराब अनुभव सहना पड़े। यदि आप उसी LFM2.5 2.6B मॉडल को स्थानीय रूप से उपयोग करना चाहते हैं, तो अपनी मशीन पर llama.cpp या Ollama से इन्फ़रेंस चलाएँ और WebGPU पर निर्भर रहने के बजाय WebBrain को उस स्थानीय एंडपॉइंट से जोड़ें।
WebGPU विज़न फ़ॉलबैक उपलब्ध है क्योंकि उसका मॉडल बहुत छोटा है और फ़ॉलबैक का उपयोग कभी-कभार ही होता है।
अपने नेटवर्क पर स्थानीय एलएलएम सर्वर (vLLM, Ollama, llama.cpp) से कनेक्ट करते समय मुझे "फ़ेच करने में विफल" संदेश मिल रहा है।
यदि आपका एलएलएम सर्वर आपके स्थानीय नेटवर्क पर एक अलग मशीन पर है (उदाहरण के लिए) http://192.168.1.x:8000), Chrome अनुरोध को तब तक ब्लॉक करता है जब तक सर्वर नहीं भेजता CORS शीर्षलेख. समाधान आपके सर्वर पर निर्भर करता है:
वीएलएलएम: से शुरू करें --allowed-origins '["*"]' (मान JSON सूची होना चाहिए)।
Ollama: पर्यावरण चर सेट करें OLLAMA_ORIGINS=* शुरू करने से पहले.
llama.cpp: CORS डिफ़ॉल्ट रूप से सक्षम है - किसी परिवर्तन की आवश्यकता नहीं है।
यदि आपका सर्वर चालू है localhost (ब्राउज़र के समान मशीन), CORS की आमतौर पर आवश्यकता नहीं होती है। समस्या केवल स्थानीय नेटवर्क पर क्रॉस-मशीन कनेक्शन को प्रभावित करती है। सुनिश्चित करें कि आपका आधार URL WebBrain सेटिंग्स के साथ समाप्त होता है /v1 (उदा. http://192.168.1.47:8000/v1). अपवाद: ब्राउज़र एक्सटेंशन से उपयोग किए गए Ollama की अभी भी आवश्यकता हो सकती है OLLAMA_ORIGINS; नीचे Ollama FAQ देखें।
Ollama localhost पर WebBrain एक्सटेंशन से 403 क्यों लौटाता है?
हाल के Ollama संस्करण ब्राउज़र-एक्सटेंशन मूल से अनुरोधों को अस्वीकार कर सकते हैं, भले ही Ollama उसी मशीन पर चल रहा हो। एक्सटेंशन एक भेजता है Origin जैसे chrome-extension://... या moz-extension://..., और Ollama 403 का उत्तर दे सकता है जब तक कि उन मूलों की अनुमति न हो।
किसी भी Ollama डेस्कटॉप ऐप से बाहर निकलें जिसमें पहले से ही पोर्ट है 11434, फिर इनमें से किसी एक कमांड से Ollama प्रारंभ करें:
OLLAMA_ORIGINS="*" ollama serveOLLAMA_ORIGINS="chrome-extension://*,moz-extension://*" ollama serve
WebBrain के Ollama बेस यूआरएल को इस पर सेट रखें http://localhost:11434/v1. टर्मिनल curl चेक इस सेटिंग के बिना भी काम कर सकते हैं क्योंकि वे ब्राउज़र-एक्सटेंशन मूल नहीं भेजते हैं।
क्या मैं इसे LM Studio में भी उपयोग कर सकता हूँ?
हाँ. WebBrain के केवल पढ़ने योग्य नेटवर्क उपकरण — fetch_url और research_url - स्टैंडअलोन के रूप में भी शिप करें LM Studio प्लगइन पर वेबब्रेन/वेब-टूल्स. के साथ स्थापित करें lms clone webbrain/web-tools और इसे किसी भी LM Studio चैट में चालू करें - कोई भी टूल-सक्षम मॉडल ब्राउज़र एक्सटेंशन इंस्टॉल किए बिना उन दो टूल को कॉल कर सकता है। शुद्ध नोड, कोई हेडलेस ब्राउज़र नहीं। स्रोत: एलएमस्टूडियो-प्लगइन/.
ब्राउज़र और रोज़मर्रा का उपयोग
5क्या मैं Chrome के साइड पैनल की तरह Firefox साइडबार को बाएँ से दाएँ घुमा सकता हूँ?
हां - Firefox का साइडबार डिफ़ॉल्ट रूप से बाईं ओर है, लेकिन आप इसे फ़्लिप कर सकते हैं। साइडबार हेडर में कहीं भी राइट-क्लिक करें और चुनें साइडबार को दाईं ओर ले जाएँ (या उपयोग करें देखें → साइडबार → साइडबार को दाईं ओर ले जाएँ मेनू बार से)। पुनः प्रारंभ होने पर स्थिति बनी रहती है। Chrome का साइडपैनल डिफ़ॉल्ट रूप से दाईं ओर है और पैनल से ही उपयोगकर्ता द्वारा चलाया नहीं जा सकता है।
क्या विवाल्डी के वेब पैनल में WebBrain का उपयोग करते समय कोई सीमाएँ हैं?
हाँ. विवाल्डी वेब पैनल्स जैसे देशी जावास्क्रिप्ट संवादों को दबा देते हैं confirm(), alert(), और prompt(). WebBrain का आस्क, एक्ट और डेव मोड स्विच अब उन संवादों पर निर्भर नहीं है, लेकिन कुछ माध्यमिक क्रियाएं अभी भी निर्भर करती हैं।
रिकॉर्डिंग: प्रयोग न करें /record अभी के लिए विवाल्डी में। यदि रिकॉर्डिंग विफल हो जाती है, तो विवाल्डी त्रुटि चेतावनी छिपा सकता है और कोई दृश्यमान स्पष्टीकरण नहीं छोड़ सकता है।
सेटिंग्स, इतिहास, निशान और Ollama हैंडऑफ़: इनमें मूल संवाद भी शामिल हैं, लेकिन WebBrain आम तौर पर उन्हें नियमित टैब के रूप में खोलता है, जहां वे काम करते हैं। यदि आप मैन्युअल रूप से किसी को वेब पैनल में रखते हैं, तो संवाद-निर्भर क्रियाओं का उपयोग करने से पहले इसे एक सामान्य टैब में खोलें।
क्या WebBrain के मेरे टैब पर काम करते समय मैं ऊपर या नीचे स्क्रॉल कर सकता हूँ?
अधिकतर समय, हाँ — खासकर Ask मोड में “इस पेज का सारांश दो” जैसे केवल-पढ़ने वाले अनुरोधों के लिए। WebBrain के काम करते समय आप स्क्रॉल करना जारी रख सकते हैं।
कब इससे बचना चाहिए? ऑटो-स्क्रीनशॉट टैब के मौजूदा व्यूपोर्ट को दर्शाते हैं। जब WebBrain Act या Dev मोड में दिखाई दे रही सामग्री का सक्रिय रूप से निरीक्षण कर रहा हो या उससे इंटरैक्ट कर रहा हो, तब स्क्रॉल करने से लक्ष्य खिसक सकता है या मॉडल को दिखने वाली सामग्री बदल सकती है। स्क्रॉल करने से पहले उस चरण के पूरा होने दें; उन क्षणों के अलावा आप पेज का इस्तेमाल जारी रख सकते हैं।
जब WebBrain एक पेज पर काम कर रहा हो तो क्या मैं दूसरे टैब पर स्विच कर सकता हूँ?
हाँ। संस्करण 27.0.0 से WebBrain Chromium-आधारित ब्राउज़र और Firefox दोनों में फ़ोकस नहीं छीनता, जब तक कि सामने मौजूद टैब तक पहुँचना बिल्कुल आवश्यक न हो। रन उस टैब से जुड़ा रहता है जहाँ वह शुरू हुआ था, इसलिए आप किसी दूसरे टैब में सुरक्षित रूप से काम कर सकते हैं।
यदि किसी दुर्लभ चरण के लिए मूल टैब को सामने लाना ज़रूरी हो, तो WebBrain थोड़ी देर के लिए उस पर फ़ोकस कर सकता है। जब WebBrain उसी टैब में सक्रिय रूप से काम कर रहा हो, तब वहाँ क्लिक या टाइप करने से बचें।
WebBrain कुकी बैनर और पेवॉल के साथ क्या करता है?
कुकी बैनर: WebBrain सामान्य फ्रेमवर्क (वनट्रस्ट, कुकीबॉट, डिडोमी, क्वांटकास्ट, गूगल फंडिंग चॉइस, ट्रस्टआर्क) से सहमति बैनर को पहचानता है और पेज के बारे में तर्क करने से पहले उन्हें खारिज कर देता है। प्राथमिकता "सभी को अस्वीकार करें" / "गैर-आवश्यक को अस्वीकार करें" / "केवल आवश्यक" है जब स्पष्ट रूप से दिखाई दे; यह "वरीयताएँ प्रबंधित करें" भूलभुलैया में गायब होने के बजाय "सभी को स्वीकार करें" पर वापस आ जाता है।
भुगतान: WebBrain पेवॉल की ईमानदारी से रिपोर्ट करता है और आपको बताता है कि यह वास्तव में क्या देख सकता है (हेडलाइन, डेक, पहला पैराग्राफ)। यह होता है नहीं पेवॉल्स को बायपास करने का प्रयास - कोई Archive.today, 12ft.io, कुकी क्लियरिंग, JS अक्षम करना, या रीडर-मोड ट्रिक्स नहीं। यदि आप पूरा लेख चाहते हैं, तो सदस्यता के साथ लॉग इन करें या उसी कहानी की मुफ्त कवरेज देखने के लिए WebBrain से पूछें।
सुरक्षा और गोपनीयता
7क्या WebBrain का उपयोग सुरक्षित है? क्या यह वेब पेजों को संशोधित कर सकता है?
WebBrain में तीन मोड हैं। आस्क मोड (डिफ़ॉल्ट) केवल-पढ़ने के लिए है और पृष्ठ पर कुछ भी संशोधित नहीं कर सकता। एक्ट मोड ब्राउज़र क्रियाओं जैसे क्लिक करना, टाइप करना और नेविगेट करना सक्षम बनाता है, जबकि डेव मोड पेज-डीबगिंग टूल जोड़ता है। परिणामी कार्रवाइयों के लिए डिफ़ॉल्ट रूप से अनुमोदन की आवश्यकता होती है; यदि वह अनुमति गेट बंद है, तो WebBrain एक दृश्यमान चेतावनी बैनर प्रदर्शित करता है। आप किसी भी समय स्टॉप बटन से एजेंट को रोक सकते हैं। एक्सटेंशन का स्रोत कोड GitHub पर ऑडिट के लिए पूरी तरह से खुला है।
"WebBrain ने इस ब्राउज़र को डीबग करना शुरू कर दिया" बैनर क्या है? WebBrain CDP का उपयोग क्यों करता है?
किसी पृष्ठ पर विश्वसनीय रूप से कार्य करने के लिए, WebBrain मानक के माध्यम से Chrome DevTools प्रोटोकॉल (CDP) का उपयोग करता है chrome.debugger एक्सटेंशन एपीआई - यही Chrome के "WebBrain ने इस ब्राउज़र को डीबग करना शुरू किया" बैनर को ट्रिगर करता है। सीडीपी वह है जो एजेंट को क्लिक करने और टाइप करने की सुविधा देता है विश्वसनीय इनपुट घटनाएँ आधुनिक साइटें वास्तव में इसका सम्मान करती हैं; किसी सामग्री स्क्रिप्ट से सक्रिय सिंथेटिक ईवेंट कई साइटों, वेब घटकों और फ़्रेमवर्क-नियंत्रित इनपुट द्वारा अस्वीकार कर दिए जाते हैं। यह भी है कि कैसे WebBrain विज़न फ़ॉलबैक के लिए पिक्सेल-सटीक स्क्रीनशॉट कैप्चर करता है और पहुँचता है क्रॉस-ओरिजिनल आईफ्रेम और शैडो डोम वह सामग्री स्क्रिप्ट नहीं देख सकती.
केवल पढ़ने योग्य आस्क मोड को सीडीपी की आवश्यकता नहीं है - पेज और एक्सेसिबिलिटी-ट्री रीड्स सामान्य सामग्री स्क्रिप्ट के माध्यम से चलते हैं। यह है अधिनियम मोड विश्वसनीयता और क्रॉस-ओरिजिन कार्य जिसके लिए इसकी आवश्यकता होती है, और मेनिफेस्ट V3 एक्सटेंशन में विश्वसनीय इनपुट के लिए कोई गैर-डीबगर एपीआई नहीं है। WebBrain डिबगर जोड़ता है केवल तभी जब किसी कार्य को इसकी आवश्यकता हो, प्रति टैब, और पूरा एक्सटेंशन ओपन-सोर्स है ताकि आप ऑडिट कर सकें कि सत्र वास्तव में क्या करता है। सीडीपी शक्तिशाली है, इसलिए हम इसके पदचिह्न को नियंत्रित करने वाली चीज़ के रूप में मानते हैं - मांग पर संलग्न करें, इसे पढ़ते रहें - और इसे और कड़ा करना हमारे सुरक्षा रोडमैप पर है।
यह मुझसे बहुत सारे प्रश्न पूछ रहा है। क्या मैं उसे अक्षम कर सकता हूँ?
वे अनुमोदन संकेत आपकी सुरक्षा के लिए हैं। यहां तक कि उन साइटों पर भी जिन पर आप भरोसा करते हैं, दुर्भावनापूर्ण अभिनेता एलएलएम निर्देशों की नकल कर सकते हैं या ऐसी सामग्री डाल सकते हैं जो एजेंट को आपकी ओर से ऐसे काम करने के लिए मजबूर करने की कोशिश करती है जिन्हें आप स्वीकार नहीं करेंगे। इसीलिए WebBrain परिणामी कार्रवाई से पहले पूछता है। यदि आप अभी भी उन संकेतों का पालन नहीं करना चाहते हैं, तो टाइप करें /dangerously-skip-permissions साइड पैनल में, या साइड प्लगइन खोलें, हेडर में व्हील आइकन पर क्लिक करें, पर जाएं अनुमतियाँ टैब इन settings.html, और स्विच ऑफ कर दें परिणामी कार्रवाई से पहले पूछें.
क्या WebBrain सीधे एपीआई को कॉल करता है, या यह हमेशा यूआई पर क्लिक करता है?
डिफ़ॉल्ट रूप से, WebBrain हमेशा दृश्यमान यूआई के माध्यम से जाता है किसी भी ऐसी कार्रवाई के लिए जो कुछ भी बनाती है, संशोधित करती है, हटाती है, भेजती है, सबमिट करती है, पोस्ट करती है या खरीदती है। यह पृष्ठ पर नेविगेट करेगा, फ़ॉर्म भरेगा, और बटन पर क्लिक करेगा - बिल्कुल वैसे ही जैसे आप करेंगे। यह सीधे पृष्ठभूमि के माध्यम से REST/GraphQL एंडपॉइंट्स को कॉल करने से इंकार कर देता है fetch() उत्परिवर्तन के लिए. यह जानबूझकर किया गया है: एपीआई क्रियाएं अदृश्य हैं (आप नहीं देख सकते कि क्या भेजा जा रहा है), अक्सर अलग-अलग ऑथ टोकन की आवश्यकता होती है जिन्हें आपने कॉन्फ़िगर नहीं किया होगा, और दृश्यमान गलत-क्लिक की तुलना में बहुत बड़ा ब्लास्ट त्रिज्या होता है। यूआई-फर्स्ट का मतलब है कि आपके सामान्य ब्राउज़र सत्र में सब कुछ स्क्रीन पर है, और रोका जा सकता है।
के लिए पढ़ना डेटा - एक README प्राप्त करना, एक समस्या को देखना, साइटों पर कीमतों की तुलना करना, एक स्थिति पृष्ठ की जाँच करना - WebBrain स्वतंत्र रूप से पृष्ठभूमि HTTP अनुरोधों का उपयोग करता है fetch_url और research_url उपकरण. पढ़ना अभिनय के समान नहीं है; यह किसी दूरस्थ सेवा पर कुछ भी नहीं बदलता है, इसलिए सुरक्षा संबंधी चिंताएँ लागू नहीं होती हैं।
यदि आप विशेष रूप से किसी विशेष कार्य के लिए एपीआई म्यूटेशन की अनुमति देना चाहते हैं, तो टाइप करें /allow-api आपके संदेश के प्रारंभ में (वैकल्पिक रूप से उसके बाद एक संक्षिप्त कार्य विवरण)। यह प्रति-वार्तालाप ओवरराइड WebBrain को एपीआई एंडपॉइंट पर वापस आने देता है जब यूआई वास्तव में विफल या अव्यवहार्य होता है, जबकि यूआई काम करने पर भी यूआई को प्राथमिकता देता है। ओवरराइड सक्रिय होने पर एक चिपचिपा बैज इनपुट क्षेत्र के ऊपर दिखाई देता है, और जब आप वार्तालाप को रीसेट करते हैं तो यह साफ़ हो जाता है।
प्रोफ़ाइल स्वतः-भरण कैसे काम करता है, और क्या यह सुरक्षित है?
प्रोफ़ाइल स्वतः-भरण एक वैकल्पिक सुविधा है सेटिंग्स → प्रोफ़ाइल. आप एक संक्षिप्त जीवनी दर्ज करें - नाम, कार्य ईमेल, कंपनी, और ए फेंकना कम जोखिम वाले साइनअप के लिए पासवर्ड - और इसे चालू करें। सक्षम होने पर, WebBrain उस टेक्स्ट को एजेंट के सिस्टम प्रॉम्प्ट में जोड़ देता है ताकि वह हर बार बिना पूछे साइनअप फॉर्म भर सके।
पाठ संग्रहीत है सादे पाठ में आपके ब्राउज़र के स्थानीय संग्रहण में. यह है नहीं WebBrain प्रोजेक्ट को प्रेषित, लेकिन यह है सिस्टम प्रॉम्प्ट के भाग के रूप में, प्रत्येक मोड़ पर आपके द्वारा कॉन्फ़िगर किए गए किसी भी एलएलएम प्रदाता को भेजा जाता है। डिफ़ॉल्ट रूप से बंद.
महत्वपूर्ण खातों के लिए पासवर्ड न रखें (Google, Apple, iCloud, बैंकिंग, कार्य SSO, प्राथमिक ईमेल) यहां। उन खातों को 2FA का उपयोग करना चाहिए और किसी भी तरह से किसी एजेंट को नहीं सौंपा जाना चाहिए। न्यूज़लेटर साइनअप और निःशुल्क परीक्षणों के लिए आपके द्वारा पुन: उपयोग किया जाने वाला एक थ्रोअवे पासवर्ड इच्छित उपयोग का मामला है।
क्या स्क्रीनशॉट रिडक्शन सेटिंग यह गारंटी देती है कि मेरा निजी डेटा कभी भी क्लाउड विज़न मॉडल तक नहीं पहुंचेगा?
नहीं - यह जोखिम को कम करता है, इसकी कोई गारंटी नहीं है। सक्षम होने पर (सेटिंग्स → मल्टीमॉडल → स्क्रीनशॉट रिडक्शन, डिफ़ॉल्ट रूप से बंद), WebBrain फॉर्म फ़ील्ड और टेक्स्ट को पिक्सेलित करता है जो प्रत्येक स्क्रीनशॉट पर एक ईमेल पते या फोन नंबर की तरह दिखता है पहले इसे एक विज़न मॉडल में भेजा जाता है। DOM हेयुरिस्टिक्स का उपयोग करके डिटेक्शन पूरी तरह से आपके डिवाइस पर चलता है; कुछ भी अतिरिक्त प्रसारित नहीं होता है.
यह सर्वोत्तम-प्रयास और असफलता-रहित है। यदि डिटेक्टर किसी पृष्ठ पर नहीं चल सकता है - उदाहरण के लिए नेविगेशन के तुरंत बाद, पीडीएफ दर्शकों पर, या प्रतिबंधित ब्राउज़र पृष्ठों पर - स्क्रीनशॉट अभी भी भेजा जाता है अप्रकाशित अपने कार्य को निरस्त करने के बजाय। वह सामग्री जिसे DOM अनुमान नहीं देख सकता (कैनवास पर खींचा गया पाठ, छवियों के अंदर PII, असामान्य विजेट) भी फिसल सकता है। और सेटिंग केवल स्क्रीनशॉट को कवर करती है: पेज पाठ मॉडल को भेजा गया इसके द्वारा संशोधित नहीं किया गया है।
पूर्ण दृष्टि गोपनीयता के लिए, स्थानीय मॉडल का उपयोग करें। llama.cpp या Ollama जैसे ऑफ़लाइन प्रदाता के साथ, स्क्रीनशॉट और पेज टेक्स्ट आपकी मशीन को कभी नहीं छोड़ते हैं, इसलिए पहली बार में रिडक्ट करने के लिए कुछ भी नहीं है - यह एकमात्र कॉन्फ़िगरेशन है जहां गोपनीयता की गारंटी है। देखें "क्या मैं WebBrain का पूरी तरह ऑफ़लाइन उपयोग कर सकता हूँ?" ऊपर।
क्या आपके पास ऐसी मशीन नहीं है जो दृष्टि-सक्षम स्थानीय मॉडल चला सके? एक अच्छा मध्य मार्ग नियोजन और टूल कॉल के लिए एक छोटा स्थानीय मॉडल है (एक मामूली सीपीयू/जीपीयू के लिए पर्याप्त तेज़ और हल्का) जिसे विज़न उप-कॉल के लिए क्लाउड प्रदाता के साथ जोड़ा जाता है, जिसमें स्क्रीनशॉट रिडक्शन चालू होता है। आप अभी भी अपनी बातचीत और पेज टेक्स्ट को डिवाइस पर रखते हैं, और क्लाउड विज़न के लिए छोड़े जाने वाले प्रत्येक स्क्रीनशॉट में फॉर्म फ़ील्ड और पहचाने गए ईमेल/फ़ोन पहले धुंधले होते हैं - पूर्ण स्थानीय विज़न मॉडल के लिए हार्डवेयर की आवश्यकता के बिना क्लाउड एक्सपोज़र कम हो जाता है। विज़न स्प्लिट को नीचे कॉन्फ़िगर करें सेटिंग्स → विजन (ऊपर देखें "WebBrain क्लाउड एलएलएम बिलों को कैसे नियंत्रण में रखता है?")।
क्या WebBrain पूरा DOM एआई मॉडल को भेजता है?
नहीं। WebBrain डिफ़ॉल्ट रूप से कच्चा HTML या कच्चा DOM डंप नहीं भेजता। यह पेज के URL और शीर्षक, संबंधित साइट मार्गदर्शन और विज़न सक्षम होने पर वैकल्पिक व्यूपोर्ट स्क्रीनशॉट से शुरू करता है।
जब किसी कार्य के लिए पेज की सामग्री चाहिए, WebBrain उसे आवश्यकता के अनुसार संक्षिप्त सिमेंटिक एक्सेसिबिलिटी ट्री या निकाले गए टेक्स्ट के रूप में पढ़ता है। जहाँ उचित हो वहाँ रीडिंग को दृश्यता के आधार पर फ़िल्टर किया जाता है, अक्षर सीमा लगाई जाती है और बड़े परिणामों को पृष्ठों में बाँटा जाता है। कच्चे पेज स्रोत तक पहुँच केवल Dev मोड में उपलब्ध है।
