क्या WebBrain क्लाउड के ब्राउज़र प्लगइन का एक निःशुल्क विकल्प है?
हाँ. WebBrain समान AI ब्राउज़र एजेंट क्षमताएं प्रदान करता है - पेज पढ़ना, डेटा निकालना, बटन क्लिक करना, फॉर्म भरना और मल्टी-स्टेप वर्कफ़्लो को स्वचालित करना। क्लाउड के मालिकाना ब्राउज़र प्लगइन के विपरीत, जिसके लिए क्लाउड प्रो सदस्यता की आवश्यकता होती है और केवल Anthropic के मॉडल के साथ काम करता है, WebBrain पूरी तरह से मुफ़्त, ओपन-सोर्स (एमआईटी लाइसेंस) है, और स्थानीय मॉडल सहित कई एलएलएम प्रदाताओं का समर्थन करता है जो पूरी तरह से आपकी मशीन पर चलते हैं।
WebBrain क्लाउड सदस्यता कितनी है?
WebBrain क्लाउड वर्तमान में है प्रति डिवाइस प्रोफ़ाइल $5/माह, फिलहाल क्लाउड प्रो से काफी सस्ता है। उचित उपयोग नीति के तहत उपयोग वर्तमान में असीमित है: सामान्य व्यक्तिगत उपयोग ठीक है, लेकिन अपमानजनक, स्वचालित, पुनर्विक्रय, या असामान्य रूप से उच्च मात्रा में उपयोग की अनुमति नहीं है।
सदस्यता उस ब्राउज़र + OS GUID के एक्सटेंशन द्वारा उत्पन्न डिवाइस पहचानकर्ता से जुड़ी होती है, उपयोगकर्ता खाते से नहीं। यदि वह पहचानकर्ता खो जाता है क्योंकि आप एक्सटेंशन स्टोरेज को रीसेट करते हैं, ब्राउज़र प्रोफ़ाइल हटाते हैं, ब्राउज़र को फिर से इंस्टॉल करते हैं, ब्राउज़र/ओएस बदलते हैं, या डिवाइस खो देते हैं, तो हम इसे पुनर्प्राप्त या स्थानांतरित नहीं कर सकते हैं और हम उस नुकसान के लिए रिफंड जारी नहीं करते हैं।
आप यहां से सदस्यता ले सकते हैं या बिलिंग प्रबंधित कर सकते हैं खाता के साथ प्लगइन सेटिंग पृष्ठ का अनुभाग बिलिंग प्रबंधित करें बटन. मैन्युअल रूप से रद्द करने के लिए, चेकआउट के समय आपके द्वारा उपयोग किए गए ईमेल पते के साथ ईमेल द्वारा हमसे संपर्क करें।
एन्क्रिप्टेड क्लाउड सिंक कैसे काम करता है?
क्लाउड सिंक सक्रिय WebBrain क्लाउड ग्राहकों के लिए एक वैकल्पिक सुविधा है। यह आपकी WebBrain यादों, प्रोफाइल ऑटो-फिल टेक्स्ट और एपीआई कुंजियों सहित समर्थित प्रदाता कॉन्फ़िगरेशन को सिंक करता है। यह होता है नहीं चैट इतिहास, ब्राउज़र इतिहास, पेज स्क्रीनशॉट, या लीगेसी OAuth एक्सेस और ताज़ा टोकन सिंक करें।
आपका ब्राउज़र आपके द्वारा चुने गए पासवर्ड के साथ अपलोड करने से पहले सिंक वॉल्ट को एन्क्रिप्ट करता है। WebBrain क्लाउड केवल एन्क्रिप्टेड वॉल्ट को संग्रहीत करता है; यह आपकी यादें, प्रोफ़ाइल टेक्स्ट, प्रदाता सेटिंग्स, या एपीआई कुंजी नहीं पढ़ सकता है, और यह आपके लिए सिंक पासवर्ड पुनर्प्राप्त नहीं कर सकता है।
ईमेल फ़ील्ड WebBrain क्लाउड मैजिक-लिंक बिलिंग/सदस्यता प्रमाणीकरण के लिए है। यह कोई खाता पासवर्ड नहीं है. यदि यूआई कहता है कि क्लाउड सिंक में पासवर्ड बदलें, तो इसका मतलब है एन्क्रिप्शन पासवर्ड सिंक करें, WebBrain खाता पासवर्ड नहीं।
यदि आप सिंक पासवर्ड भूल जाते हैं, तो पुराने एन्क्रिप्टेड क्लाउड वॉल्ट को डिक्रिप्ट नहीं किया जा सकता है। आप क्लाउड वॉल्ट को रीसेट कर सकते हैं और उस डिवाइस से एक नई एन्क्रिप्टेड कॉपी अपलोड कर सकते हैं जिसमें अभी भी स्थानीय रूप से डेटा मौजूद है।
WebBrain की तुलना OpenClaw, ब्राउज़र-यूज़ और अन्य AI एजेंट फ्रेमवर्क से कैसे की जाती है?
वे उपकरणों की विभिन्न श्रेणियां हैं। WebBrain एक ब्राउज़र एक्सटेंशन है - आप इसे Chrome या Firefox में इंस्टॉल करें और साइड पैनल में इसके साथ चैट करें, किसी कोडिंग की आवश्यकता नहीं है। ओपनक्लॉ और ब्राउज़र-यूज़ जैसे फ्रेमवर्क, आमतौर पर हेडलेस ब्राउज़र और सीडीपी का उपयोग करके पायथन में स्वचालित ब्राउज़र पाइपलाइन बनाने के लिए डेवलपर एसडीके हैं। इसे इस तरह से सोचें: WebBrain AI सहायक के साथ दैनिक ब्राउज़िंग के लिए है; एजेंट फ्रेमवर्क स्क्रैपिंग बॉट और टेस्ट ऑटोमेशन के निर्माण के लिए हैं। आप दोनों का उपयोग कर सकते हैं - वे एक दूसरे के पूरक हैं।
क्या मैं WebBrain का पूरी तरह ऑफ़लाइन उपयोग कर सकता हूँ?
हाँ. WebBrain का डिफ़ॉल्ट प्रदाता llama.cpp है, जो आपके कंप्यूटर पर एक स्थानीय AI मॉडल चलाता है। किसी एपीआई कुंजी की आवश्यकता नहीं है, एआई के लिए किसी इंटरनेट की आवश्यकता नहीं है, और कोई भी डेटा आपकी मशीन को कभी नहीं छोड़ता है। बस एक जीजीयूएफ मॉडल डाउनलोड करें, लामा-सर्वर शुरू करें, और आपके पास एक पूरी तरह से निजी एआई ब्राउज़र एजेंट है। आप Ollama का उपयोग इसके OpenAI-संगत समापन बिंदु के साथ भी कर सकते हैं।
WebBrain कौन से AI मॉडल का समर्थन करता है?
WebBrain चार प्रदाता प्रकारों का समर्थन करता है: llama.cpp (कोई भी स्थानीय GGUF मॉडल), OpenAI (GPT-4o, GPT-4, आदि), क्लाउड (मूल एपीआई के माध्यम से क्लाउड ओपस, सॉनेट, हाइकू), और OpenRouter (विभिन्न प्रदाताओं से 100+ मॉडल तक पहुंच)। कोई भी OpenAI-संगत एपीआई एंडपॉइंट काम करता है, इसलिए आप टुगेदर AI, Groq, Mistral, या OpenAI-संगत इंटरफ़ेस वाले किसी भी स्थानीय सर्वर जैसी सेवाओं का भी उपयोग कर सकते हैं।
सर्वाधिक अनुशंसित मॉडल कौन सा है?
के रूप में 21 अप्रैल 2026, शीर्ष सिफ़ारिश है Qwen 3.6 35B. क्यों: हमारे विज़न बेंचमार्क में (विज़न-मॉडल-शूटआउट), स्थानीय अनुमान के लिए व्यावहारिक रहते हुए इसने स्क्रीनशॉट समझ में जेम्मा 4 से बेहतर प्रदर्शन किया।
उपभोक्ता GPU के लिए, RTX 5090 आदर्श है, और RTX 4090 अक्सर INT4 ऑटोराउंड परिमाणीकरण के साथ काम करने योग्य होता है Intel/Qwen3.6-35B-A3B-int4-ऑटोराउंड.
अधिकतम गति के लिए, हम इसे जारी रखने की सलाह देते हैं वीएलएलएम. नमूना आदेश:
python -u -m vllm.entrypoints.openai.api_server --model Intel/Qwen3.6-35B-A3B-int4-AutoRound --served-model-name qwen3.6-35b --quantization auto --dtype bfloat16 --max-model-len 65536 --max-num-batched-tokens 32768 --max-num-seqs 4 --host 0.0.0.0 --port 8000 --gpu-memory-utilization 0.92 --enable-prefix-caching --enable-chunked-prefill --limit-mm-per-prompt '{"image": 4, "video": 1}' --mm-processor-cache-type shm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --trust-remote-code --allowed-origins '["*"]' --speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.6-35B-A3B-DFlash", "num_speculative_tokens": 15}' --attention-backend flash_attn
DFlash सट्टा डिकोडिंग वैकल्पिक है।
अपने नेटवर्क पर स्थानीय एलएलएम सर्वर (vLLM, Ollama, llama.cpp) से कनेक्ट करते समय मुझे "फ़ेच करने में विफल" संदेश मिल रहा है।
यदि आपका एलएलएम सर्वर आपके स्थानीय नेटवर्क पर एक अलग मशीन पर है (उदाहरण के लिए) http://192.168.1.x:8000), Chrome अनुरोध को तब तक ब्लॉक करता है जब तक सर्वर नहीं भेजता CORS शीर्षलेख. समाधान आपके सर्वर पर निर्भर करता है:
वीएलएलएम: से शुरू करें --allowed-origins '["*"]' (मान JSON सूची होना चाहिए)।
Ollama: पर्यावरण चर सेट करें OLLAMA_ORIGINS=* शुरू करने से पहले.
llama.cpp: CORS डिफ़ॉल्ट रूप से सक्षम है - किसी परिवर्तन की आवश्यकता नहीं है।
यदि आपका सर्वर चालू है localhost (ब्राउज़र के समान मशीन), CORS की आमतौर पर आवश्यकता नहीं होती है। समस्या केवल स्थानीय नेटवर्क पर क्रॉस-मशीन कनेक्शन को प्रभावित करती है। सुनिश्चित करें कि आपका आधार URL WebBrain सेटिंग्स के साथ समाप्त होता है /v1 (उदा. http://192.168.1.47:8000/v1). अपवाद: ब्राउज़र एक्सटेंशन से उपयोग किए गए Ollama की अभी भी आवश्यकता हो सकती है OLLAMA_ORIGINS; नीचे Ollama FAQ देखें।
Ollama localhost पर WebBrain एक्सटेंशन से 403 क्यों लौटाता है?
हाल के Ollama संस्करण ब्राउज़र-एक्सटेंशन मूल से अनुरोधों को अस्वीकार कर सकते हैं, भले ही Ollama उसी मशीन पर चल रहा हो। एक्सटेंशन एक भेजता है Origin जैसे chrome-extension://... या moz-extension://..., और Ollama 403 का उत्तर दे सकता है जब तक कि उन मूलों की अनुमति न हो।
किसी भी Ollama डेस्कटॉप ऐप से बाहर निकलें जिसमें पहले से ही पोर्ट है 11434, फिर इनमें से किसी एक कमांड से Ollama प्रारंभ करें:
OLLAMA_ORIGINS="*" ollama serve
OLLAMA_ORIGINS="chrome-extension://*,moz-extension://*" ollama serve
WebBrain के Ollama बेस यूआरएल को इस पर सेट रखें http://localhost:11434/v1. टर्मिनल curl चेक इस सेटिंग के बिना भी काम कर सकते हैं क्योंकि वे ब्राउज़र-एक्सटेंशन मूल नहीं भेजते हैं।
क्या WebBrain Firefox पर काम करता है?
हाँ. WebBrain एक Chrome संस्करण (मैनिफेस्ट V3, साइडपैनल एपीआई का उपयोग करके) और एक Firefox संस्करण (मैनिफेस्ट V2, साइडबार_एक्शन का उपयोग करके) दोनों के साथ आता है। दोनों संस्करणों में समान विशेषताएं हैं। Firefox संस्करण को विकास के लिए अस्थायी ऐड-ऑन के रूप में लोड किया जा सकता है, या स्थायी स्थापना के लिए addons.mozilla.org पर प्रकाशित किया जा सकता है।
क्या मैं Chrome के साइड पैनल की तरह Firefox साइडबार को बाएँ से दाएँ घुमा सकता हूँ?
हां - Firefox का साइडबार डिफ़ॉल्ट रूप से बाईं ओर है, लेकिन आप इसे फ़्लिप कर सकते हैं। साइडबार हेडर में कहीं भी राइट-क्लिक करें और चुनें साइडबार को दाईं ओर ले जाएँ (या उपयोग करें देखें → साइडबार → साइडबार को दाईं ओर ले जाएँ मेनू बार से)। पुनः प्रारंभ होने पर स्थिति बनी रहती है। Chrome का साइडपैनल डिफ़ॉल्ट रूप से दाईं ओर है और पैनल से ही उपयोगकर्ता द्वारा चलाया नहीं जा सकता है।
क्या विवाल्डी के वेब पैनल में WebBrain का उपयोग करते समय कोई सीमाएँ हैं?
हाँ. विवाल्डी वेब पैनल्स जैसे देशी जावास्क्रिप्ट संवादों को दबा देते हैं confirm(), alert(), और prompt(). WebBrain का आस्क, एक्ट और डेव मोड स्विच अब उन संवादों पर निर्भर नहीं है, लेकिन कुछ माध्यमिक क्रियाएं अभी भी निर्भर करती हैं।
नई बातचीत: वेब पैनल में, बटन कुछ भी नहीं करता हुआ दिखाई दे सकता है क्योंकि इसका पुष्टिकरण संवाद दबा हुआ है। WebBrain पैनल आइकन पर राइट-क्लिक करें, चुनें → नया टैब खोलें, और उपयोग करें नई बातचीत उस नियमित टैब से.
रिकॉर्डिंग: प्रयोग न करें /record अभी के लिए विवाल्डी में। यदि रिकॉर्डिंग विफल हो जाती है, तो विवाल्डी त्रुटि चेतावनी छिपा सकता है और कोई दृश्यमान स्पष्टीकरण नहीं छोड़ सकता है।
सेटिंग्स, इतिहास, निशान और Ollama हैंडऑफ़: इनमें मूल संवाद भी शामिल हैं, लेकिन WebBrain आम तौर पर उन्हें नियमित टैब के रूप में खोलता है, जहां वे काम करते हैं। यदि आप मैन्युअल रूप से किसी को वेब पैनल में रखते हैं, तो संवाद-निर्भर क्रियाओं का उपयोग करने से पहले इसे एक सामान्य टैब में खोलें।
क्या WebBrain का उपयोग सुरक्षित है? क्या यह वेब पेजों को संशोधित कर सकता है?
WebBrain में तीन मोड हैं। आस्क मोड (डिफ़ॉल्ट) केवल-पढ़ने के लिए है और पृष्ठ पर कुछ भी संशोधित नहीं कर सकता। एक्ट मोड ब्राउज़र क्रियाओं जैसे क्लिक करना, टाइप करना और नेविगेट करना सक्षम बनाता है, जबकि डेव मोड पेज-डीबगिंग टूल जोड़ता है। परिणामी कार्रवाइयों के लिए डिफ़ॉल्ट रूप से अनुमोदन की आवश्यकता होती है; यदि वह अनुमति गेट बंद है, तो WebBrain एक दृश्यमान चेतावनी बैनर प्रदर्शित करता है। आप किसी भी समय स्टॉप बटन से एजेंट को रोक सकते हैं। एक्सटेंशन का स्रोत कोड GitHub पर ऑडिट के लिए पूरी तरह से खुला है।
"WebBrain ने इस ब्राउज़र को डीबग करना शुरू कर दिया" बैनर क्या है? WebBrain CDP का उपयोग क्यों करता है?
किसी पृष्ठ पर विश्वसनीय रूप से कार्य करने के लिए, WebBrain मानक के माध्यम से Chrome DevTools प्रोटोकॉल (CDP) का उपयोग करता है chrome.debugger एक्सटेंशन एपीआई - यही Chrome के "WebBrain ने इस ब्राउज़र को डीबग करना शुरू किया" बैनर को ट्रिगर करता है। सीडीपी वह है जो एजेंट को क्लिक करने और टाइप करने की सुविधा देता है विश्वसनीय इनपुट घटनाएँ आधुनिक साइटें वास्तव में इसका सम्मान करती हैं; किसी सामग्री स्क्रिप्ट से सक्रिय सिंथेटिक ईवेंट कई साइटों, वेब घटकों और फ़्रेमवर्क-नियंत्रित इनपुट द्वारा अस्वीकार कर दिए जाते हैं। यह भी है कि कैसे WebBrain विज़न फ़ॉलबैक के लिए पिक्सेल-सटीक स्क्रीनशॉट कैप्चर करता है और पहुँचता है क्रॉस-ओरिजिनल आईफ्रेम और शैडो डोम वह सामग्री स्क्रिप्ट नहीं देख सकती.
केवल पढ़ने योग्य आस्क मोड को सीडीपी की आवश्यकता नहीं है - पेज और एक्सेसिबिलिटी-ट्री रीड्स सामान्य सामग्री स्क्रिप्ट के माध्यम से चलते हैं। यह है अधिनियम मोड विश्वसनीयता और क्रॉस-ओरिजिन कार्य जिसके लिए इसकी आवश्यकता होती है, और मेनिफेस्ट V3 एक्सटेंशन में विश्वसनीय इनपुट के लिए कोई गैर-डीबगर एपीआई नहीं है। WebBrain डिबगर जोड़ता है केवल तभी जब किसी कार्य को इसकी आवश्यकता हो, प्रति टैब, और पूरा एक्सटेंशन ओपन-सोर्स है ताकि आप ऑडिट कर सकें कि सत्र वास्तव में क्या करता है। सीडीपी शक्तिशाली है, इसलिए हम इसके पदचिह्न को नियंत्रित करने वाली चीज़ के रूप में मानते हैं - मांग पर संलग्न करें, इसे पढ़ते रहें - और इसे और कड़ा करना हमारे सुरक्षा रोडमैप पर है।
यह मुझसे बहुत सारे प्रश्न पूछ रहा है। क्या मैं उसे अक्षम कर सकता हूँ?
वे अनुमोदन संकेत आपकी सुरक्षा के लिए हैं। यहां तक कि उन साइटों पर भी जिन पर आप भरोसा करते हैं, दुर्भावनापूर्ण अभिनेता एलएलएम निर्देशों की नकल कर सकते हैं या ऐसी सामग्री डाल सकते हैं जो एजेंट को आपकी ओर से ऐसे काम करने के लिए मजबूर करने की कोशिश करती है जिन्हें आप स्वीकार नहीं करेंगे। इसीलिए WebBrain परिणामी कार्रवाई से पहले पूछता है। यदि आप अभी भी उन संकेतों का पालन नहीं करना चाहते हैं, तो टाइप करें /dangerously-skip-permissions साइड पैनल में, या साइड प्लगइन खोलें, हेडर में व्हील आइकन पर क्लिक करें, पर जाएं अनुमतियाँ टैब इन settings.html, और स्विच ऑफ कर दें परिणामी कार्रवाई से पहले पूछें.
मैं वेब स्क्रैपिंग और डेटा निष्कर्षण के लिए WebBrain का उपयोग कैसे करूं?
बस कोई भी वेब पेज खोलें, WebBrain साइड पैनल खोलें, और प्राकृतिक भाषा में पूछें: "इस पेज से सभी उत्पाद के नाम और कीमतें निकालें", "इस पेज पर सभी ईमेल पते प्राप्त करें", या "इस लेख को बुलेट बिंदुओं में सारांशित करें"। एआई एजेंट पृष्ठ सामग्री को पढ़ता है, संरचना को समझता है, और निकाले गए डेटा को वापस करता है। अधिक जटिल स्क्रैपिंग के लिए, एक्ट मोड पर स्विच करें और एजेंट पेजों के बीच नेविगेट कर सकता है, पेजिनेशन बटन पर क्लिक कर सकता है और कई पेजों पर डेटा एकत्र कर सकता है।
क्या WebBrain सीधे एपीआई को कॉल करता है, या यह हमेशा यूआई पर क्लिक करता है?
डिफ़ॉल्ट रूप से, WebBrain हमेशा दृश्यमान यूआई के माध्यम से जाता है किसी भी ऐसी कार्रवाई के लिए जो कुछ भी बनाती है, संशोधित करती है, हटाती है, भेजती है, सबमिट करती है, पोस्ट करती है या खरीदती है। यह पृष्ठ पर नेविगेट करेगा, फ़ॉर्म भरेगा, और बटन पर क्लिक करेगा - बिल्कुल वैसे ही जैसे आप करेंगे। यह सीधे पृष्ठभूमि के माध्यम से REST/GraphQL एंडपॉइंट्स को कॉल करने से इंकार कर देता है fetch() उत्परिवर्तन के लिए. यह जानबूझकर किया गया है: एपीआई क्रियाएं अदृश्य हैं (आप नहीं देख सकते कि क्या भेजा जा रहा है), अक्सर अलग-अलग ऑथ टोकन की आवश्यकता होती है जिन्हें आपने कॉन्फ़िगर नहीं किया होगा, और दृश्यमान गलत-क्लिक की तुलना में बहुत बड़ा ब्लास्ट त्रिज्या होता है। यूआई-फर्स्ट का मतलब है कि आपके सामान्य ब्राउज़र सत्र में सब कुछ स्क्रीन पर है, और रोका जा सकता है।
के लिए पढ़ना डेटा - एक README प्राप्त करना, एक समस्या को देखना, साइटों पर कीमतों की तुलना करना, एक स्थिति पृष्ठ की जाँच करना - WebBrain स्वतंत्र रूप से पृष्ठभूमि HTTP अनुरोधों का उपयोग करता है fetch_url और research_url उपकरण. पढ़ना अभिनय के समान नहीं है; यह किसी दूरस्थ सेवा पर कुछ भी नहीं बदलता है, इसलिए सुरक्षा संबंधी चिंताएँ लागू नहीं होती हैं।
यदि आप विशेष रूप से किसी विशेष कार्य के लिए एपीआई म्यूटेशन की अनुमति देना चाहते हैं, तो टाइप करें /allow-api आपके संदेश के प्रारंभ में (वैकल्पिक रूप से उसके बाद एक संक्षिप्त कार्य विवरण)। यह प्रति-वार्तालाप ओवरराइड WebBrain को एपीआई एंडपॉइंट पर वापस आने देता है जब यूआई वास्तव में विफल या अव्यवहार्य होता है, जबकि यूआई काम करने पर भी यूआई को प्राथमिकता देता है। ओवरराइड सक्रिय होने पर एक चिपचिपा बैज इनपुट क्षेत्र के ऊपर दिखाई देता है, और जब आप वार्तालाप को रीसेट करते हैं तो यह साफ़ हो जाता है।
क्या मैं इसे LM Studio में भी उपयोग कर सकता हूँ?
हाँ. WebBrain के केवल पढ़ने योग्य नेटवर्क उपकरण — fetch_url और research_url - स्टैंडअलोन के रूप में भी शिप करें LM Studio प्लगइन पर वेबब्रेन/वेब-टूल्स. के साथ स्थापित करें lms clone webbrain/web-tools और इसे किसी भी LM Studio चैट में चालू करें - कोई भी टूल-सक्षम मॉडल ब्राउज़र एक्सटेंशन इंस्टॉल किए बिना उन दो टूल को कॉल कर सकता है। शुद्ध नोड, कोई हेडलेस ब्राउज़र नहीं। स्रोत: एलएमस्टूडियो-प्लगइन/.
जब WebBrain एक पेज पर काम कर रहा हो तो क्या मैं दूसरे टैब पर स्विच कर सकता हूँ?
हां, Chrome पर - एजेंट बैकग्राउंड सर्विस वर्कर में चलता है और उस टैब से जुड़ा होता है जिस पर उसने शुरुआत की थी, इसलिए जब आप फोकस कहीं और ले जाते हैं तब भी यह उस विशिष्ट टैब पर क्लिक, टाइप और पढ़ता रहता है। उपकरण जो एक टैब को लक्षित करते हैं (सीडीपी क्लिक, टाइप, नेविगेट, स्क्रीनशॉट) सभी Chrome में पृष्ठभूमि वाले टैब पर काम करते हैं। किसी कार्य के चलने के दौरान साइडबार इनपुट को लॉक कर देता है ताकि आप गलती से नए टैब पर दूसरा कार्य शुरू न कर सकें - आपको वर्तमान वाले को प्रतीक्षा करने या रोकने की आवश्यकता होगी। ध्यान दें कि ब्राउज़र पृष्ठभूमि टैब पर टाइमर और एनिमेशन को दबा देते हैं, इसलिए भारी एनिमेटेड साइटें थोड़ी धीमी प्रतिक्रिया दे सकती हैं।
Firefox पर, एजेंट अपने मूल टैब पर भी चलता रहेगा, लेकिन ऑटो-स्क्रीनशॉट सीमित हैं: Firefox का स्क्रीनशॉट एपीआई केवल वर्तमान सक्रिय टैब को कैप्चर कर सकता है, पृष्ठभूमि में किसी विशिष्ट टैब को नहीं। WebBrain इसका पता लगाता है और मॉडल को एक असंबंधित पृष्ठ की छवि खिलाने के बजाय उस मोड़ के लिए स्क्रीनशॉट को छोड़ देता है। जब तक आप उसके टैब पर वापस नहीं जाते, एजेंट टेक्स्ट-आधारित संदर्भ से योजना बनाना जारी रखेगा।
जिस टैब पर एजेंट काम कर रहा है, उसी टैब पर सक्रिय रूप से क्लिक करने या टाइप करने से बचें - इससे दौड़ की स्थितियाँ बनती हैं जहाँ आप और एजेंट एक ही पृष्ठ पर लड़ते हैं। टैब स्विच करना ठीक है; एक ही टैब का सह-ड्राइविंग नहीं है।
प्रोफ़ाइल स्वतः-भरण कैसे काम करता है, और क्या यह सुरक्षित है?
प्रोफ़ाइल स्वतः-भरण एक वैकल्पिक सुविधा है सेटिंग्स → प्रोफ़ाइल. आप एक संक्षिप्त जीवनी दर्ज करें - नाम, कार्य ईमेल, कंपनी, और ए फेंकना कम जोखिम वाले साइनअप के लिए पासवर्ड - और इसे चालू करें। सक्षम होने पर, WebBrain उस टेक्स्ट को एजेंट के सिस्टम प्रॉम्प्ट में जोड़ देता है ताकि वह हर बार बिना पूछे साइनअप फॉर्म भर सके।
पाठ संग्रहीत है सादे पाठ में आपके ब्राउज़र के स्थानीय संग्रहण में. यह है नहीं WebBrain प्रोजेक्ट को प्रेषित, लेकिन यह है सिस्टम प्रॉम्प्ट के भाग के रूप में, प्रत्येक मोड़ पर आपके द्वारा कॉन्फ़िगर किए गए किसी भी एलएलएम प्रदाता को भेजा जाता है। डिफ़ॉल्ट रूप से बंद.
महत्वपूर्ण खातों के लिए पासवर्ड न रखें (Google, Apple, iCloud, बैंकिंग, कार्य SSO, प्राथमिक ईमेल) यहां। उन खातों को 2FA का उपयोग करना चाहिए और किसी भी तरह से किसी एजेंट को नहीं सौंपा जाना चाहिए। न्यूज़लेटर साइनअप और निःशुल्क परीक्षणों के लिए आपके द्वारा पुन: उपयोग किया जाने वाला एक थ्रोअवे पासवर्ड इच्छित उपयोग का मामला है।
क्या स्क्रीनशॉट रिडक्शन सेटिंग यह गारंटी देती है कि मेरा निजी डेटा कभी भी क्लाउड विज़न मॉडल तक नहीं पहुंचेगा?
नहीं - यह जोखिम को कम करता है, इसकी कोई गारंटी नहीं है। सक्षम होने पर (सेटिंग्स → मल्टीमॉडल → स्क्रीनशॉट रिडक्शन, डिफ़ॉल्ट रूप से बंद), WebBrain फॉर्म फ़ील्ड और टेक्स्ट को पिक्सेलित करता है जो प्रत्येक स्क्रीनशॉट पर एक ईमेल पते या फोन नंबर की तरह दिखता है पहले इसे एक विज़न मॉडल में भेजा जाता है। DOM हेयुरिस्टिक्स का उपयोग करके डिटेक्शन पूरी तरह से आपके डिवाइस पर चलता है; कुछ भी अतिरिक्त प्रसारित नहीं होता है.
यह सर्वोत्तम-प्रयास और असफलता-रहित है। यदि डिटेक्टर किसी पृष्ठ पर नहीं चल सकता है - उदाहरण के लिए नेविगेशन के तुरंत बाद, पीडीएफ दर्शकों पर, या प्रतिबंधित ब्राउज़र पृष्ठों पर - स्क्रीनशॉट अभी भी भेजा जाता है अप्रकाशित अपने कार्य को निरस्त करने के बजाय। वह सामग्री जिसे DOM अनुमान नहीं देख सकता (कैनवास पर खींचा गया पाठ, छवियों के अंदर PII, असामान्य विजेट) भी फिसल सकता है। और सेटिंग केवल स्क्रीनशॉट को कवर करती है: पेज पाठ मॉडल को भेजा गया इसके द्वारा संशोधित नहीं किया गया है।
पूर्ण दृष्टि गोपनीयता के लिए, स्थानीय मॉडल का उपयोग करें। llama.cpp या Ollama जैसे ऑफ़लाइन प्रदाता के साथ, स्क्रीनशॉट और पेज टेक्स्ट आपकी मशीन को कभी नहीं छोड़ते हैं, इसलिए पहली बार में रिडक्ट करने के लिए कुछ भी नहीं है - यह एकमात्र कॉन्फ़िगरेशन है जहां गोपनीयता की गारंटी है। देखें "क्या मैं WebBrain का पूरी तरह ऑफ़लाइन उपयोग कर सकता हूँ?" ऊपर।
क्या आपके पास ऐसी मशीन नहीं है जो दृष्टि-सक्षम स्थानीय मॉडल चला सके? एक अच्छा मध्य मार्ग नियोजन और टूल कॉल के लिए एक छोटा स्थानीय मॉडल है (एक मामूली सीपीयू/जीपीयू के लिए पर्याप्त तेज़ और हल्का) जिसे विज़न उप-कॉल के लिए क्लाउड प्रदाता के साथ जोड़ा जाता है, जिसमें स्क्रीनशॉट रिडक्शन चालू होता है। आप अभी भी अपनी बातचीत और पेज टेक्स्ट को डिवाइस पर रखते हैं, और क्लाउड विज़न के लिए छोड़े जाने वाले प्रत्येक स्क्रीनशॉट में फॉर्म फ़ील्ड और पहचाने गए ईमेल/फ़ोन पहले धुंधले होते हैं - पूर्ण स्थानीय विज़न मॉडल के लिए हार्डवेयर की आवश्यकता के बिना क्लाउड एक्सपोज़र कम हो जाता है। विज़न स्प्लिट को नीचे कॉन्फ़िगर करें सेटिंग्स → विजन (ऊपर देखें "WebBrain क्लाउड एलएलएम बिलों को कैसे नियंत्रण में रखता है?")।
WebBrain कुकी बैनर और पेवॉल के साथ क्या करता है?
कुकी बैनर: WebBrain सामान्य फ्रेमवर्क (वनट्रस्ट, कुकीबॉट, डिडोमी, क्वांटकास्ट, गूगल फंडिंग चॉइस, ट्रस्टआर्क) से सहमति बैनर को पहचानता है और पेज के बारे में तर्क करने से पहले उन्हें खारिज कर देता है। प्राथमिकता "सभी को अस्वीकार करें" / "गैर-आवश्यक को अस्वीकार करें" / "केवल आवश्यक" है जब स्पष्ट रूप से दिखाई दे; यह "वरीयताएँ प्रबंधित करें" भूलभुलैया में गायब होने के बजाय "सभी को स्वीकार करें" पर वापस आ जाता है।
भुगतान: WebBrain पेवॉल की ईमानदारी से रिपोर्ट करता है और आपको बताता है कि यह वास्तव में क्या देख सकता है (हेडलाइन, डेक, पहला पैराग्राफ)। यह होता है नहीं पेवॉल्स को बायपास करने का प्रयास - कोई Archive.today, 12ft.io, कुकी क्लियरिंग, JS अक्षम करना, या रीडर-मोड ट्रिक्स नहीं। यदि आप पूरा लेख चाहते हैं, तो सदस्यता के साथ लॉग इन करें या उसी कहानी की मुफ्त कवरेज देखने के लिए WebBrain से पूछें।
क्या WebBrain ड्राई-रन मोड का समर्थन करता है?
के रूप में 7.0.0, अभी तक नहीं. ड्राई-रन मोड की योजना बनाई गई है और पहले से ही रोडमैप पर है।
WebBrain क्लाउड एलएलएम बिलों को कैसे नियंत्रण में रखता है?
तीन स्वतंत्र परतें:
टोकन-सचेत स्क्रीनशॉट। इससे पहले कि कोई छवि आपकी मशीन से बाहर जाए, WebBrain उसका आकार बदलता है (छोटा साइड कैप्ड, पहलू अनुपात को संरक्षित करता है) और इसे पुनरावृत्त रूप से JPEG-संपीड़ित करता है जब तक कि यह प्रति-मोड़ छवि-टोकन बजट में फिट न हो जाए। एक 2000×1200 स्क्रीनशॉट जिसकी कीमत आपको GPT-4o पर ~1,500 इनपुट टोकन होगी, पेज-रीडिंग कार्यों के लिए कोई व्यावहारिक हानि के बिना ~300-500 टोकन तक संपीड़ित हो जाता है। में क्रियान्वित किया गया _fitImageDimensions बजट गणित के लिए इकाई परीक्षणों के साथ।
स्मार्ट संदर्भ ट्रिमिंग. वार्तालाप इतिहास, टूल आउटपुट और इनलाइन DOM डंप को प्रति मोड़ पर सीमित किया जाता है और सक्रिय मॉडल की संदर्भ विंडो पूर्ण होने पर सबसे पहले छंटनी की जाती है। आप 10k टोकन से 100k तक चुपचाप चलने वाला गुब्बारा नहीं देखेंगे क्योंकि a read_page एक उपन्यास-लंबा लेख लौटाया।
समर्पित विज़न मॉडल. योजना और टूल कॉल के लिए एक सस्ते टेक्स्ट मॉडल (जैसे GPT-4o-मिनी) को केवल स्क्रीनशॉट के लिए एक अलग विज़न-सक्षम मॉडल (जैसे GPT-4o) के साथ जोड़ें, ताकि आपको हर एक मोड़ पर मल्टीमॉडल-मॉडल कीमतों का भुगतान न करना पड़े। के अंतर्गत कॉन्फ़िगर करें सेटिंग्स → विजन.
शुद्ध परिणाम: क्लाउड प्रदाताओं के साथ लंबे सत्र पूर्वानुमानित रहते हैं। पूर्ण नियंत्रण के लिए, स्थानीय रूप से llama.cpp का उपयोग करें - शून्य प्रति टोकन लागत।
क्या मैं WebBrain में योगदान कर सकता हूँ?
बिल्कुल! WebBrain MIT-लाइसेंस प्राप्त है और योगदान का स्वागत करता है। की जाँच करें GitHub भंडार मुद्दों, सुविधा अनुरोधों और योगदान दिशानिर्देशों के लिए।