ओपन-सोर्स एआई ब्राउज़र एजेंट

WebBrain एक मुफ़्त, ओपन-सोर्स ब्राउज़र एक्सटेंशन है जो आपके ब्राउज़र में AI एजेंट क्षमताएं लाता है। पेज पढ़ें, डेटा निकालें और वेब कार्यों को स्वचालित करें - अपनी पसंद के एलएलएम द्वारा संचालित। मालिकाना ब्राउज़र AI प्लगइन्स का स्व-होस्टेबल विकल्प।

एक्सटेंशन इंस्टॉल करें GitHub पर देखें
https://magazine.dev/local-ai-2026

स्थानीय एआई का भविष्य

जेन स्मिथ द्वारा · 8 मिनट पढ़ा गया
WebBrain.one
इस लेख को संक्षेप में प्रस्तुत करें
स्थानीय एलएलएम अब कई कार्यों में क्लाउड गुणवत्ता से मेल खाते हैं - बेहतर परिमाणीकरण, तेज़ उपभोक्ता जीपीयू और गोपनीयता-पहली पारी द्वारा संचालित।
लेखक 2026 के लिए क्या भविष्यवाणी करता है?
लेख प्रसंग याद आ रहा है
द्वारा 2026, लेखक को उम्मीद है कि 70%+ उपभोक्ता एआई वर्कलोड डिवाइस पर चलेगा।
इस पेज के बारे में कुछ भी पूछें...
डेमो

WebBrain को क्रियान्वित होते हुए देखें

देखें कि कैसे WebBrain पेज पढ़ता है, डेटा निकालता है और ब्राउज़र कार्यों को स्वचालित करता है।

विशेषताएं

ब्राउज़र AI में आपको जो कुछ भी चाहिए वह सब कुछ

एक पूर्ण विशेषताओं वाला AI एजेंट जो आपके ब्राउज़र साइडबार में रहता है और किसी भी वेब पेज को समझता है।

📖

पृष्ठ समझ

किसी भी वेब पेज को पढ़ता और समझता है - लेख, दस्तावेज़, डैशबोर्ड, फॉर्म। प्रश्न पूछें और वर्तमान पृष्ठ सामग्री से तुरंत उत्तर प्राप्त करें।

🤖

पूर्ण ब्राउज़र एजेंट

अपनी ओर से पृष्ठों पर क्लिक करें, टाइप करें, स्क्रॉल करें, नेविगेट करें और उनके साथ इंटरैक्ट करें। प्राकृतिक भाषा निर्देशों के साथ दोहराए जाने वाले कार्यों को स्वचालित करें।

📊

डेटा निष्कर्षण

किसी भी पृष्ठ से संरचित डेटा निकालें - तालिकाएँ, सूचियाँ, लिंक, फ़ॉर्म। उत्पाद कैटलॉग, खोज परिणाम, या कोई पृष्ठ सामग्री निर्यात करें। पीडीएफ़ के साथ काम करता है.

🔌

बहु-प्रदाता एलएलएम

स्थानीय llama.cpp, OpenAI, क्लाउड और OpenRouter के साथ काम करता है। अपने पसंदीदा मॉडल का उपयोग करें - या स्थानीय एआई के साथ पूरी तरह से ऑफ़लाइन चलाएं।

🛡️

गोपनीयता पहले

आपका डेटा आपका ही रहता है. शून्य डेटा रिसाव के लिए स्थानीय एलएलएम के साथ चलाएं। कोई टेलीमेट्री नहीं, कोई ट्रैकिंग नहीं, कोई अकाउंट आवश्यक नहीं। पूरी तरह से खुला स्रोत.

स्मार्ट प्रसंग

स्वचालित संदर्भ प्रबंधन टोकन अतिप्रवाह को रोकता है। बातचीत के इतिहास को बुद्धिमानी से छोटा करता है और सुचारू, निर्बाध सत्रों के लिए टूल आउटपुट को सीमित करता है।

👁️

समर्पित विज़न मॉडल

स्क्रीनशॉट पढ़ने के लिए एक अलग दृष्टि-सक्षम मॉडल के साथ योजना बनाने के लिए एक तेज़ टेक्स्ट-केवल मॉडल को जोड़ें। हर चीज़ के लिए एक बड़े मल्टीमॉडल मॉडल का उपयोग करने की तुलना में सस्ता और तेज़।

👤

प्रोफ़ाइल स्वतः भरण

वैकल्पिक प्लेनटेक्स्ट बायो - नाम, कार्य ईमेल, कंपनी, एक थ्रोअवे पासवर्ड - एजेंट को हर बार पूछे बिना कम जोखिम वाले साइनअप फॉर्म के माध्यम से आसानी से जाने देता है। डिफ़ॉल्ट रूप से बंद, सभी स्थानीय रूप से संग्रहीत।

🍪

कुकी और पेवॉल जागरूक

पेज के बारे में तर्क करने से पहले सहमति बैनर (वनट्रस्ट, कुकीबॉट, डिडोमी, क्वांटकास्ट) को खारिज कर देता है। पेवॉल्स का पता लगाता है और आपको लेख सामग्री गढ़ने या उन्हें बायपास करने की कोशिश करने के बजाय ईमानदारी से बताता है।

🧩

वैकल्पिक कैप्चा सॉल्वर

ए प्लग इन करें कैपसॉल्वर एपीआई कुंजी और एजेंट reCAPTCHA v2/v3, hCaptcha, और Cloudflare टर्नस्टाइल को स्वचालित रूप से हल कर देंगे जब वे किसी चरण को अवरुद्ध कर देंगे - पूछने के लिए रुकने के बजाय। डिफ़ॉल्ट रूप से बंद, BYO कुंजी, जब तक आप इसे चालू नहीं करते, कोई कैप्चा सेवा भेजी या संपर्क नहीं की जाती है।

🌐

बहुभाषी यूआई

प्लगइन अंग्रेज़ी, Español, Français, Türkçe और 中文 में भेजा जाता है। पहली बार उपयोग करने पर आपकी ब्राउज़र भाषा का स्वतः पता लगाता है; साइड पैनल में ग्लोब आइकन से किसी भी समय स्विच करें। मार्केटिंग साइट को मिलान के लिए स्थानीयकृत किया गया है।

💰

टोकन-जागरूक

आपकी मशीन से निकलने से पहले स्क्रीनशॉट का आकार बदल दिया जाता है और उन्हें पुनरावृत्त रूप से JPEG-संपीड़ित किया जाता है, जिससे छवि टोकन छोटे रहते हैं। स्मार्ट संदर्भ ट्रिमिंग और टूल-आउटपुट कैप क्लाउड बिलों को पूर्वानुमानित रखते हैं - लंबे सत्रों पर कोई आश्चर्यजनक खर्च नहीं होता है।

सुरक्षा

WebBrain आपको कैसे नियंत्रण में रखता है

ब्राउज़र वह जगह है जहां वास्तविक कार्य होता है - और एक प्रतिकूल सतह। WebBrain रीड-ओनली आस्क मोड में शुरू होता है, कार्य करने से पहले पूछता है, छिपे हुए शीघ्र इंजेक्शन के खिलाफ बचाव करता है, और सख्त नियमों के साथ संवेदनशील क्षेत्रों को संभालता है।

एलएलएम प्रदाता

अपना खुद का एआई लाओ

किसी भी OpenAI-संगत API से कनेक्ट करें या स्थानीय मॉडल चलाएँ। एक्सटेंशन सेटिंग से किसी भी समय प्रदाता बदलें। स्थानीय मॉडलों के लिए, उन्हें कम से कम 16k-टोकन संदर्भ विंडो दें (8k कॉम्पैक्ट मोड के साथ काम करता है) - WebBrain बातचीत को सीमा के करीब पहुंचने पर ऑटो-कॉम्पैक्ट करता है।

🦙
llama.cpp
Ollama
OpenAI
Claude
OpenRouter
LM Studio
vLLM
Grok
Gemini
DeepSeek
Mistral
लॉन्च हैंडऑफ़ घोषणा के लिए WebBrain लोगो, एक दिल और Ollama लोगो
Ollama लॉन्च हैंडऑफ़

एक Ollama मॉडल चुनें, फिर इसे WebBrain को सौंप दें

एक नया लॉन्च पथ एक टर्मिनल कमांड से स्थानीय Ollama मॉडल के लिए WebBrain को कॉन्फ़िगर कर सकता है। यह आज हमारी Ollama शाखा से उपलब्ध है, जबकि हम अपस्ट्रीम एकीकरण की दिशा में काम कर रहे हैं।

घोषणा पढ़ें
आरंभ करें

WebBrain स्थापित करें

Chrome, Edge, और Firefox के लिए उपलब्ध है। मुफ़्त, खुला स्रोत, किसी खाते की आवश्यकता नहीं।

Chrome और क्रोमियम

मेनिफेस्ट V3 · Chrome 116+ · ब्रेव, ओपेरा, विवाल्डी और अन्य क्रोमियम-संगत ब्राउज़रों के साथ भी काम करता है।

माइक्रोसॉफ्ट Edge

मेनिफेस्ट V3 · विंडोज़ 10/11 · विंडोज़ पर Microsoft Edge की आवश्यकता है।

WebBrain क्यों?

WebBrain की तुलना कैसे की जाती है?

WebBrain ब्राउज़र-मूल एआई प्लगइन्स और पूर्ण एजेंट फ्रेमवर्क के चौराहे पर बैठता है। यहां बताया गया है कि यह कैसे ढेर हो जाता है।

बनाम ब्राउज़र एआई प्लगइन्स

विशेषता WebBrain Chrome में क्लाउड
खुला स्रोतएमआईटी लाइसेंसमालिकाना
कीमतहमेशा के लिए मुफ़्तक्लाउड प्रो ($20/माह) की आवश्यकता है
स्थानीय एलएलएम समर्थनllama.cpp, Ollamaनहीं - केवल क्लाउड
बहु-प्रदातासभी OpenAI-संगत समापन बिंदुकेवल क्लाउड
Chromeहाँ (एमवी3)हाँ
Firefoxहाँ (एमवी2)नहीं
साइड पैनल यूआईहाँहाँ
पूछें / कार्य करें मोडहाँसमान
पूर्णतः ऑफ़लाइनहाँ (स्थानीय एलएलएम के साथ)नहीं - बादल आवश्यक है
स्व-मेज़बानहाँनहीं

बनाम एआई एजेंट फ्रेमवर्क (विभिन्न श्रेणी)

पहलू WebBrain ओपनक्लॉ/ब्राउज़र-उपयोग/आदि।
यह क्या है?ब्राउज़र एक्सटेंशन (अंतिम-उपयोगकर्ता उपकरण)एजेंट फ्रेमवर्क/एसडीके (डेवलपर टूल)
लक्षित उपयोगकर्ताकोई भी - कोई कोडिंग की आवश्यकता नहीं हैडेवलपर्स ऑटोमेशन का निर्माण कर रहे हैं
स्थापनाएक-क्लिक ब्राउज़र इंस्टॉल करेंपायथन/डॉकर सेटअप आवश्यक है
यूआईअंतर्निहित साइड पैनल चैटकोई यूआई नहीं - केवल कोड या एपीआई
ब्राउज़र नियंत्रणसामग्री स्क्रिप्ट (हल्का)सीडीपी/नाटककार (पूर्ण नियंत्रण)
मल्टी-टैब वर्कफ़्लोज़प्रति-टैब वार्तालापप्रोग्रामयोग्य मल्टी-टैब ऑर्केस्ट्रेशन
हेडलेस मोडनहीं - आपके ब्राउज़र में चलता हैहाँ - नेतृत्वहीन स्वचालन
विस्तारशीलताकस्टम एलएलएम प्रदाता जोड़ेंपूर्ण पायथन एसडीके, कस्टम उपकरण
के लिए सर्वोत्तमदैनिक ब्राउज़िंग एआई सहायकस्वचालित स्क्रैपिंग/परीक्षण पाइपलाइन

WebBrain उन अंतिम उपयोगकर्ताओं के लिए एक ब्राउज़र एक्सटेंशन है जो ब्राउज़ करते समय AI सहायक चाहते हैं। ओपनक्लॉ जैसे एजेंट फ्रेमवर्क स्वचालित ब्राउज़र पाइपलाइनों के निर्माण के लिए डेवलपर उपकरण हैं। अलग-अलग कार्यों के लिए अलग-अलग उपकरण - और आप दोनों का उपयोग कर सकते हैं।

अक्सर पूछे जाने वाले प्रश्न

अक्सर पूछे जाने वाले प्रश्न

क्या WebBrain क्लाउड के ब्राउज़र प्लगइन का एक निःशुल्क विकल्प है?

हाँ. WebBrain समान AI ब्राउज़र एजेंट क्षमताएं प्रदान करता है - पेज पढ़ना, डेटा निकालना, बटन क्लिक करना, फॉर्म भरना और मल्टी-स्टेप वर्कफ़्लो को स्वचालित करना। क्लाउड के मालिकाना ब्राउज़र प्लगइन के विपरीत, जिसके लिए क्लाउड प्रो सदस्यता की आवश्यकता होती है और केवल Anthropic के मॉडल के साथ काम करता है, WebBrain पूरी तरह से मुफ़्त, ओपन-सोर्स (एमआईटी लाइसेंस) है, और स्थानीय मॉडल सहित कई एलएलएम प्रदाताओं का समर्थन करता है जो पूरी तरह से आपकी मशीन पर चलते हैं।

WebBrain क्लाउड सदस्यता कितनी है?

WebBrain क्लाउड वर्तमान में है प्रति डिवाइस प्रोफ़ाइल $5/माह, फिलहाल क्लाउड प्रो से काफी सस्ता है। उचित उपयोग नीति के तहत उपयोग वर्तमान में असीमित है: सामान्य व्यक्तिगत उपयोग ठीक है, लेकिन अपमानजनक, स्वचालित, पुनर्विक्रय, या असामान्य रूप से उच्च मात्रा में उपयोग की अनुमति नहीं है।

सदस्यता उस ब्राउज़र + OS GUID के एक्सटेंशन द्वारा उत्पन्न डिवाइस पहचानकर्ता से जुड़ी होती है, उपयोगकर्ता खाते से नहीं। यदि वह पहचानकर्ता खो जाता है क्योंकि आप एक्सटेंशन स्टोरेज को रीसेट करते हैं, ब्राउज़र प्रोफ़ाइल हटाते हैं, ब्राउज़र को फिर से इंस्टॉल करते हैं, ब्राउज़र/ओएस बदलते हैं, या डिवाइस खो देते हैं, तो हम इसे पुनर्प्राप्त या स्थानांतरित नहीं कर सकते हैं और हम उस नुकसान के लिए रिफंड जारी नहीं करते हैं।

आप यहां से सदस्यता ले सकते हैं या बिलिंग प्रबंधित कर सकते हैं खाता के साथ प्लगइन सेटिंग पृष्ठ का अनुभाग बिलिंग प्रबंधित करें बटन. मैन्युअल रूप से रद्द करने के लिए, चेकआउट के समय आपके द्वारा उपयोग किए गए ईमेल पते के साथ ईमेल द्वारा हमसे संपर्क करें।

एन्क्रिप्टेड क्लाउड सिंक कैसे काम करता है?

क्लाउड सिंक सक्रिय WebBrain क्लाउड ग्राहकों के लिए एक वैकल्पिक सुविधा है। यह आपकी WebBrain यादों, प्रोफाइल ऑटो-फिल टेक्स्ट और एपीआई कुंजियों सहित समर्थित प्रदाता कॉन्फ़िगरेशन को सिंक करता है। यह होता है नहीं चैट इतिहास, ब्राउज़र इतिहास, पेज स्क्रीनशॉट, या लीगेसी OAuth एक्सेस और ताज़ा टोकन सिंक करें।

आपका ब्राउज़र आपके द्वारा चुने गए पासवर्ड के साथ अपलोड करने से पहले सिंक वॉल्ट को एन्क्रिप्ट करता है। WebBrain क्लाउड केवल एन्क्रिप्टेड वॉल्ट को संग्रहीत करता है; यह आपकी यादें, प्रोफ़ाइल टेक्स्ट, प्रदाता सेटिंग्स, या एपीआई कुंजी नहीं पढ़ सकता है, और यह आपके लिए सिंक पासवर्ड पुनर्प्राप्त नहीं कर सकता है।

ईमेल फ़ील्ड WebBrain क्लाउड मैजिक-लिंक बिलिंग/सदस्यता प्रमाणीकरण के लिए है। यह कोई खाता पासवर्ड नहीं है. यदि यूआई कहता है कि क्लाउड सिंक में पासवर्ड बदलें, तो इसका मतलब है एन्क्रिप्शन पासवर्ड सिंक करें, WebBrain खाता पासवर्ड नहीं।

यदि आप सिंक पासवर्ड भूल जाते हैं, तो पुराने एन्क्रिप्टेड क्लाउड वॉल्ट को डिक्रिप्ट नहीं किया जा सकता है। आप क्लाउड वॉल्ट को रीसेट कर सकते हैं और उस डिवाइस से एक नई एन्क्रिप्टेड कॉपी अपलोड कर सकते हैं जिसमें अभी भी स्थानीय रूप से डेटा मौजूद है।

WebBrain की तुलना OpenClaw, ब्राउज़र-यूज़ और अन्य AI एजेंट फ्रेमवर्क से कैसे की जाती है?

वे उपकरणों की विभिन्न श्रेणियां हैं। WebBrain एक ब्राउज़र एक्सटेंशन है - आप इसे Chrome या Firefox में इंस्टॉल करें और साइड पैनल में इसके साथ चैट करें, किसी कोडिंग की आवश्यकता नहीं है। ओपनक्लॉ और ब्राउज़र-यूज़ जैसे फ्रेमवर्क, आमतौर पर हेडलेस ब्राउज़र और सीडीपी का उपयोग करके पायथन में स्वचालित ब्राउज़र पाइपलाइन बनाने के लिए डेवलपर एसडीके हैं। इसे इस तरह से सोचें: WebBrain AI सहायक के साथ दैनिक ब्राउज़िंग के लिए है; एजेंट फ्रेमवर्क स्क्रैपिंग बॉट और टेस्ट ऑटोमेशन के निर्माण के लिए हैं। आप दोनों का उपयोग कर सकते हैं - वे एक दूसरे के पूरक हैं।

क्या मैं WebBrain का पूरी तरह ऑफ़लाइन उपयोग कर सकता हूँ?

हाँ. WebBrain का डिफ़ॉल्ट प्रदाता llama.cpp है, जो आपके कंप्यूटर पर एक स्थानीय AI मॉडल चलाता है। किसी एपीआई कुंजी की आवश्यकता नहीं है, एआई के लिए किसी इंटरनेट की आवश्यकता नहीं है, और कोई भी डेटा आपकी मशीन को कभी नहीं छोड़ता है। बस एक जीजीयूएफ मॉडल डाउनलोड करें, लामा-सर्वर शुरू करें, और आपके पास एक पूरी तरह से निजी एआई ब्राउज़र एजेंट है। आप Ollama का उपयोग इसके OpenAI-संगत समापन बिंदु के साथ भी कर सकते हैं।

WebBrain कौन से AI मॉडल का समर्थन करता है?

WebBrain चार प्रदाता प्रकारों का समर्थन करता है: llama.cpp (कोई भी स्थानीय GGUF मॉडल), OpenAI (GPT-4o, GPT-4, आदि), क्लाउड (मूल एपीआई के माध्यम से क्लाउड ओपस, सॉनेट, हाइकू), और OpenRouter (विभिन्न प्रदाताओं से 100+ मॉडल तक पहुंच)। कोई भी OpenAI-संगत एपीआई एंडपॉइंट काम करता है, इसलिए आप टुगेदर AI, Groq, Mistral, या OpenAI-संगत इंटरफ़ेस वाले किसी भी स्थानीय सर्वर जैसी सेवाओं का भी उपयोग कर सकते हैं।

सर्वाधिक अनुशंसित मॉडल कौन सा है?

के रूप में 21 अप्रैल 2026, शीर्ष सिफ़ारिश है Qwen 3.6 35B. क्यों: हमारे विज़न बेंचमार्क में (विज़न-मॉडल-शूटआउट), स्थानीय अनुमान के लिए व्यावहारिक रहते हुए इसने स्क्रीनशॉट समझ में जेम्मा 4 से बेहतर प्रदर्शन किया।

उपभोक्ता GPU के लिए, RTX 5090 आदर्श है, और RTX 4090 अक्सर INT4 ऑटोराउंड परिमाणीकरण के साथ काम करने योग्य होता है Intel/Qwen3.6-35B-A3B-int4-ऑटोराउंड.

अधिकतम गति के लिए, हम इसे जारी रखने की सलाह देते हैं वीएलएलएम. नमूना आदेश:

python -u -m vllm.entrypoints.openai.api_server --model Intel/Qwen3.6-35B-A3B-int4-AutoRound --served-model-name qwen3.6-35b --quantization auto --dtype bfloat16 --max-model-len 65536 --max-num-batched-tokens 32768 --max-num-seqs 4 --host 0.0.0.0 --port 8000 --gpu-memory-utilization 0.92 --enable-prefix-caching --enable-chunked-prefill --limit-mm-per-prompt '{"image": 4, "video": 1}' --mm-processor-cache-type shm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --trust-remote-code --allowed-origins '["*"]' --speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.6-35B-A3B-DFlash", "num_speculative_tokens": 15}' --attention-backend flash_attn

DFlash सट्टा डिकोडिंग वैकल्पिक है।

अपने नेटवर्क पर स्थानीय एलएलएम सर्वर (vLLM, Ollama, llama.cpp) से कनेक्ट करते समय मुझे "फ़ेच करने में विफल" संदेश मिल रहा है।

यदि आपका एलएलएम सर्वर आपके स्थानीय नेटवर्क पर एक अलग मशीन पर है (उदाहरण के लिए) http://192.168.1.x:8000), Chrome अनुरोध को तब तक ब्लॉक करता है जब तक सर्वर नहीं भेजता CORS शीर्षलेख. समाधान आपके सर्वर पर निर्भर करता है:

वीएलएलएम: से शुरू करें --allowed-origins '["*"]' (मान JSON सूची होना चाहिए)।
Ollama: पर्यावरण चर सेट करें OLLAMA_ORIGINS=* शुरू करने से पहले.
llama.cpp: CORS डिफ़ॉल्ट रूप से सक्षम है - किसी परिवर्तन की आवश्यकता नहीं है।

यदि आपका सर्वर चालू है localhost (ब्राउज़र के समान मशीन), CORS की आमतौर पर आवश्यकता नहीं होती है। समस्या केवल स्थानीय नेटवर्क पर क्रॉस-मशीन कनेक्शन को प्रभावित करती है। सुनिश्चित करें कि आपका आधार URL WebBrain सेटिंग्स के साथ समाप्त होता है /v1 (उदा. http://192.168.1.47:8000/v1). अपवाद: ब्राउज़र एक्सटेंशन से उपयोग किए गए Ollama की अभी भी आवश्यकता हो सकती है OLLAMA_ORIGINS; नीचे Ollama FAQ देखें।

Ollama localhost पर WebBrain एक्सटेंशन से 403 क्यों लौटाता है?

हाल के Ollama संस्करण ब्राउज़र-एक्सटेंशन मूल से अनुरोधों को अस्वीकार कर सकते हैं, भले ही Ollama उसी मशीन पर चल रहा हो। एक्सटेंशन एक भेजता है Origin जैसे chrome-extension://... या moz-extension://..., और Ollama 403 का उत्तर दे सकता है जब तक कि उन मूलों की अनुमति न हो।

किसी भी Ollama डेस्कटॉप ऐप से बाहर निकलें जिसमें पहले से ही पोर्ट है 11434, फिर इनमें से किसी एक कमांड से Ollama प्रारंभ करें:

OLLAMA_ORIGINS="*" ollama serve
OLLAMA_ORIGINS="chrome-extension://*,moz-extension://*" ollama serve

WebBrain के Ollama बेस यूआरएल को इस पर सेट रखें http://localhost:11434/v1. टर्मिनल curl चेक इस सेटिंग के बिना भी काम कर सकते हैं क्योंकि वे ब्राउज़र-एक्सटेंशन मूल नहीं भेजते हैं।

क्या WebBrain Firefox पर काम करता है?

हाँ. WebBrain एक Chrome संस्करण (मैनिफेस्ट V3, साइडपैनल एपीआई का उपयोग करके) और एक Firefox संस्करण (मैनिफेस्ट V2, साइडबार_एक्शन का उपयोग करके) दोनों के साथ आता है। दोनों संस्करणों में समान विशेषताएं हैं। Firefox संस्करण को विकास के लिए अस्थायी ऐड-ऑन के रूप में लोड किया जा सकता है, या स्थायी स्थापना के लिए addons.mozilla.org पर प्रकाशित किया जा सकता है।

क्या मैं Chrome के साइड पैनल की तरह Firefox साइडबार को बाएँ से दाएँ घुमा सकता हूँ?

हां - Firefox का साइडबार डिफ़ॉल्ट रूप से बाईं ओर है, लेकिन आप इसे फ़्लिप कर सकते हैं। साइडबार हेडर में कहीं भी राइट-क्लिक करें और चुनें साइडबार को दाईं ओर ले जाएँ (या उपयोग करें देखें → साइडबार → साइडबार को दाईं ओर ले जाएँ मेनू बार से)। पुनः प्रारंभ होने पर स्थिति बनी रहती है। Chrome का साइडपैनल डिफ़ॉल्ट रूप से दाईं ओर है और पैनल से ही उपयोगकर्ता द्वारा चलाया नहीं जा सकता है।

क्या विवाल्डी के वेब पैनल में WebBrain का उपयोग करते समय कोई सीमाएँ हैं?

हाँ. विवाल्डी वेब पैनल्स जैसे देशी जावास्क्रिप्ट संवादों को दबा देते हैं confirm(), alert(), और prompt(). WebBrain का आस्क, एक्ट और डेव मोड स्विच अब उन संवादों पर निर्भर नहीं है, लेकिन कुछ माध्यमिक क्रियाएं अभी भी निर्भर करती हैं।

नई बातचीत: वेब पैनल में, बटन कुछ भी नहीं करता हुआ दिखाई दे सकता है क्योंकि इसका पुष्टिकरण संवाद दबा हुआ है। WebBrain पैनल आइकन पर राइट-क्लिक करें, चुनें → नया टैब खोलें, और उपयोग करें नई बातचीत उस नियमित टैब से.

रिकॉर्डिंग: प्रयोग न करें /record अभी के लिए विवाल्डी में। यदि रिकॉर्डिंग विफल हो जाती है, तो विवाल्डी त्रुटि चेतावनी छिपा सकता है और कोई दृश्यमान स्पष्टीकरण नहीं छोड़ सकता है।

सेटिंग्स, इतिहास, निशान और Ollama हैंडऑफ़: इनमें मूल संवाद भी शामिल हैं, लेकिन WebBrain आम तौर पर उन्हें नियमित टैब के रूप में खोलता है, जहां वे काम करते हैं। यदि आप मैन्युअल रूप से किसी को वेब पैनल में रखते हैं, तो संवाद-निर्भर क्रियाओं का उपयोग करने से पहले इसे एक सामान्य टैब में खोलें।

क्या WebBrain का उपयोग सुरक्षित है? क्या यह वेब पेजों को संशोधित कर सकता है?

WebBrain में तीन मोड हैं। आस्क मोड (डिफ़ॉल्ट) केवल-पढ़ने के लिए है और पृष्ठ पर कुछ भी संशोधित नहीं कर सकता। एक्ट मोड ब्राउज़र क्रियाओं जैसे क्लिक करना, टाइप करना और नेविगेट करना सक्षम बनाता है, जबकि डेव मोड पेज-डीबगिंग टूल जोड़ता है। परिणामी कार्रवाइयों के लिए डिफ़ॉल्ट रूप से अनुमोदन की आवश्यकता होती है; यदि वह अनुमति गेट बंद है, तो WebBrain एक दृश्यमान चेतावनी बैनर प्रदर्शित करता है। आप किसी भी समय स्टॉप बटन से एजेंट को रोक सकते हैं। एक्सटेंशन का स्रोत कोड GitHub पर ऑडिट के लिए पूरी तरह से खुला है।

"WebBrain ने इस ब्राउज़र को डीबग करना शुरू कर दिया" बैनर क्या है? WebBrain CDP का उपयोग क्यों करता है?

किसी पृष्ठ पर विश्वसनीय रूप से कार्य करने के लिए, WebBrain मानक के माध्यम से Chrome DevTools प्रोटोकॉल (CDP) का उपयोग करता है chrome.debugger एक्सटेंशन एपीआई - यही Chrome के "WebBrain ने इस ब्राउज़र को डीबग करना शुरू किया" बैनर को ट्रिगर करता है। सीडीपी वह है जो एजेंट को क्लिक करने और टाइप करने की सुविधा देता है विश्वसनीय इनपुट घटनाएँ आधुनिक साइटें वास्तव में इसका सम्मान करती हैं; किसी सामग्री स्क्रिप्ट से सक्रिय सिंथेटिक ईवेंट कई साइटों, वेब घटकों और फ़्रेमवर्क-नियंत्रित इनपुट द्वारा अस्वीकार कर दिए जाते हैं। यह भी है कि कैसे WebBrain विज़न फ़ॉलबैक के लिए पिक्सेल-सटीक स्क्रीनशॉट कैप्चर करता है और पहुँचता है क्रॉस-ओरिजिनल आईफ्रेम और शैडो डोम वह सामग्री स्क्रिप्ट नहीं देख सकती.

केवल पढ़ने योग्य आस्क मोड को सीडीपी की आवश्यकता नहीं है - पेज और एक्सेसिबिलिटी-ट्री रीड्स सामान्य सामग्री स्क्रिप्ट के माध्यम से चलते हैं। यह है अधिनियम मोड विश्वसनीयता और क्रॉस-ओरिजिन कार्य जिसके लिए इसकी आवश्यकता होती है, और मेनिफेस्ट V3 एक्सटेंशन में विश्वसनीय इनपुट के लिए कोई गैर-डीबगर एपीआई नहीं है। WebBrain डिबगर जोड़ता है केवल तभी जब किसी कार्य को इसकी आवश्यकता हो, प्रति टैब, और पूरा एक्सटेंशन ओपन-सोर्स है ताकि आप ऑडिट कर सकें कि सत्र वास्तव में क्या करता है। सीडीपी शक्तिशाली है, इसलिए हम इसके पदचिह्न को नियंत्रित करने वाली चीज़ के रूप में मानते हैं - मांग पर संलग्न करें, इसे पढ़ते रहें - और इसे और कड़ा करना हमारे सुरक्षा रोडमैप पर है।

यह मुझसे बहुत सारे प्रश्न पूछ रहा है। क्या मैं उसे अक्षम कर सकता हूँ?

वे अनुमोदन संकेत आपकी सुरक्षा के लिए हैं। यहां तक ​​कि उन साइटों पर भी जिन पर आप भरोसा करते हैं, दुर्भावनापूर्ण अभिनेता एलएलएम निर्देशों की नकल कर सकते हैं या ऐसी सामग्री डाल सकते हैं जो एजेंट को आपकी ओर से ऐसे काम करने के लिए मजबूर करने की कोशिश करती है जिन्हें आप स्वीकार नहीं करेंगे। इसीलिए WebBrain परिणामी कार्रवाई से पहले पूछता है। यदि आप अभी भी उन संकेतों का पालन नहीं करना चाहते हैं, तो टाइप करें /dangerously-skip-permissions साइड पैनल में, या साइड प्लगइन खोलें, हेडर में व्हील आइकन पर क्लिक करें, पर जाएं अनुमतियाँ टैब इन settings.html, और स्विच ऑफ कर दें परिणामी कार्रवाई से पहले पूछें.

मैं वेब स्क्रैपिंग और डेटा निष्कर्षण के लिए WebBrain का उपयोग कैसे करूं?

बस कोई भी वेब पेज खोलें, WebBrain साइड पैनल खोलें, और प्राकृतिक भाषा में पूछें: "इस पेज से सभी उत्पाद के नाम और कीमतें निकालें", "इस पेज पर सभी ईमेल पते प्राप्त करें", या "इस लेख को बुलेट बिंदुओं में सारांशित करें"। एआई एजेंट पृष्ठ सामग्री को पढ़ता है, संरचना को समझता है, और निकाले गए डेटा को वापस करता है। अधिक जटिल स्क्रैपिंग के लिए, एक्ट मोड पर स्विच करें और एजेंट पेजों के बीच नेविगेट कर सकता है, पेजिनेशन बटन पर क्लिक कर सकता है और कई पेजों पर डेटा एकत्र कर सकता है।

क्या WebBrain सीधे एपीआई को कॉल करता है, या यह हमेशा यूआई पर क्लिक करता है?

डिफ़ॉल्ट रूप से, WebBrain हमेशा दृश्यमान यूआई के माध्यम से जाता है किसी भी ऐसी कार्रवाई के लिए जो कुछ भी बनाती है, संशोधित करती है, हटाती है, भेजती है, सबमिट करती है, पोस्ट करती है या खरीदती है। यह पृष्ठ पर नेविगेट करेगा, फ़ॉर्म भरेगा, और बटन पर क्लिक करेगा - बिल्कुल वैसे ही जैसे आप करेंगे। यह सीधे पृष्ठभूमि के माध्यम से REST/GraphQL एंडपॉइंट्स को कॉल करने से इंकार कर देता है fetch() उत्परिवर्तन के लिए. यह जानबूझकर किया गया है: एपीआई क्रियाएं अदृश्य हैं (आप नहीं देख सकते कि क्या भेजा जा रहा है), अक्सर अलग-अलग ऑथ टोकन की आवश्यकता होती है जिन्हें आपने कॉन्फ़िगर नहीं किया होगा, और दृश्यमान गलत-क्लिक की तुलना में बहुत बड़ा ब्लास्ट त्रिज्या होता है। यूआई-फर्स्ट का मतलब है कि आपके सामान्य ब्राउज़र सत्र में सब कुछ स्क्रीन पर है, और रोका जा सकता है।

के लिए पढ़ना डेटा - एक README प्राप्त करना, एक समस्या को देखना, साइटों पर कीमतों की तुलना करना, एक स्थिति पृष्ठ की जाँच करना - WebBrain स्वतंत्र रूप से पृष्ठभूमि HTTP अनुरोधों का उपयोग करता है fetch_url और research_url उपकरण. पढ़ना अभिनय के समान नहीं है; यह किसी दूरस्थ सेवा पर कुछ भी नहीं बदलता है, इसलिए सुरक्षा संबंधी चिंताएँ लागू नहीं होती हैं।

यदि आप विशेष रूप से किसी विशेष कार्य के लिए एपीआई म्यूटेशन की अनुमति देना चाहते हैं, तो टाइप करें /allow-api आपके संदेश के प्रारंभ में (वैकल्पिक रूप से उसके बाद एक संक्षिप्त कार्य विवरण)। यह प्रति-वार्तालाप ओवरराइड WebBrain को एपीआई एंडपॉइंट पर वापस आने देता है जब यूआई वास्तव में विफल या अव्यवहार्य होता है, जबकि यूआई काम करने पर भी यूआई को प्राथमिकता देता है। ओवरराइड सक्रिय होने पर एक चिपचिपा बैज इनपुट क्षेत्र के ऊपर दिखाई देता है, और जब आप वार्तालाप को रीसेट करते हैं तो यह साफ़ हो जाता है।

क्या मैं इसे LM Studio में भी उपयोग कर सकता हूँ?

हाँ. WebBrain के केवल पढ़ने योग्य नेटवर्क उपकरण — fetch_url और research_url - स्टैंडअलोन के रूप में भी शिप करें LM Studio प्लगइन पर वेबब्रेन/वेब-टूल्स. के साथ स्थापित करें lms clone webbrain/web-tools और इसे किसी भी LM Studio चैट में चालू करें - कोई भी टूल-सक्षम मॉडल ब्राउज़र एक्सटेंशन इंस्टॉल किए बिना उन दो टूल को कॉल कर सकता है। शुद्ध नोड, कोई हेडलेस ब्राउज़र नहीं। स्रोत: एलएमस्टूडियो-प्लगइन/.

जब WebBrain एक पेज पर काम कर रहा हो तो क्या मैं दूसरे टैब पर स्विच कर सकता हूँ?

हां, Chrome पर - एजेंट बैकग्राउंड सर्विस वर्कर में चलता है और उस टैब से जुड़ा होता है जिस पर उसने शुरुआत की थी, इसलिए जब आप फोकस कहीं और ले जाते हैं तब भी यह उस विशिष्ट टैब पर क्लिक, टाइप और पढ़ता रहता है। उपकरण जो एक टैब को लक्षित करते हैं (सीडीपी क्लिक, टाइप, नेविगेट, स्क्रीनशॉट) सभी Chrome में पृष्ठभूमि वाले टैब पर काम करते हैं। किसी कार्य के चलने के दौरान साइडबार इनपुट को लॉक कर देता है ताकि आप गलती से नए टैब पर दूसरा कार्य शुरू न कर सकें - आपको वर्तमान वाले को प्रतीक्षा करने या रोकने की आवश्यकता होगी। ध्यान दें कि ब्राउज़र पृष्ठभूमि टैब पर टाइमर और एनिमेशन को दबा देते हैं, इसलिए भारी एनिमेटेड साइटें थोड़ी धीमी प्रतिक्रिया दे सकती हैं।

Firefox पर, एजेंट अपने मूल टैब पर भी चलता रहेगा, लेकिन ऑटो-स्क्रीनशॉट सीमित हैं: Firefox का स्क्रीनशॉट एपीआई केवल वर्तमान सक्रिय टैब को कैप्चर कर सकता है, पृष्ठभूमि में किसी विशिष्ट टैब को नहीं। WebBrain इसका पता लगाता है और मॉडल को एक असंबंधित पृष्ठ की छवि खिलाने के बजाय उस मोड़ के लिए स्क्रीनशॉट को छोड़ देता है। जब तक आप उसके टैब पर वापस नहीं जाते, एजेंट टेक्स्ट-आधारित संदर्भ से योजना बनाना जारी रखेगा।

जिस टैब पर एजेंट काम कर रहा है, उसी टैब पर सक्रिय रूप से क्लिक करने या टाइप करने से बचें - इससे दौड़ की स्थितियाँ बनती हैं जहाँ आप और एजेंट एक ही पृष्ठ पर लड़ते हैं। टैब स्विच करना ठीक है; एक ही टैब का सह-ड्राइविंग नहीं है।

प्रोफ़ाइल स्वतः-भरण कैसे काम करता है, और क्या यह सुरक्षित है?

प्रोफ़ाइल स्वतः-भरण एक वैकल्पिक सुविधा है सेटिंग्स → प्रोफ़ाइल. आप एक संक्षिप्त जीवनी दर्ज करें - नाम, कार्य ईमेल, कंपनी, और ए फेंकना कम जोखिम वाले साइनअप के लिए पासवर्ड - और इसे चालू करें। सक्षम होने पर, WebBrain उस टेक्स्ट को एजेंट के सिस्टम प्रॉम्प्ट में जोड़ देता है ताकि वह हर बार बिना पूछे साइनअप फॉर्म भर सके।

पाठ संग्रहीत है सादे पाठ में आपके ब्राउज़र के स्थानीय संग्रहण में. यह है नहीं WebBrain प्रोजेक्ट को प्रेषित, लेकिन यह है सिस्टम प्रॉम्प्ट के भाग के रूप में, प्रत्येक मोड़ पर आपके द्वारा कॉन्फ़िगर किए गए किसी भी एलएलएम प्रदाता को भेजा जाता है। डिफ़ॉल्ट रूप से बंद.

महत्वपूर्ण खातों के लिए पासवर्ड न रखें (Google, Apple, iCloud, बैंकिंग, कार्य SSO, प्राथमिक ईमेल) यहां। उन खातों को 2FA का उपयोग करना चाहिए और किसी भी तरह से किसी एजेंट को नहीं सौंपा जाना चाहिए। न्यूज़लेटर साइनअप और निःशुल्क परीक्षणों के लिए आपके द्वारा पुन: उपयोग किया जाने वाला एक थ्रोअवे पासवर्ड इच्छित उपयोग का मामला है।

क्या स्क्रीनशॉट रिडक्शन सेटिंग यह गारंटी देती है कि मेरा निजी डेटा कभी भी क्लाउड विज़न मॉडल तक नहीं पहुंचेगा?

नहीं - यह जोखिम को कम करता है, इसकी कोई गारंटी नहीं है। सक्षम होने पर (सेटिंग्स → मल्टीमॉडल → स्क्रीनशॉट रिडक्शन, डिफ़ॉल्ट रूप से बंद), WebBrain फॉर्म फ़ील्ड और टेक्स्ट को पिक्सेलित करता है जो प्रत्येक स्क्रीनशॉट पर एक ईमेल पते या फोन नंबर की तरह दिखता है पहले इसे एक विज़न मॉडल में भेजा जाता है। DOM हेयुरिस्टिक्स का उपयोग करके डिटेक्शन पूरी तरह से आपके डिवाइस पर चलता है; कुछ भी अतिरिक्त प्रसारित नहीं होता है.

यह सर्वोत्तम-प्रयास और असफलता-रहित है। यदि डिटेक्टर किसी पृष्ठ पर नहीं चल सकता है - उदाहरण के लिए नेविगेशन के तुरंत बाद, पीडीएफ दर्शकों पर, या प्रतिबंधित ब्राउज़र पृष्ठों पर - स्क्रीनशॉट अभी भी भेजा जाता है अप्रकाशित अपने कार्य को निरस्त करने के बजाय। वह सामग्री जिसे DOM अनुमान नहीं देख सकता (कैनवास पर खींचा गया पाठ, छवियों के अंदर PII, असामान्य विजेट) भी फिसल सकता है। और सेटिंग केवल स्क्रीनशॉट को कवर करती है: पेज पाठ मॉडल को भेजा गया इसके द्वारा संशोधित नहीं किया गया है।

पूर्ण दृष्टि गोपनीयता के लिए, स्थानीय मॉडल का उपयोग करें। llama.cpp या Ollama जैसे ऑफ़लाइन प्रदाता के साथ, स्क्रीनशॉट और पेज टेक्स्ट आपकी मशीन को कभी नहीं छोड़ते हैं, इसलिए पहली बार में रिडक्ट करने के लिए कुछ भी नहीं है - यह एकमात्र कॉन्फ़िगरेशन है जहां गोपनीयता की गारंटी है। देखें "क्या मैं WebBrain का पूरी तरह ऑफ़लाइन उपयोग कर सकता हूँ?" ऊपर।

क्या आपके पास ऐसी मशीन नहीं है जो दृष्टि-सक्षम स्थानीय मॉडल चला सके? एक अच्छा मध्य मार्ग नियोजन और टूल कॉल के लिए एक छोटा स्थानीय मॉडल है (एक मामूली सीपीयू/जीपीयू के लिए पर्याप्त तेज़ और हल्का) जिसे विज़न उप-कॉल के लिए क्लाउड प्रदाता के साथ जोड़ा जाता है, जिसमें स्क्रीनशॉट रिडक्शन चालू होता है। आप अभी भी अपनी बातचीत और पेज टेक्स्ट को डिवाइस पर रखते हैं, और क्लाउड विज़न के लिए छोड़े जाने वाले प्रत्येक स्क्रीनशॉट में फॉर्म फ़ील्ड और पहचाने गए ईमेल/फ़ोन पहले धुंधले होते हैं - पूर्ण स्थानीय विज़न मॉडल के लिए हार्डवेयर की आवश्यकता के बिना क्लाउड एक्सपोज़र कम हो जाता है। विज़न स्प्लिट को नीचे कॉन्फ़िगर करें सेटिंग्स → विजन (ऊपर देखें "WebBrain क्लाउड एलएलएम बिलों को कैसे नियंत्रण में रखता है?")।

WebBrain कुकी बैनर और पेवॉल के साथ क्या करता है?

कुकी बैनर: WebBrain सामान्य फ्रेमवर्क (वनट्रस्ट, कुकीबॉट, डिडोमी, क्वांटकास्ट, गूगल फंडिंग चॉइस, ट्रस्टआर्क) से सहमति बैनर को पहचानता है और पेज के बारे में तर्क करने से पहले उन्हें खारिज कर देता है। प्राथमिकता "सभी को अस्वीकार करें" / "गैर-आवश्यक को अस्वीकार करें" / "केवल आवश्यक" है जब स्पष्ट रूप से दिखाई दे; यह "वरीयताएँ प्रबंधित करें" भूलभुलैया में गायब होने के बजाय "सभी को स्वीकार करें" पर वापस आ जाता है।

भुगतान: WebBrain पेवॉल की ईमानदारी से रिपोर्ट करता है और आपको बताता है कि यह वास्तव में क्या देख सकता है (हेडलाइन, डेक, पहला पैराग्राफ)। यह होता है नहीं पेवॉल्स को बायपास करने का प्रयास - कोई Archive.today, 12ft.io, कुकी क्लियरिंग, JS अक्षम करना, या रीडर-मोड ट्रिक्स नहीं। यदि आप पूरा लेख चाहते हैं, तो सदस्यता के साथ लॉग इन करें या उसी कहानी की मुफ्त कवरेज देखने के लिए WebBrain से पूछें।

क्या WebBrain ड्राई-रन मोड का समर्थन करता है?

के रूप में 7.0.0, अभी तक नहीं. ड्राई-रन मोड की योजना बनाई गई है और पहले से ही रोडमैप पर है।

WebBrain क्लाउड एलएलएम बिलों को कैसे नियंत्रण में रखता है?

तीन स्वतंत्र परतें:

टोकन-सचेत स्क्रीनशॉट। इससे पहले कि कोई छवि आपकी मशीन से बाहर जाए, WebBrain उसका आकार बदलता है (छोटा साइड कैप्ड, पहलू अनुपात को संरक्षित करता है) और इसे पुनरावृत्त रूप से JPEG-संपीड़ित करता है जब तक कि यह प्रति-मोड़ छवि-टोकन बजट में फिट न हो जाए। एक 2000×1200 स्क्रीनशॉट जिसकी कीमत आपको GPT-4o पर ~1,500 इनपुट टोकन होगी, पेज-रीडिंग कार्यों के लिए कोई व्यावहारिक हानि के बिना ~300-500 टोकन तक संपीड़ित हो जाता है। में क्रियान्वित किया गया _fitImageDimensions बजट गणित के लिए इकाई परीक्षणों के साथ।

स्मार्ट संदर्भ ट्रिमिंग. वार्तालाप इतिहास, टूल आउटपुट और इनलाइन DOM डंप को प्रति मोड़ पर सीमित किया जाता है और सक्रिय मॉडल की संदर्भ विंडो पूर्ण होने पर सबसे पहले छंटनी की जाती है। आप 10k टोकन से 100k तक चुपचाप चलने वाला गुब्बारा नहीं देखेंगे क्योंकि a read_page एक उपन्यास-लंबा लेख लौटाया।

समर्पित विज़न मॉडल. योजना और टूल कॉल के लिए एक सस्ते टेक्स्ट मॉडल (जैसे GPT-4o-मिनी) को केवल स्क्रीनशॉट के लिए एक अलग विज़न-सक्षम मॉडल (जैसे GPT-4o) के साथ जोड़ें, ताकि आपको हर एक मोड़ पर मल्टीमॉडल-मॉडल कीमतों का भुगतान न करना पड़े। के अंतर्गत कॉन्फ़िगर करें सेटिंग्स → विजन.

शुद्ध परिणाम: क्लाउड प्रदाताओं के साथ लंबे सत्र पूर्वानुमानित रहते हैं। पूर्ण नियंत्रण के लिए, स्थानीय रूप से llama.cpp का उपयोग करें - शून्य प्रति टोकन लागत।

क्या मैं WebBrain में योगदान कर सकता हूँ?

बिल्कुल! WebBrain MIT-लाइसेंस प्राप्त है और योगदान का स्वागत करता है। की जाँच करें GitHub भंडार मुद्दों, सुविधा अनुरोधों और योगदान दिशानिर्देशों के लिए।

बात फैलाओ, प्यार बांटो

WebBrain MIT-लाइसेंस प्राप्त है और पूरी तरह से आपके ब्राउज़र में चलता है। यदि यह उपयोगी है, तो हमें एक स्टार दें या इसे साझा करें - इसी तरह स्वतंत्र ओपन-सोर्स प्रोजेक्ट मिलते हैं।